一本厚书被推进液压切纸机,,,,压板落下,,,,刀片切下,,,,书脊被爽性利落地削掉。。原本毗连在一起的书页酿成整齐的一沓纸张。。
若是没有任何诠释,,,,看到这样一段视频,,,,你甚至可能会以为“引起恬静”、很是解压。。
可若是告诉你,,,,AI公司正在用这套步伐成批处理纸质书,,,,其中还可能包括冷门书和绝版书,,,,相信你八成绩惬意不起来了。。
为了寻找更多训练数据,,,,AI公司已经从果真互联网、盗版电子书,,,,一起找到了现实天下里的纸质书。。其中,,,,2022年以前出书的书由于没有混入AI天生内容,,,,也没有经由现代数据投毒工具处理,,,,成了难堪的“上品”。。
那些网上搜不到、没有电子版的冷门书和绝版书,,,,能够提供互联网抓取不到的内容,,,,更是“上上品”。。
Anthropic被曝光的“巴拿马妄想”中明确说不希望外界知道。。
图书数据库公司ISBNdb果真宣称,,,,可以接活儿给AI公司找书,,,,能从旧书店、图书馆和绝版书目录中,,,,一次采购1000至100万本纸质书,,,,还会通过保密协议藏住买家身份和采购书目。。
AI公司也知道这事儿“欠悦目”。。
“巴拿马妄想”
AI公司最先盯上纸质书,,,,最早是从Anthropic惹上的一场讼事里露出眉目的。。
2024年8月,,,,三名作家把Anthropic告上法庭,,,,指控它未经授权,,,,用他们的作品训练Claude。。
说真话,,,,这类争议着实从OpenAI搞出个ChatGPT最先就没停过,,,,一点也不新鲜,,,,类似的讼事也已经有不少。。
争议在于AI公司把整个人类互联网抓去训练模子,,,,究竟算不算侵权??作者的书进了训练集,,,,要不要经由自己赞成、支付版权费??
以是在这场讼事里,,,,纸质书一最先压根不是主角。。
为了让Claude明确更多、写得更好,,,,Anthropic先把果真互联网扫了一遍。。但网页里的内容良莠不齐,,,,因此经由作者写作、编辑筛选和出书社校对的书籍被盯上了。。
最利便的步伐,,,,虽然是直接找电子书。。
法庭质料显示,,,,Anthropic曾从Books3、LibGen和PiLiMi等资源库下载凌驾700万本书。。这内里相当一部分来自盗版网站。。公司并没有用完就删,,,,而是把这些文件存进一个恒久保存的“中央图书馆”,,,,准备供未来的模子训练和研究继续使用。。
随后,,,,一个内部代号为“巴拿马妄想”的工程启动了。。这个妄想简朴来说就是Anthropic大规模购置纸质书、扫描并喂养AI。。
不过在其时,,,,法庭真正体贴的是Anthropic获得和使用这些内容的方式是否正当。。
2025年6月,,,,法官威廉·阿尔萨普给出了一套对Anthropic相当有利的判断。。
在他看来,,,,大模子读取一本书,,,,并不是为了向用户复述或出售这本书,,,,而是从中学习语言、知识和表达方式,,,,再天生新的内容。。这种用途具有很强的“转化性”,,,,和人读过一本书之后获得知识、再去创作有些类似,,,,因此可以以为在合理使用的规模内。。
至于那些买来的纸质书,,,,Anthropic已经为每一本付过钱。。公司扫描一本,,,,就销毁对应的实体书,,,,只在内部留下一个数字替换品,,,,没有多制造一份拿到市场上出售的副本。。法官因此以为,,,,这部分也没有侵占版权。。
可是那700多万本从盗版资源库下载的电子书就说不过去了。。
法官以为,,,,训练模子可能属于合理使用,,,,却不可反过来证实盗版获取也是正当的。。你怎么用书是一回事,,,,这本书怎么到你手里,,,,是另一回事。。
在美国执法系统中,,,,判例的作用是重大的,,,,这位法官的判例为AI公司开了一条路,,,,那就是AI公司可以学习人类写下的作品,,,,条件是先用正当方式把作品弄到手。。
以是可以看到,,,,在去年的Anthropic讼事里,,,,虽然其购置纸质书并扫描的做法已经公之于众,,,,可是法庭及公共的关注点照旧更多在老生常谈的“用人类知识训练AI的执法界线”上。。
直到今年,,,,两篇报道接连泛起,,,,各人才突然意识到问题的严肃性。。
绝版纸质书永远消逝??
今年1月,,,,《华盛顿邮报》从4000多页刚刚解封的法庭质料中,,,,挖出了“巴拿马妄想”的更多细节。。
Anthropic在一年左右的时间里破费数万万美元,,,,买下数百万本纸质书。。供应商切掉书脊,,,,将散开的书页送进高速扫描仪,,,,最后再把剩下的纸张交给接纳公司。。仅一份项目方案,,,,就妄想在半年内处理50万至200万本书。。
规模已经足够惊人,,,,Anthropic内部文件里的两句话更要命:
“巴拿马妄想,,,,是我们对全天下所有书籍举行破损性扫描的行动。。”
“我们不希望外界知道我们正在做这件事。。”
这两句话放在一起,,,,整件事就很难看了。。
Anthropic向来强调AI清静、品德和责任,,,,效果却在背地里启动了一项毁掉数百万本书的神秘工程。。
切书原本还可以诠释为一种追求效率的扫描方式,,,,“不希望外界知道”则让人很难不嫌疑:Anthropic自己也清晰,,,,这件事一旦果真,,,,绝对说不过去。。
Anthropic究竟偷偷毁了几多书??
《华盛顿邮报》没有拿到完整书目,,,,外界也不知道这些书里有几多是随处可见的脱销书,,,,几多已经阻止再版。。人们震惊于工业化切书的规模,,,,还很难判断它事实造成了什么详细损失。。
半年后,,,,404 Media的一篇报道,,,,把担心聚焦到了绝版书身上。。
报道的主角叫ISBNdb,,,,一家号称拥有全球最大图书数据库的公司。。它在官网上向AI客户果真兜售纸质书采购服务,,,,宣称一次可以采购1000至100万本书,,,,货源笼罩旧书店、图书馆和绝版书目录。。
公司甚至把保密写成了卖点:每个项目都会签署严酷的保密协议,,,,客户身份、采购战略和目的书目一概不会披露。。
更讥笑的是,,,,ISBNdb自己也知道这学生意见不得光。。它在宣传中直接提醒客户:“AI公司毁掉200万本书”,,,,可不是什么能赢得同情的新闻问题。。
尚有一点很有意思,,,,AI公司最近尤其喜欢2022年以前出书的纸质书。。
原因很简朴:天生式AI爆发以后,,,,网上混入了大宗AI天生内容,,,,尚有人居心使用数据投毒工具滋扰模子训练。。相比之下,,,,2022年以前出书的纸质书险些可以确定由人类写作,,,,经由编辑、校对和出书流程,,,,也没有被现代投毒工具处理过。。
AI公司亲手制造了越来越多的网络垃圾,,,,最后又转头寻找没有被AI污染过的旧书。。
这股需求已经传到了二手书市场。。一名专营有数和低流通量图书的书商告诉404 Media,,,,从今年4月最先,,,,他每周处理的订单从20本左右猛增到数百本。。被买走的书主题杂乱、语言差别,,,,相互险些没有联系,,,,唯一的配合点是都有ISBN编号。。
这名书商无法确认买家就是AI公司,,,,但他的库存中有不少外文书、冷门书和绝版书。。
他一方面靠这些订单清掉了多年卖不出去的库存,,,,另一方面又很不惬意:“我不喜欢这些书最后的用途,,,,也不喜欢那些不常见的书被打成纸浆。。”正如前文所说,,,,AI公司扫描纸质书的流程是很粗暴的,,,,这让生意变好的二手书商也忍不住心疼。。
从互联网到盗版电子书,,,,再到可以批量买来的纸质书,,,,AI公司一直在寻找训练资源的触角向外延伸。。现在,,,,冷门书籍以致绝版书也难以幸免。。
绝版不即是孤本。。现在也没有证据证实,,,,某本书在天下上的最后一册已经被AI公司销毁。。
外界看不到采购清单,,,,不知道哪些公司正在买书,,,,更不知道书被送进切割机以前,,,,有没有人检查过它还剩几多册。。
但风险是显而易见的。。
极其有限的退让
2025年的判例(至少在美国规模)已经给了Anthropic一定的执法保唬;;。。
法官以为Anthropic正当买下一本纸质书,,,,将它扫描成数字文件,,,,再销毁纸质原本,,,,最终仍然只有一份副本。。数字文件没有对外出售,,,,也没有增添市场上的流通数目,,,,相当于用一种名堂替换另一种名堂,,,,因此可以组成合理使用。。
凭证这套逻辑,,,,切书甚至成了证实正当的一环。。原书继续留在市场上,,,,Anthropic手里又多出一份数字版,,,,便可能涉及未经授权的复制;;;;把纸质书销毁,,,,只保存数字文件,,,,执法风险反而更低。。
康奈尔科技学院数字与信息法教授James Grimmelmann就以为,,,,Anthropic放弃盗版书库,,,,转而购置、扫描纸质书,,,,是一个“智慧的选择”,,,,也体现了越发榨取、切合执法的做法。。
毁掉纸质书这种事,,,,关于一本印了几十万册的脱销书来说问题没有那么尖锐,,,,少一册并不会影响其他人继续阅读和购置。。
但冷门书、绝版书和带有特殊历史痕迹的版本,,,,显然不可这样盘算。。
澳大利亚和新西兰古旧书商协会主席Dawn Albinger指出,,,,古旧书的价值并不但在印刷出来的正文。。书页上可能有亲历者留下的批注,,,,署名、题赠和历任珍藏者的信息可以证实它的撒播履历,,,,重新装订的封皮里甚至可能藏着更早的手稿。。
这些信息都依附于那一本详细的书。。纵然书页上的文字已经完成扫描,,,,原来的纸张、装帧和各部分之间的关系一旦被破损,,,,后人也无法重新检查。。
也就是说,,,,AI公司获得了一份适合训练模子的数字文件,,,,却可能毁掉了一件无法通过数字文件完整还原的实物。。
争议扩大后,,,,科技行业很快泛起了退让。。
马斯克在X上体现,,,,已经要求SpaceXAI团队将有数书籍生涯在图书馆,,,,并接纳更贫困的无损方式扫描,,,,不可简朴切掉书脊。。他没有宣布SpaceXAI买了几多书,,,,也没有诠释什么样的书会被归为“有数”,,,,这次回应更像是一种态度上的站队。。
ISBNdb退让得更快。。
404 Media报道宣布9天后,,,,ISBNdb删除了面向AI公司的纸质书采购页面,,,,撤下有关保密采购和破损性扫描的宣传。。公司随后改口称,,,,相关页面只是一次市场需求测试,,,,服务从未真正上线,,,,ISBNdb也从未为AI训练购置、扫描或者出售过任何一本书。。
此前还在宣传一次采购100万本书,,,,遭遇舆论反弹后,,,,整学生意突然酿成了“一次测试”。。
这番诠释能否令人信服是一回事,,,,它至少说明,,,,匿名资助AI公司大批量采购纸质书,,,,已经成了一项企业不肯肩负的声誉风险。。
不过,,,,马斯克的一句允许和ISBNdb删除几个网页,,,,都取代不了真正的规则。。
谁认真在扫描前判断一本书是否有数??判断依据是出书年份、版本和存世数目,,,,照旧书里的署名、批注和装。??AI公司是否应该果真大规模采购的书目??若是某本书已经绝版,,,,是否只能接纳无损扫描,,,,并在扫描后交给图书馆生涯??
现在,,,,这些问题都没有谜底。。
讥笑的是,,,,ISBNdb此前重复强调,,,,2022年以前的纸质书之以是珍贵,,,,正是由于它们生涯了没有受到AI污染、经由作者写作和编辑筛选的人类知识。。AI公司越认可这些内容不可替换,,,,就越难明释为什么承载它们的实体可以被当成一次性耗材。。