一本厚书被推进液压切纸机,,,,,压板落下,,,,,刀片切下,,,,,书脊被爽性利落地削掉。。。。。原本毗连在一起的书页酿成整齐的一沓纸张。。。。。
若是没有任何诠释,,,,,看到这样一段视频,,,,,你甚至可能会以为“引起恬静”、很是解压。。。。。
可若是告诉你,,,,,AI公司正在用这套步伐成批处理纸质书,,,,,其中还可能包括冷门书和绝版书,,,,,相信你八成绩惬意不起来了。。。。。
为了寻找更多训练数据,,,,,AI公司已经从果真互联网、盗版电子书,,,,,一起找到了现实天下里的纸质书。。。。。其中,,,,,2022年以前出书的书由于没有混入AI天生内容,,,,,也没有经由现代数据投毒工具处理,,,,,成了难堪的“上品”。。。。。
那些网上搜不到、没有电子版的冷门书和绝版书,,,,,能够提供互联网抓取不到的内容,,,,,更是“上上品”。。。。。
Anthropic被曝光的“巴拿马妄想”中明确说不希望外界知道。。。。。
图书数据库公司ISBNdb果真宣称,,,,,可以接活儿给AI公司找书,,,,,能从旧书店、图书馆和绝版书目录中,,,,,一次采购1000至100万本纸质书,,,,,还会通过保密协议藏住买家身份和采购书目。。。。。
AI公司也知道这事儿“欠悦目”。。。。。
“巴拿马妄想”
AI公司最先盯上纸质书,,,,,最早是从Anthropic惹上的一场讼事里露出眉目的。。。。。
2024年8月,,,,,三名作家把Anthropic告上法庭,,,,,指控它未经授权,,,,,用他们的作品训练Claude。。。。。
说真话,,,,,这类争议着实从OpenAI搞出个ChatGPT最先就没停过,,,,,一点也不新鲜,,,,,类似的讼事也已经有不少。。。。。
争议在于AI公司把整个人类互联网抓去训练模子,,,,,究竟算不算侵权?????作者的书进了训练集,,,,,要不要经由自己赞成、支付版权费?????
以是在这场讼事里,,,,,纸质书一最先压根不是主角。。。。。
为了让Claude明确更多、写得更好,,,,,Anthropic先把果真互联网扫了一遍。。。。。但网页里的内容良莠不齐,,,,,因此经由作者写作、编辑筛选和出书社校对的书籍被盯上了。。。。。
最利便的步伐,,,,,虽然是直接找电子书。。。。。
法庭质料显示,,,,,Anthropic曾从Books3、LibGen和PiLiMi等资源库下载凌驾700万本书。。。。。这内里相当一部分来自盗版网站。。。。。公司并没有用完就删,,,,,而是把这些文件存进一个恒久保存的“中央图书馆”,,,,,准备供未来的模子训练和研究继续使用。。。。。
随后,,,,,一个内部代号为“巴拿马妄想”的工程启动了。。。。。这个妄想简朴来说就是Anthropic大规模购置纸质书、扫描并喂养AI。。。。。
不过在其时,,,,,法庭真正体贴的是Anthropic获得和使用这些内容的方式是否正当。。。。。
2025年6月,,,,,法官威廉·阿尔萨普给出了一套对Anthropic相当有利的判断。。。。。
在他看来,,,,,大模子读取一本书,,,,,并不是为了向用户复述或出售这本书,,,,,而是从中学习语言、知识和表达方式,,,,,再天生新的内容。。。。。这种用途具有很强的“转化性”,,,,,和人读过一本书之后获得知识、再去创作有些类似,,,,,因此可以以为在合理使用的规模内。。。。。
至于那些买来的纸质书,,,,,Anthropic已经为每一本付过钱。。。。。公司扫描一本,,,,,就销毁对应的实体书,,,,,只在内部留下一个数字替换品,,,,,没有多制造一份拿到市场上出售的副本。。。。。法官因此以为,,,,,这部分也没有侵占版权。。。。。
可是那700多万本从盗版资源库下载的电子书就说不过去了。。。。。
法官以为,,,,,训练模子可能属于合理使用,,,,,却不可反过来证实盗版获取也是正当的。。。。。你怎么用书是一回事,,,,,这本书怎么到你手里,,,,,是另一回事。。。。。
在美国执法系统中,,,,,判例的作用是重大的,,,,,这位法官的判例为AI公司开了一条路,,,,,那就是AI公司可以学习人类写下的作品,,,,,条件是先用正当方式把作品弄到手。。。。。
以是可以看到,,,,,在去年的Anthropic讼事里,,,,,虽然其购置纸质书并扫描的做法已经公之于众,,,,,可是法庭及公共的关注点照旧更多在老生常谈的“用人类知识训练AI的执法界线”上。。。。。
直到今年,,,,,两篇报道接连泛起,,,,,各人才突然意识到问题的严肃性。。。。。
绝版纸质书永远消逝?????
今年1月,,,,,《华盛顿邮报》从4000多页刚刚解封的法庭质料中,,,,,挖出了“巴拿马妄想”的更多细节。。。。。
Anthropic在一年左右的时间里破费数万万美元,,,,,买下数百万本纸质书。。。。。供应商切掉书脊,,,,,将散开的书页送进高速扫描仪,,,,,最后再把剩下的纸张交给接纳公司。。。。。仅一份项目方案,,,,,就妄想在半年内处理50万至200万本书。。。。。
规模已经足够惊人,,,,,Anthropic内部文件里的两句话更要命:
“巴拿马妄想,,,,,是我们对全天下所有书籍举行破损性扫描的行动。。。。。”
“我们不希望外界知道我们正在做这件事。。。。。”
这两句话放在一起,,,,,整件事就很难看了。。。。。
Anthropic向来强调AI清静、品德和责任,,,,,效果却在背地里启动了一项毁掉数百万本书的神秘工程。。。。。
切书原本还可以诠释为一种追求效率的扫描方式,,,,,“不希望外界知道”则让人很难不嫌疑:Anthropic自己也清晰,,,,,这件事一旦果真,,,,,绝对说不过去。。。。。
Anthropic究竟偷偷毁了几多书?????
《华盛顿邮报》没有拿到完整书目,,,,,外界也不知道这些书里有几多是随处可见的脱销书,,,,,几多已经阻止再版。。。。。人们震惊于工业化切书的规模,,,,,还很难判断它事实造成了什么详细损失。。。。。
半年后,,,,,404 Media的一篇报道,,,,,把担心聚焦到了绝版书身上。。。。。
报道的主角叫ISBNdb,,,,,一家号称拥有全球最大图书数据库的公司。。。。。它在官网上向AI客户果真兜售纸质书采购服务,,,,,宣称一次可以采购1000至100万本书,,,,,货源笼罩旧书店、图书馆和绝版书目录。。。。。
公司甚至把保密写成了卖点:每个项目都会签署严酷的保密协议,,,,,客户身份、采购战略和目的书目一概不会披露。。。。。
更讥笑的是,,,,,ISBNdb自己也知道这学生意见不得光。。。。。它在宣传中直接提醒客户:“AI公司毁掉200万本书”,,,,,可不是什么能赢得同情的新闻问题。。。。。
尚有一点很有意思,,,,,AI公司最近尤其喜欢2022年以前出书的纸质书。。。。。
原因很简朴:天生式AI爆发以后,,,,,网上混入了大宗AI天生内容,,,,,尚有人居心使用数据投毒工具滋扰模子训练。。。。。相比之下,,,,,2022年以前出书的纸质书险些可以确定由人类写作,,,,,经由编辑、校对和出书流程,,,,,也没有被现代投毒工具处理过。。。。。
AI公司亲手制造了越来越多的网络垃圾,,,,,最后又转头寻找没有被AI污染过的旧书。。。。。
这股需求已经传到了二手书市场。。。。。一名专营有数和低流通量图书的书商告诉404 Media,,,,,从今年4月最先,,,,,他每周处理的订单从20本左右猛增到数百本。。。。。被买走的书主题杂乱、语言差别,,,,,相互险些没有联系,,,,,唯一的配合点是都有ISBN编号。。。。。
这名书商无法确认买家就是AI公司,,,,,但他的库存中有不少外文书、冷门书和绝版书。。。。。
他一方面靠这些订单清掉了多年卖不出去的库存,,,,,另一方面又很不惬意:“我不喜欢这些书最后的用途,,,,,也不喜欢那些不常见的书被打成纸浆。。。。。”正如前文所说,,,,,AI公司扫描纸质书的流程是很粗暴的,,,,,这让生意变好的二手书商也忍不住心疼。。。。。
从互联网到盗版电子书,,,,,再到可以批量买来的纸质书,,,,,AI公司一直在寻找训练资源的触角向外延伸。。。。。现在,,,,,冷门书籍以致绝版书也难以幸免。。。。。
绝版不即是孤本。。。。。现在也没有证据证实,,,,,某本书在天下上的最后一册已经被AI公司销毁。。。。。
外界看不到采购清单,,,,,不知道哪些公司正在买书,,,,,更不知道书被送进切割机以前,,,,,有没有人检查过它还剩几多册。。。。。
但风险是显而易见的。。。。。
极其有限的退让
2025年的判例(至少在美国规模)已经给了Anthropic一定的执法;;;;。。。。。
法官以为Anthropic正当买下一本纸质书,,,,,将它扫描成数字文件,,,,,再销毁纸质原本,,,,,最终仍然只有一份副本。。。。。数字文件没有对外出售,,,,,也没有增添市场上的流通数目,,,,,相当于用一种名堂替换另一种名堂,,,,,因此可以组成合理使用。。。。。
凭证这套逻辑,,,,,切书甚至成了证实正当的一环。。。。。原书继续留在市场上,,,,,Anthropic手里又多出一份数字版,,,,,便可能涉及未经授权的复制;;;;把纸质书销毁,,,,,只保存数字文件,,,,,执法风险反而更低。。。。。
康奈尔科技学院数字与信息法教授James Grimmelmann就以为,,,,,Anthropic放弃盗版书库,,,,,转而购置、扫描纸质书,,,,,是一个“智慧的选择”,,,,,也体现了越发榨取、切合执法的做法。。。。。
毁掉纸质书这种事,,,,,关于一本印了几十万册的脱销书来说问题没有那么尖锐,,,,,少一册并不会影响其他人继续阅读和购置。。。。。
但冷门书、绝版书和带有特殊历史痕迹的版本,,,,,显然不可这样盘算。。。。。
澳大利亚和新西兰古旧书商协会主席Dawn Albinger指出,,,,,古旧书的价值并不但在印刷出来的正文。。。。。书页上可能有亲历者留下的批注,,,,,署名、题赠和历任珍藏者的信息可以证实它的撒播履历,,,,,重新装订的封皮里甚至可能藏着更早的手稿。。。。。
这些信息都依附于那一本详细的书。。。。。纵然书页上的文字已经完成扫描,,,,,原来的纸张、装帧和各部分之间的关系一旦被破损,,,,,后人也无法重新检查。。。。。
也就是说,,,,,AI公司获得了一份适合训练模子的数字文件,,,,,却可能毁掉了一件无法通过数字文件完整还原的实物。。。。。
争议扩大后,,,,,科技行业很快泛起了退让。。。。。
马斯克在X上体现,,,,,已经要求SpaceXAI团队将有数书籍生涯在图书馆,,,,,并接纳更贫困的无损方式扫描,,,,,不可简朴切掉书脊。。。。。他没有宣布SpaceXAI买了几多书,,,,,也没有诠释什么样的书会被归为“有数”,,,,,这次回应更像是一种态度上的站队。。。。。
ISBNdb退让得更快。。。。。
404 Media报道宣布9天后,,,,,ISBNdb删除了面向AI公司的纸质书采购页面,,,,,撤下有关保密采购和破损性扫描的宣传。。。。。公司随后改口称,,,,,相关页面只是一次市场需求测试,,,,,服务从未真正上线,,,,,ISBNdb也从未为AI训练购置、扫描或者出售过任何一本书。。。。。
此前还在宣传一次采购100万本书,,,,,遭遇舆论反弹后,,,,,整学生意突然酿成了“一次测试”。。。。。
这番诠释能否令人信服是一回事,,,,,它至少说明,,,,,匿名资助AI公司大批量采购纸质书,,,,,已经成了一项企业不肯肩负的声誉风险。。。。。
不过,,,,,马斯克的一句允许和ISBNdb删除几个网页,,,,,都取代不了真正的规则。。。。。
谁认真在扫描前判断一本书是否有数?????判断依据是出书年份、版本和存世数目,,,,,照旧书里的署名、批注和装。。。。?????AI公司是否应该果真大规模采购的书目?????若是某本书已经绝版,,,,,是否只能接纳无损扫描,,,,,并在扫描后交给图书馆生涯?????
现在,,,,,这些问题都没有谜底。。。。。
讥笑的是,,,,,ISBNdb此前重复强调,,,,,2022年以前的纸质书之以是珍贵,,,,,正是由于它们生涯了没有受到AI污染、经由作者写作和编辑筛选的人类知识。。。。。AI公司越认可这些内容不可替换,,,,,就越难明释为什么承载它们的实体可以被当成一次性耗材。。。。。