IT之家 8 月 2 日新闻,,,,,,本周,,,,,,一则关于大宗珍贵图书被集中破损、仅为训练大语言模子(LLM)提供数据的新闻,,,,,,引发了念书喜欢者和通俗网友的普遍关注。。。。
新闻称,,,,,,一些图书供应商近期收到了数目异常重大的图书订单。。。。业内人士推测,,,,,,AI 公司希望获得质量更高、更清洁的训练数据,,,,,,同时尽可能规避版权风险。。。。而这场争议的焦点,,,,,,则指向了图书数据库网站 ISBNdb。。。。外界以为,,,,,,该网站不但勉励这种做法,,,,,,甚至还为 AI 公司与图书供应商之间牵线搭桥。。。。随着舆论迅速发酵,,,,,,ISBNdb 最先试图与这场争议划清界线,,,,,,并删除了自己此前宣布的相关内容。。。。
ISBNdb 在最新声明中体现:“我们已经注重到近期关于网站上一则营销落地页的报道,,,,,,也明确它所引发的担心。。。。我们并不训练 AI 模子,,,,,,也从未从事过相关营业。。。。谁人页面只是一次市场需求测试,,,,,,相关服务从未真正上线,,,,,,现在我们已经将页面删除。。。。”
几天前,,,,,,404 Media 报道称,,,,,,多家图书供应商突然接到大宗图书采购订单。。。。由于学校和图书馆近年来预算主要、采购需求下降,,,,,,不少供应商谋划压力较大,,,,,,因此更容易接受这类大额订单。。。。
其时外界普遍嫌疑幕后买家是 AI 公司,,,,,,而 ISBNdb 则成为舆论焦点,,,,,,由于它曾推出一项服务,,,,,,似乎专门资助 AI 企业与图书仓储机构建设联系。。。。
现在已经删除的宣传页面上曾写道:“天下上最优质的 AI 训练数据,,,,,,就摆放在书架上。。。。图书承载着经由筛选、偕行评审和专业领域沉淀的人类知识,,,,,,其结构化水平是任何网络爬虫都无法复制的,,,,,,内容麋集、经由编辑且具有权威性。。。。”
事实上,,,,,,这一做法并非首次曝光。。。。早在今年 1 月,,,,,,一份果真的法庭文件就披露了 Anthropic 内部代号为“Project Panama(巴拿马妄想)”的项目。。。。该项目旨在尽可能购置大宗图书,,,,,,完成数字化扫描后再将实体书销毁。。。。
Anthropic 以后与作者告竣了一项总额 15 亿美元(IT之家注:现汇率约合 101.47 亿元人民币)的息争协议。。。。不过,,,,,,随效果真的法庭文件显示,,,,,,这种做法自己被以为是正当的,,,,,,真正让公司担心的是由此带来的负面舆论。。。。因此,,,,,,Anthropic 愿意支付高额价钱,,,,,,以阻止相关做法被曝光。。。。
现在,,,,,,这一内幕已经果真,,,,,,因此近期泛起的大宗珍贵图书采购订单也受到了更严酷的关注。。。。
一位匿名图书卖家在接受 404 Media 采访时体现:“这么做既能帮我整理那些原来就很难卖出去的库存,,,,,,也能让我赚到钱。。。。但另一方面,,,,,,我并不喜欢这些图书最终的用途,,,,,,也不肯意看到一些有数图书被直接打成纸浆。。。。”
报道称,,,,,,随着 AI 公司越来越难获得“清洁”的训练数据,,,,,,它们正在寻找新的数据泉源。。。。
互联网上大宗低质量内容,,,,,,以及越来越多由 AI 自己天生的内容,,,,,,都可能导致模子训练泛起“负反馈循环”问题。。。。因此,,,,,,各家公司希望获取质量更高的数据,,,,,,同时又只管阻止引发外界关注。。。。
今年炎天,,,,,,影戏公司 A24 就宣布与谷歌告竣相助,,,,,,为 DeepMind 提供逊ж材,,,,,,希望资助其媒体天生模子挣脱大宗质量差劲、气概杂乱的 AI 内容。。。。
至于为何要销毁实体书,,,,,,报道以为,,,,,,这并不是为了掩饰痕迹,,,,,,也不是出于珍藏有数知识的目的。。。。
虽然“巴拿马妄想”的相关文件并未说明销毁图书的详细原因,,,,,,但最可能的诠释仍然是为了降低本钱。。。。现实上,,,,,,图书数字化扫描并纷歧定需要破损原书,,,,,,但若是整个流程追求低本钱、高效率,,,,,,就很可能直接拆掉书脊,,,,,,以获得更平整、更清晰的扫描效果,,,,,,随后再将已经损坏的书籍看成废纸处理。。。。