2026-08-01 07:10

AI公司抢购2022年前的旧书:机器越会写,人类数据越值钱

author_path 快刀青衣 icon_path
头图

本文来自微信公众号: 快刀青衣 ,作者:快刀青衣


那些有出处且经过判断的真实数据,更值钱。


最近,海外科技媒体404 Media爆出了一件特别有这个时代特点的事情,非常魔幻,我来和你聊一聊。


主角是一家叫ISBNdb的图书数据公司。如果你是纸质书爱好者或者从业者,从这家公司的名字就能猜到它是做什么业务的。因为名字里的ISBN,就是图书的国际标准书号,db一般指数据库。


最近,这家公司开始向AI公司兜售一项新服务。它可以按照书单,从旧书店、图书馆和绝版书目录里批量寻找实体书,一次订单数量可以从1000本到100万本。


这家公司打出来的广告语就是:世界上最好的AI训练数据,正躺在书架上。


对,他们就是专门负责把书架上的实体老书,变成AI公司可以使用的优质数据。他们尤其看重2022年以前出版的书。


听到这里,你可能会觉得有点奇怪。AI不是已经读完了大半个互联网吗?它每天还能自己批量生成海量文章,为什么今天反而要花钱去找一批落满灰尘的旧书?


答案正好藏在「2022年以前」这几个字里。


为什么是2022年前的书


2022年11月,ChatGPT发布。此后,大量AI生成的文章、商品介绍、搜索结果、论文摘要和营销文案开始回灌互联网。


于是,这两年还出现了一个流行词,叫「AI Slop」。翻译过来就非常影响食欲了,叫「AI泔水」。


过去,AI从网上抓到一篇文章,大概率是人在说话。今天,它抓到的很可能是另一个AI根据第三个AI的总结,改写出来的第四手内容。


如果下一代模型不断拿上一代模型的输出训练自己,会发生什么情况?


我和你举个生活化的例子。就像拿一张复印件继续复印,最先丢掉的,往往不是那些最大、最显眼的字,而是那些不常见的细节、少数人的表达和边角上的纹理。


复印的次数越多,最后留下的东西就越模糊,越没有细节。AI研究者把这种风险叫作「模型崩塌」。


不过,这里也要说准确一点,AI生成的数据不是天然有毒。


现在很多模型训练都会主动使用经过筛选的合成数据。只要模型的训练数据中始终保留足够的真实数据,并且有人负责筛选和验证,模型崩塌并不是必然发生的。


但真正麻烦的是,今天的互联网已经很难告诉你,哪一段是人写的,哪一段是AI写的,哪一段又是AI写完之后被人改过的。


这时候,一本2022年以前印出来的书,就变成了一种很特别的东西。它不一定是好书,也不能保证每句话都正确。


但哪怕是一本烂书,这也是一本纯粹由人类写出来的烂书。这批文字在生成式AI大规模爆发以前,就已经被固定在纸上了。


所以,AI公司表面上买的是旧书,但真正要买的是一批有出处、有时间、很难被事后改写的人类文本。


同一本书,两条不同法律路径


这件事还有一个更加反常识的法律案例。


Anthropic,也就是我们都知道的Claude背后的公司,早年曾经从一些电子书盗版网站下载过数百万本电子书。后来,版权风险越来越大,它换了一条完全不同的路。


从2024年开始,Anthropic花费数百万美元,大批量购买实体书,再把书脊切掉,把散开的书页送进高速扫描仪,扫描成数字文件。扫描完成后,纸书被丢弃销毁,电子文件则留在公司内部数据库。


这项行动后来被称为「Project Panama」,翻译过来就是「巴拿马项目」。至于这个名字怎么来的,现在还没有公开解释。


但是它的目标听起来像一句电影台词:破坏性扫描全世界所有的书。


2025年,一名美国联邦法官在图书版权方Bartz诉Anthropic案里,给出一个非常微妙的判断。虽然案件发生在美国,但它讨论的其实是AI时代才会出现的新问题,值得咱们了解一下。


这名法官把Anthropic做过的事拆成了几个部分:


首先,用书中的文字训练模型,在这起案件的具体事实下,被认定属于合理使用。


然后,合法买来的纸书,被一对一转换成公司内部的数字副本;纸书同时被销毁,数字副本也没有对外传播。法官同样认定,这属于合理使用。


但是,从盗版网站直接下载几百万本书,再把它们长期放进自己的中央资料库,这不属于合理使用。


也就是说,同一本书,同样是为了训练AI,从盗版网站下载一份PDF,和先合法买下一本实体书,再把它转换成一个内部数字副本,在这名法官眼里是两件不同的事。


所以,这条路之所以能走通,不是因为「只要花钱买过书,想怎么训练都行」,而是合法购买、一次转换、原件销毁、内部使用和不对外分发几个条件叠在了一起。


说实话,我第一次看到这个项目的时候,作为一个爱书的人,我心里对Anthropic这家公司的厌恶又增加了几分。


但是这两天详细了解了案件背后的这些条件后,我不由得感叹,这家公司太能钻法律的空子了,甚至连钻漏洞的方式都有些精妙。


不过,必须告诉你的是,这可不是全世界通用的法律规则,连美国不同州的法院也不会照搬。这就是一名联邦地区法院法官,在一起具体案件里给出的判断。


15亿美元的和解


Anthropic后来同意拿出15亿美元,解决盗版书库带来的集体诉讼。当地时间2026年7月20日,法院最终批准了这项和解。


注意,这15亿美元是和解,不是法院对「拿书训练AI」开出的一张罚单。


它主要解决的是Anthropic当年从盗版书库获取作品的问题。听起来这个数字很大,但是你想想看,他们可是搞了几百万本盗版书。


如果没用这种方式,他们得一家出版社一家出版社,或者一个作者一个作者地去聊版权,那要等到猴年马月了。


基于这样的背景,咱们似乎也能理解,为什么之前很多版本的Claude模型写出来的文字质感,比其他AI多了不少人味儿。我猜,这估计就和背后这批真实的人类著作训练数据有关。


但这场官司,等于给整个行业画出了一条现实路线:如果直接下载盗版书风险太大,那就去市场上买实体书。


中间商看见了旧书的新生意


ISBNdb这家公司看见的正是这门生意。


它本来就是一个大型图书元数据库,知道一本书的ISBN、版本、出版时间,以及市场上还有哪些库存。而且这家公司已经做了很多年了,并不是AI时代才出现的。


但是现在,它把这种能力重新包装成了AI时代的数据采购服务:需要什么书,它可以帮你找;需要多少本,它可以按工业规模去买;如果客户不想露面,它还可以充当中间人。


有意思的是,404 Media报道之后,ISBNdb又撤下了这项服务的页面,表示这只是一次需求探索,公司已经决定不再往这个方向走。


不过在我看来,这可能就是公关辞令,未来很可能会被包装成更加隐蔽的数据服务。


只要AI公司还需要大量经过人类写作、编辑和出版流程的文本,只要盗版下载的法律风险还在,只要纸书扫描仍然比逐本谈授权更便宜,市场就会继续寻找下一家中间商。


机器越会写,人类数据越值钱


我觉得,这件事最值得关注的,不只是AI公司到底又毁掉了多少本书,更是它暴露了一个特别重要的变化:


AI时代真正稀缺的,可能不再是普通的内容,而是高价值的内容。


过去我们总觉得,数字化解决了知识稀缺的问题,一篇文章可以复制一亿份,一本书可以存进无数台电脑。现在,AI把生成成本又压低了一大截,理论上每天都可以造出无穷无尽的新文字。


可问题是,文字变多,不等于有价值的数据变多。一本旧书真正值钱的地方,不只是里面有几十万个汉字或者英文单词。


更重要的是,不少书在真正出版以前,有人决定这个题目值得写,有人花几年时间搜集材料,有编辑判断哪些内容应该保留,读者又用购买、引用和讨论继续做了一轮筛选。


这套过程当然不完美,也会制造垃圾书。但它至少留下了一套来自真实世界的选择记录。


这也让我想起昨天,我去了纽约大学的图书馆,里面有大量几十年前的藏书。我当时随手翻开一本书,发现是一本1952年的大学一年级物理课本。整本书从字体到配图,都是手写格式的。


那种感觉,就有点像高中老师自己手写了一份测试题,然后再用滚筒一张张印出来,卷子上还散发着油墨香味。论效率,肯定比不上现在的AI出题和打印,但是在这个背后,你能看到一个老师的思考。


我相信,国内外很多大学图书馆里的这类藏书,基本上在互联网上都没有数字痕迹。所以,今天AI回头抢购2022年以前的旧书,并不代表纸张打败了互联网。


它更像是在提醒我们:机器越会生产内容,那些能够证明「这不是机器自己编出来的」内容,就越值钱。


写在最后


当然,这样的数据也不仅仅是旧书。我们的日常工作中,也会产生大量这样的真实数据。


比如一家服装电商公司,这么多年积累下来的买家秀,可能就是一座数据富矿;再比如一家制造工厂,这么多年积累的生产数据和失败数据,甚至退货数据,都会是有价值的数据。


以后最昂贵的数据,未必是最秘密的数据,也未必是数量最大的数据,而是那些能够说清楚自己从哪里来、由谁判断过、为什么值得相信的数据。

本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。