深度阅读

文章详情

围绕重点内容进行完整呈现,帮助读者获得更顺畅、更聚焦的阅读体验。

古籍遭遇科技巨头的猎食:纸质知识的危机
Article View

古籍遭遇科技巨头的猎食:纸质知识的危机

谈球吧(中国)-官方网站 211 阅读 约 5.5 分钟

如果最近你走访过东京的神田神保町——这个被誉为全球最大古书店聚集地的区域,你可能会瞧见一种让人瞠目结舌的现象。在这里,古书商们接待了出现频率逐渐增多的神秘“大客户”。这些顾客既不似手持老花镜的资深学者,也不似追求文献的富有收藏家,更像是不折不扣的非人类。它们在书店中广泛购书,毫不在意作者、名气或装帧,甚至无视书籍的保存状态。昭和时代的地方志、数十年前的法律判例集、早已不再被注重的旧医学手册,乃至乏味的农业统计报表,只要书籍上有文字,统统被收入囊中。有些书店短短一天内就被扫走上百本,累积总数竟超过千册。买家的注册名或许五花八门,却最终都指向同一个跨国物流的中转站。直到日本媒体进行深入调查后才恍然大悟,自去年起,超过五十吨的日本二手书籍已被运送至美国。这并非书虫的淘宝盛宴,而是一场由科技巨头发起的“纸质文明大洗劫”。以每本书五百克计,五十吨便相当于十万册纸质书。昔日书架上积满灰尘的纸质知识,正成箱成箱地被装入集装箱,运往海的另一边。顶尖的高科技人工智能公司,究竟为何对这些古料产生如此饥渴?答案既充满科幻色彩,又略显讽刺:在几乎吞噬了整个互联网后,这些大模型终于面临“断粮”,他们开始“吃纸”。

一、网络信息日渐枯竭,AI模型面临资源枯竭的困境

近些年来,人工智能的演进逻辑显得极为简单粗暴:大模型需要更多的数据以获得更高的智能。硅谷的爬虫程序犹如蝗虫般肆无忌惮,几乎将全球互联网的每一个角落都翻遍,包括维基百科、线上论坛、新闻报道,甚至社交平台上的争吵记录皆在其囊括之下。然而,人类在网络上留存的文字毕竟有限。权威的人工智能研究机构 Epoch AI 之前发布的一份预测报告让人不寒而栗:若依照大模型训练数据的消耗速度,至2026年前,互联网上可供使用的高质量文本数据——大约在数万亿至数十万亿 Token 之间——或将彻底耗尽。这便是困扰硅谷科学家的“数据墙”。相比“书籍匮乏”,更为可怕的则是陷入“毒药”的深渊。当今互联网早已不再是一个纯粹的知识海洋,而是满是AI批量生成的低质量营销文章、搜索引擎优化的伪信息和水军制造的无用内容。如果大模型继续将其训练建立在这些不堪入目的数据上,最终将可能遭遇“模型崩溃”。剑桥大学与牛津大学的研究人员在《Nature》的论文中证实:若允许AI用AI生成的数据进行自我训练,经历数代迭代后,模型的输出几乎会沦为毫无逻辑的混乱语句。这就好比不加挑剔地让一个画家仅仅临摹画册的复印品,随着时间的推移,画面只剩下模糊的噪点。这种“算力近亲繁殖”的现象将导致人工智能的智力与日俱减。在面对即将见底的网络数据库与遍布的垃圾信息之际,硅谷的巨头们开始放眼全球,意外发现最为纯净、逻辑深邃、未曾被AI污染的“高价值资源”,竟然全都安静地藏匿在尚未数字化的实体书籍之中。 谈球吧

二、从优雅的网络爬虫到粗暴的工业化拆解:硅谷的纸质书“猎人”

about image

显然,既然网上的数据已然枯竭,实体书便成了新的猎物。或许你会认为AI公司买书归来,是安排一群工作人员以极其小心翼翼的态度逐页扫描,这显然低估了科技新贵对效率的极致追求。在硅谷,纸质书转变为训练数据的过程,充满了工业时代的暴力美学。早前,外媒曾披露AI独角兽公司Anthropic的经典操作。为了迅速获取海量高质量的图书文本,他们设立了一条极其高效的“图书数字化流水线”:巨头们购入成吨的实体书籍,甚至未曾翻看内容,便将其直接送入重型工业切纸机。在重型铡刀的轰鸣声中,珍贵的书脊瞬间被切割开来,一本本厚重的书籍顷刻之间化作数百张散落的单页。而后,这些纸张被投入高速工业扫描仪中,以每分钟几百页的速度转化成高分辨率的数字图像。接下来,最新的光学字符识别(OCR)技术则将图像中的文字、排版与表格迅速提取,转化为结构化的数字文本。有何谓硬核数字化?这无疑就是“拆书炼丹”。一本凝结了作者数年心血的著作,在流水线上历经几秒,便完成了从实体消亡到数字升华的蜕变。书脊断裂的声音,是现代模型吞噬人类文明的噬骨声响。

三、为何日本古籍成为硅谷的“美味佳肴” 谈球吧

在这场全球范围内的“纸质书籍抢购战”中,日本的二手古籍之所以成为硅谷科技巨头们翘首以盼的“极品”,缘由深厚,却又极为实际。首先,这些书籍具备极高的数据纯度和优质的排版质量。自近代以来,日本建立了极为庞大的出版业,其印刷技术精湛、字体排版规范。如此高品质的纸张和清晰的印刷,使得现代的光学字符识别软件的识别准确率高达99.9%。与其他语言的旧书相比,这些日文古籍几乎是数据整理工程师心目中的完美食材。此外,这些书籍的内容与领域知识深度,也使其无可替代。此次神秘买家的出击,着重于大量“地方志”、过期法律判例集,以及昭和时代的行业报告。这些书籍在当初的发行量极少,并且鲜有进入互联网。蕴含其中的社会运作逻辑、人际关系、法律博弈以及历史细节,都是任何现代网页所无法提供的宝贵素材。

觉得有用?分享给朋友

让更多人看到这篇内容。

Recommended

推荐阅读