书商怀疑人工智能公司正在购买并摧毁珍贵书籍
“每个收藏都很重要”人工智能公司悄然大量购入稀有书籍,却遭到书商的抵制。如果你真正能够欣赏一本旧书,甚至会惊叹于其脆弱的发黄页面中包含了人类试图理解周围世界的最早方式,那么关于科技公司为了训练人工智能而摧毁书籍的头条新闻无疑会折磨你内心最柔软的部分。想象一堆书脊等待被送入切木机,而撕下的页面被裁剪、扫描并扔掉,这确实令人沮丧。但这也是扫描书籍最快、最便宜的方法,人工智能公司正急于通过训练那些只能在书中找到的引人入胜、高质量的长篇文本来提升他们的模型。因此,书籍爱好者担心这一做法可能超出目前的报道范围,在更大规模上发生,导致某些书籍的实体副本将永远消失。然而,这种破坏性更令人痛心的是它本不必如此。谷歌在2009年申请了一项非破坏性的书籍扫描技术,人工智能公司可以利用其高效地扫描书籍——如果他们愿意放慢脚步并投资于此过程。然而,这项技术并不完美;研究发现页面的弯曲可能会扭曲文字,且可能会遗漏页面。正如《连线》所报道的,当工人移动得太快时,可能会发生故障,包括无形的手遮住页面。总体而言,成本和速度之间的权衡可能并不吸引那些寻求以最低成本扫描数百万书籍的人工智能公司,谷歌的方法可能也不是处理珍稀书籍的最佳方式。帮助图书馆保存老旧藏书的互联网档案馆早已理解,扫描旧文本需要时间和精力以限制处理,这就是为什么这被视为如此人性化的工作。对于那些希望找到捷径的人工智能公司来说,互联网档案馆的方法可能感觉几乎陌生。但如果你是一个书籍爱好者,并在解析有关人工智能驱动的书籍破坏的谣言时寻找一剂良药,一篇2021年的旧帖子描述了互联网档案馆如何扫描书籍以避免损坏即使是最珍贵的稀有书籍。在帖子中,一位自2010年起便在档案馆工作的书籍扫描员Eliza Zhang通过解释她为何如此喜爱“艰难”方式的扫描,提供了一种心灵的安慰。互联网档案馆确实尝试过自动化的道路,帖子称,甚至测试过“拥有真空动力翻页臂的商业书籍扫描仪”。但“事实证明,这些自动扫描器实际上并不适用于脆弱的书籍、稀有书籍和其他特殊藏品——我们的图书馆合作伙伴要求我们数字化的材料”,互联网档案馆表示。“这个工作需要高度的专注,”Zhang说,因为“非常古老、脆弱的书籍”的页面“薄如纸”。在帖子中,负责领导档案馆书籍扫描操作的Andrea Mills解释说,“干净、干燥的人手是翻页的最佳方式。”为了确保每本稀有书籍只需通过扫描过程一次,Zhang会慢慢来。每次翻页时,她都会小心地用脚踏板抬起扫描器的玻璃,然后调整相机,确保页面清晰可读。她还会注意到任何折叠页,设置提醒以便返回扫描插页,以确保在记录主页面时,不会遗漏附加材料。在整个过程中,她理解如果跳过某一页面或图像模糊,互联网档案馆的专有软件将停止该过程并提示她重新扫描。实践出真知,经过十多年的工作,她报告称错误率很低。当时,Zhang已经扫描了“超过300万页,14,000个折叠页和18,000个项目(大多数为书籍)”,帖子称,其目标是确保“零错误”。Ars向互联网档案馆询问评论,但图书馆服务主任Chris Freeland表示,描述Zhang工作过程的帖子“至今仍是我们扫描过程的最佳描述”。该帖子在Zhang的书籍扫描视频在当时的推特上获得150万次观看后发布,并配有一条特别符合今天因人工智能驱动的书籍破坏而感到愤慨的书籍爱好者的说明。“在互联网档案馆,我们就是这样数字化一本书的,”推文说。“我们绝不会通过切断装订来摧毁一本书。相反,我们以艰难的方式逐页扫描。”稀有书商标记可疑的大宗订单 自从2025年夏天因其摧毁数百万本印刷书籍以训练其人工智能模型而起诉Anthropic,书籍爱好者就开始捍卫一些最珍贵的收藏,以抵御人工智能公司在其庞大语言模型中获取全世界书籍的无尽追求。对于希望通过训练过程保护书籍的人来说,最大的担忧是人工智能公司会无情地将稀有书籍制成纸浆,而这些书籍是永远无法替代的。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡