返回

文章详情

人工智能公司摧毁稀有且无法恢复的实体书籍

Hacker News2026年7月31日 19:01

人工智能行业已经剥离了开放网络的表层,吞噬了从非法获取的图书馆中每一块残余,如今却发展出了新的胃口。数百万本实体书籍现在被批量购买,并投入一个行业小心翼翼称之为“破坏性扫描”的过程。数据获取越来越多地涉及到切割数百万本书的书脊,扫描它们,然后再粉碎并丢弃。该服务由一家名为ISBNdb的公司提供。他们承诺每次订单可获取“多达一百万个标题”。他们特别将“较老、稀有和专业的书籍”作为优质的训练数据宣传,因为2022年之前的书籍“结构上保证”不会受到人工智能污染。随着人工智能开始在一个狂热的循环中自我消耗,来自旧世界的信息对大型语言模型的动量和延续变得愈加珍贵。想了解更多关于人工智能与艺术的内容,请阅读德里克·麦克阿瑟的文章:一场享有盛誉的文学比赛被指责奖励人工智能创作的作品,替代所有艺术家?人工智能艺术辩护者的奇怪逻辑,一位说唱歌手假装他的新病毒热曲不是明显的人工智能创作,开放AI的Sora本打算摧毁好莱坞……直到它戛然而止。我们能否通过法律禁止销售高地牛人工智能艺术?一个荒谬的人工智能生成的壁画是格拉斯哥最不需要的东西。当这位电影老兵要求人工智能给他提出创意时,他感到震惊。该公司的营销材料对书籍的命运进行直白的描述。“‘人工智能公司摧毁了两百万本书’不是一个能引发同情的标题,”其网站上写道。它向买家提供保密协议,并建议他们将这项工作包装为“数字保存”。我们谈论的是那些在历史的众多劫难中幸存下来的书籍,由于在信息时代之前作为冷门作品而变得稀有。欧洲和美国的多家小型书商注意到对稀有和绝版书籍的批量订单突然激增。一位书商告诉404媒体,他的销量从每周约20本飙升到数百本,包括难以找到的外文书籍。“这既在财务上对我有利,也帮助我清理了那些本来不可能再售出的旧库存,”他说。“但另一方面,我不喜欢这种最终用途,也不喜欢这些稀有书籍被粉碎。” 好吧,另一方面,这些东西是无法替代的。一旦一本最终未数字化的书籍被粉碎,它就永远消失。而数字化后的版本则成为人工智能解读的牺牲品,而非对作品的直接、准确表现。牛津大学的一批稀有书籍和手稿(图片来源:Getty)负责聊天机器人Claude的公司Anthropic是这一做法的主要推动者。在一起版权诉讼中披露的内部文件显示,2024年启动了一个名为“巴拿马项目”的计划。法院文件描述了一个工业规模的操作,使用“液压切割机”切割数百万本书的书脊,然后通过“高速、高质量的生产级扫描仪”进行扫描。一份内部备忘录称之为“我们努力颠覆性地扫描世界所有书籍”,并指出“我们不希望让外界知道我们在进行这个项目。”Anthropic专门聘请了前Google Books的负责人,帮助收购该公司所称的“世界上所有书籍”。促成这一法律框架的依据是联邦法官在Anthropic版权案中的裁决。法院认定,通过制作数字副本并在一对一转移中销毁物理原版,该过程符合“转化性”并受到合理使用保护。其理由是,由于任何时候仅存在一个副本,它不属于传统的盗版。这一裁决为这一做法迅速传播奠定了先例。来自德里克·麦克阿瑟的更多报道:麦克需要忠实重建,还是我们只是害怕自己的未来?电影制片厂像鲨鱼一样环绕着,准备收购最大的在线评论平台。今年的戛纳电影节来了又走,电影是否面临成为小众爱好的危险?更换老板并不会让破碎的创意苏格兰重新团结。跨多个国家的稀有书商现在收到类似的可疑采购请求。在荷兰,一位古籍书商收到了来自一家位于新加坡的公司发来的电子邮件,声称正在开展“一个专注于收集多种语言书籍的新项目”。附加的名单中包含了按ISBN编号排列的3,000本英文书籍,涵盖了从民间传说和童话到技术手册和科学文本的广泛主题。瑞士、西班牙和德国也出现了类似的报告。涉及的书商们得出结论,认为这些书籍注定是要用于人工智能训练,因为没有收藏家或转售商需要如此奇怪的稀缺标题。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡