这是一个时代的标志,亚马逊竟然称这为合理使用
这份404报告理应受到相当多的关注。亚马逊正在购买大量图书,将其扫描用于人工智能训练数据,并在此过程中将其销毁。404媒体的调查揭示了亚马逊的图书购买操作,这在之前并没有报道,通过在我们怀疑会被一个人工智能公司用于训练数据的稀有书籍中放置追踪装置,并在全国范围内跟踪它到达最终目的地。这一最终目的地是位于内华达州拉斯维加斯的一个亚马逊仓库。在这个地点工作的亚马逊员工表示,他们所做的就是接收大量的印刷书籍,然后将书籍的装订剪断,以便更快速地扫描这些书籍。印刷书籍在这一过程被销毁。负责这个仓库的亚马逊团队的标志是一个恐龙,露出牙齿,手中拿着一本书。我们没有透露我们跟踪的货物中书籍的标题,但它们是稀有书籍,意味着流通的副本不多。有时是因为它们的印刷数量本来就不多,有时则是因为它们是外语,能说的人并不多。正如卖书的书商所说,世界上没有很多人会像关注《雾都孤儿》的第一版那样关注这些书,但这并不意味着它们没有价值。“价值有不同的类型,”书商说。“显然有货币价值,但还有很多其他类型的价值。历史价值、知识价值、情感价值,各种各样的,而人工智能公司对此毫不在意。他们只想要连在一起的一堆文字内容。”如前所述,这在大规模上也是知识产权盗窃。然而,有一个方面没有得到应有的关注,即一个真正道德且富有公共精神的公司如何处理同样的问题。扫描所有的书籍:互联网档案馆的抄写工作 安-劳尔·弗朗特 在1996年,计算机工程师布鲁斯特·凯尔创立了互联网档案馆,使命是提供“对所有知识的普遍访问”。今天,这一愿景推动着扫描中心的系统性工作,在这里,操作人员小心翼翼地逐页数字化书籍,保持了数世纪古籍的内容和物理完整性。互联网档案馆的方法源于对2000年代初出现的数字化方法的根本分歧。当谷歌在2004年推出其图书项目时,革命性地扩大了数字图书馆的规模,但也引入了一个令人不安的权衡:速度与保护。谷歌的工业化方法往往涉及破坏性的扫描——剪断书脊和拆解装订,以便快速自动处理。互联网档案馆选择了另一条道路。“在互联网档案馆,我们从不通过剪断装订来销毁一本书。相反,我们以艰难的方式逐页进行数字化。”这促成了适应互联网档案馆特定目的的机器和软件的开发,以及一个新职业:书籍扫描员或抄写操作员。要明确的是,破坏性方法更快且更便宜,但考虑到亚马逊的巨大资源和在许多情况下明确浪费的巨额资金推动人工智能泡沫,这并不是很好的借口。更糟糕的是,当你记得这一切都是为了训练亚马逊糟糕的Nova系列时。这是他们做出的选择,就像现在建立大型化石燃料发电厂而不是花时间增加核能和可再生能源能力一样的选择,就像盗取无数作家和艺术家的知识产权的选择,就像推出尚未准备好的产品的选择,就像设立复杂且具有欺骗性的融资方案,而不是以可持续的方式发展产业的选择。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡