牛津大学允许OpenAI在博德利图书馆训练其AI模型
牛津大学允许ChatGPT背后的公司在博德利图书馆的历史文本上训练其AI模型,因为科技公司正在为新数据而扫荡学术机构。根据内部文件,OpenAI数字化的博德利材料已被用于“充实OpenAI的训练集”。牛津大学于2025年3月宣布与该公司达成合作,利用OpenAI软件对大学世界著名的图书馆中的文本进行数字化,他们表示这将使这些内容更广泛地提供给学生和研究人员。然而,声明并未指出这些材料将用于训练OpenAI的模型,这些模型通过大量数据的输入来识别单词模式,从而“学习”编写完整句子和执行其他认知任务。一位OpenAI发言人表示,该公司“为确保当代AI模型为未来保存世界历史知识而感到‘自豪’”。他们补充道:“在日常生活中,有超过十亿人使用这项技术,因此确保它反映不同的文化、历史和视角是非常重要的。”通过信息自由请求获得的牛津大学会议纪要记录了员工的担忧,包括博德利治理委员会成员对与OpenAI合作的声誉风险及达成涉及这一能源密集型技术的协议对大学环境承诺的影响的担忧。书商们还报告了关于不太知名的书籍(如18世纪非洲农业工具指南或1950年代赛车手传记)的订单激增。二手书店的老板们猜测,由于这些书籍在网上以数字化形式存在的可能性较小,它们代表了可以被下一代AI模型所消费的新数据。被抓取的网站越来越充斥着AI生成的材料,使它们在训练模型时的用处减少,开发人员因此转向实体化的、通常是历史性的书籍收藏。OpenAI还与波士顿公共图书馆、加州理工学院、麻省理工学院和密歇根大学等美国研究图书馆达成类似协议,开展名为NextGenAI的项目。牛津大学是该项目中唯一的英国成员。到2025年6月,博德利图书馆的125,000张历史论文扫描图像已与OpenAI共享,其中包括19世纪和20世纪来自欧洲和美国大学的博士论文。其他扫描文本包括一套稀有的10,000首16世纪“宽边民谣”,其中包含曾在都铎街角流传的歌词和乐谱。工作人员还讨论了对18世纪爱尔兰国事文件、爱尔兰小说家玛丽·艾奇沃斯的私人信件和多萝西·霍奇金的青霉素笔记本进行数字化。与牛津的OpenAI合同还提出了博德利图书馆2300万件藏品的大规模数字化的前景。会议纪要还讨论了创建一个“问博德”聊天机器人。牛津大学的一位发言人表示,正在进行的数字化文本“规模较小”,仅涵盖了不再受版权保护的材料。该发言人表示,博德利保留扫描的版权,并将在几个月内开始公开发布这些内容。他们拒绝了有关机器学习元素向公众和学生隐瞒的建议。该发言人称,数字化是大学的主要兴趣,但工作人员已经公开表示,该项目也会贡献训练数据。在这项协议下,博德利的馆藏保持完整,不同于其他地方的二手书收购,这些书在扫描后被压制。OpenAI的近距离竞争对手Anthropic已花费数千万美元购买书籍,并切开它们的脊背以便扫描其内容,然后将其压制。Anthropic已表示,他们不会购买和销毁稀有和古董书籍。一个科技新闻网站404 Media还在二手书订单中放置了一个追踪设备,并追踪到美国亚马逊的一处设施,在那里书籍也被拆解和扫描。牛津发言人说:“通过与OpenAI的项目数字化的材料规模较小,属于无版权,OpenAI对这些材料的使用不是独占的。博德利图书馆也保留自行提供数字化材料的权利,并且图书馆将开始在接下来的几个月内公开发布这些材料,正如我们在其他数字化合作中所做的一样。该项目实际上将使博德利更易于为更多人提供这些材料,帮助那些本可能难以获取的人。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡