据IT之家9月26日援引《卫报》报道,一份内部文件显示,由OpenAI完成数字化的牛津大学博德利图书馆藏书,已被用于构建OpenAI的训练集。牛津大学在2025年3月宣布合作时,说明了数字化将便利学生和研究人员查阅文献,但公告未提及模型训练用途。
报道说,截至2025年6月,博德利图书馆已向OpenAI提供12.5万份历史学位论文的扫描影印页;已扫描文献还包括一套收录约1万首作品的16世纪街头民谣珍藏集。教职人员讨论过其他文献的后续数字化计划,这些计划不能等同于文献已经提供或用于训练。
牛津大学否认隐瞒机器学习用途。校方发言人表示,数字化是合作的核心诉求,教职员工也明确承认项目会提供模型训练数据;合作数字化的资料规模有限,均已超出版权保护期,OpenAI获得的是非排他性使用权。博德利图书馆保留自主发布数字化资源的权利,校方称将在未来几个月逐步公开这批资料。
与此同时,报道援引牛津大学会议纪要称,包括博德利管理委员会成员在内的教职员工曾对合作的声誉风险及高能耗技术与学校环保承诺之间的关系表达顾虑。
