🤖
🤖
核心导读
《纽约时报》诉OpenAI与微软版权案最新未删节文件曝光:微软高管私下称AI抓取是“人类历史上最大的劳动力盗窃”,OpenAI领导层亦承认其模型对出版商构成“生存威胁”。文件详述双方绕过付费墙、大规模抓取并汇编训练数据的做法,微软Copilot更使纽约时报域名点击率下降高达93%,这些自认与OpenAI的“合理使用”抗辩相抵触。
最新未删节的信息显示,在《纽约时报》三年前对OpenAI和微软提起的版权诉讼中,出现了承认AI抓取无异于盗窃、且AI产品对出版机构构成重大威胁的表述。
根据诉讼文件,微软一位高层私下将两家公司的AI训练做法描述为“盗窃”,而OpenAI自己的领导层则表示,其AI模型对作品被用于训练它们的出版商和记者构成了“生存威胁”。
解封的材料还详细披露,两家公司涉嫌如何绕过付费墙而不被发现地获取并使用这些内容、通过大规模抓取构建训练数据集,以及蓄意从训练数据中抹去版权声明。
值得注意的是,这些新信息大多来自《纽约时报》自己的诉讼书,而非仍处于密封状态的原始证据。以下引述在呈现时均缺少其原始语境。
这份未经删节的文书是这起已持续三年的诉讼的最新升级。在该案中,《纽约时报》最初指控两家公司通过用其内容训练生成式AI模型而违反版权法。
AI公司能否合法使用受版权保护的材料来训练AI,目前并无明确答案,但法官总体上倾向于支持AI公司的论点,即训练构成“合理使用”。这一法律原则允许人们在某些情形下未经许可使用受版权保护的作品,例如戏仿、新闻报道或评论。本月早些时候,特朗普政府提交了一份意见书,为OpenAI未经许可使用受版权保护材料训练其大语言模型辩护。
然而,其中若干新的自认与OpenAI的合理使用抗辩相抵触,尤其是该原则要求使用不得替代或损害原作的市场。
例如,微软自己的数据显示,与传统的必应搜索相比,其Copilot“答案引擎”使《纽约时报》域名的点击率下降多达93%。微软应用科学总监布伦特·赫克特(Brent Hecht)于2024年1月撰写的微软内部演示文稿将这一下滑描述为“末日循环”,会“同时损害我们模型的表现和整个网络”。
“一款终端产品危及其核心供应商的经济基础,这是极不寻常的,但这就是我们为自家大语言模型业务在‘内容供应链’方面所造成的局面,”诉讼文件引述的微软文件写道。
微软首席执行官萨提亚·纳德拉今年早些时候在庭外取证中也作证称,“任何被置于付费墙之后的内容,任何想用它……作为基础或用于训练的人都应当获得授权”,并明确表示,如果他“得知OpenAI抓取并训练了付费墙后的信息”,他会“行使(微软的权利)要求OpenAI重新训练其模型”。
其他自认则与合理使用检验标准的另外几根支柱相冲突:OpenAI的ChatGPT负责人尼克·特利(Nick Turley)在内部沟通中写道,出版商正面临来自聊天机器人等产品的“生存威胁”,这些产品“在很大程度上具有替代性”,且“随着它们变得更好,替代性会越来越强”。
OpenAI总裁格雷格·布罗克曼称这些模型“非常擅长新闻”。纳德拉今年早些时候在宣誓后也认同,与聊天机器人对话“已经替代了……在网站和AI平台上直接获取信息,而无需前往原始来源”。
这类措辞说明,该技术可能直接与原作竞争,而非对其加以转化。
一份微软文件称,生成式AI存在“真实风险”,可能“严重扰乱那些生成基础模型训练数据的人们的就业”。
复制的规模之大令人震惊。这些文件首次披露,仅OpenAI的中期训练数据集就包含《纽约时报》《每日新闻》和调查报道中心所发表作品的91692多份副本。一个源自Common Crawl的数据集仅来自nytimes.com的文档就超过200万份。
在2023年1月的一份内部备忘录中,赫克特称之为“规模空前、令人震惊的盗窃”以及“人类历史上最大的劳动力盗窃”。
该文书以新的细节阐述了OpenAI和微软如何获取原告的内容,包括从必应索引中抓取这些内容。
“OpenAI将整个GPT-3训练数据集交付给微软,微软用它来评估如何在自己的商业产品中部署OpenAI的模型,”文书写道。“微软同样通过名为‘Project Taxi’和‘Project Mango’的项目向OpenAI提供训练数据。”
两家公司涉嫌将Project Mango的数据汇编成一个训练数据集,其中包含至少160903件来自这些新闻出版商的独立作品的副本。
为了最大限度地利用抓取成果,OpenAI员工涉嫌想出了一套在不被发现的情况下绕过付费墙的方案。文件显示,当OpenAI研究员尼克·赖德告诉布罗克曼有一个“绕过纽约时报付费墙的黑客手段”时,布罗克曼回复:“啊,不错。”
OpenAI员工还涉嫌构建了WebText和WebText2等训练数据集,这些数据集过度依赖抓取来的新闻内容。他们还涉嫌从Common Crawl——一个免费开放的网页抓取数据存储库——中提取了数百万篇文章。调查结果还描述了在数据进入模型之前蓄意抹去训练数据中版权声明的做法,因为研究人员“不希望模型向用户输出”“版权声明”。
OpenAI和微软未回应置评请求。
分享这篇文章: