# 全球最大生活指南百科 WikiHow 正式起诉 OpenAI 侵权,大模型被指最大“抄袭者”?
## 事件概述
2024年8月,全球最大的生活指南百科网站 WikiHow 的母公司正式向美国联邦法院提起诉讼,指控 OpenAI 未经授权使用其数百万篇受版权保护的文章来训练 ChatGPT 等大语言模型。这一诉讼是继《纽约时报》、多位作家和视觉艺术家之后,又一针对 AI 训练数据合法性的重磅案件,也将“大模型是否构成系统性抄袭”的争议推向新高潮。
## 核心争议:训练数据来源的合法性与“合理使用”边界
WikiHow 的指控核心在于:OpenAI 在未获得明确授权、未支付许可费用的情况下,大规模抓取并复制其网站上的文本内容,用于训练 ChatGPT,使得模型能够生成与 WikiHow 风格、结构乃至具体步骤高度相似的答案。WikiHow 明确指出,其商业模式建立在用户贡献的原创内容之上,而 OpenAI 的行为直接损害了其内容价值与广告收入。
OpenAI 方面则可能援引“合理使用”(fair use)原则进行抗辩,主张其训练行为属于“转换性使用”——即从海量文本中提取统计规律,而非直接复制或表达原作品。然而,法律界普遍认为,当 AI 模型能够逐字或近义复述原文,甚至生成与原作品高度同质化的内容时,“合理使用”的边界便变得模糊。
## 行业影响:AI 训练数据合法化进程加速
此案若对 OpenAI 不利,可能引发连锁反应:首先,其他内容平台(如 Reddit、Stack Overflow 等)将更倾向于采取“拒绝爬取 + 收费授权”模式,而非默认开放。其次,AI 企业将被迫转向完全合规的数据采购,甚至可能推动“公共领域 + 合成数据”的替代方案。最后,法院的判决将直接影响美国版权法对“机器阅读”行为的定性,进而决定未来 AI 发展的底层规则。
## 深度分析:大模型是否是“最大抄袭者”?
从技术本质看,大模型并非简单“抄袭”,而是通过概率分布拟合训练数据中的模式。但问题在于:当模型输出与训练样本高度雷同时,其“创作”实质上是无标注的复制。更关键的是,这种“复制”缺乏对原作者的署名与补偿,形成了事实上的“免费劳动剥削”。WikiHow 的诉讼正是试图在版权法框架内为这种剥削划定红线——如果法院认定 OpenAI 构成侵权,那么“大模型是最大抄袭者”的论断将首次获得司法背书,而非仅停留在道德批判层面。
## 结语
WikiHow 诉 OpenAI 一案,本质上是内容创作者与 AI 巨头之间“数据红利分配”的终极博弈。无论结果如何,它都将迫使整个行业正视一个根本问题:AI 的“智能”是否建立在对人类原创成果的无偿掠夺之上?答案将在法庭内外逐渐清晰。