在中国使用生成式 AI 训练数据的合法性边界在哪里?

中国著作权法未设文本与数据挖掘例外,训练数据合法性依赖合理使用现有情形、授权与合同安排。

三个层面:

一是著作权层面:素材的取得与使用本身即可能侵权。美杜莎案认定,用户截取动漫形象训练并发布模型侵害复制权与信息网络传播权;《庆余年》“一键成片”案以切分影视片段入库供AI调用,判赔80万元。爬取另需审查是否违反网站协议或构成不正当竞争。

二是监管层面:《生成式人工智能服务管理暂行办法》第七条要求数据与基础模型来源合法、不侵害知识产权、涉个人信息需取得同意。生成内容另须依《人工智能生成合成内容标识办法》标识。

三是数据层面:涉个人信息或重要数据的,另须符合个人信息保护与数据出境要求。实务建议:建立来源台账、留存授权链条、高风险语料过滤去标识化,服务协议明确责任分配。