人工智能大模型的训练,通常需要海量的数据作为训练材料,这些训练数据很大一部分来源于互联网上公开可获取的各类内容,包括文字、图片、代码、音视频等,其中不可避免地会包含大量受著作权法保护的原创作品,围绕这种大规模使用他人受版权保护作品进行AI模型训练的行为,是否需要事先取得权利人的授权许可,还是可以援引著作权法上的“合理使用”制度予以豁免,已经成为全球范围内人工智能法律领域最受关注、争议也最为激烈的核心问题之一。
从著作权法的基本原理看,合理使用制度,是指在特定情形下(比如个人学习研究、新闻报道、课堂教学等法律明确列举的情形),可以不经著作权人许可、不向其支付报酬而使用其作品,我国著作权法对合理使用的具体情形采用相对列举明确的立法模式,AI模型训练这种新兴的使用场景,是否能够被涵盖在现有合理使用制度的适用范围内,法律并没有专门针对性的明确规定,理论界和实务界对此存在不同观点,一种观点认为,AI训练过程本质上是对作品进行统计性的特征学习,不构成对作品表达内容的实质性再现和传播,客观上也具有促进科技创新和产业发展的公共利益价值,应当参照或者扩展适用合理使用的相关原则;另一种观点则认为,未经权利人许可,大规模复制和使用其受保护的作品用于商业性的模型训练活动,本质上仍然是对著作权人复制权、信息网络传播权等专有权利的侵犯,不应当轻易被认定为合理使用。
目前国内外已经出现了多起涉及AI训练数据著作权争议的诉讼案例,不同案件的具体裁判结果和裁判理由也存在一定差异,这也反映出这个领域的法律规则仍然处于司法实践持续探索、尚未形成完全统一稳定裁判标准的阶段,企业在开展涉及大规模数据训练的人工智能相关业务时,需要充分认识到这个领域客观存在的法律不确定性,不能简单认为“数据是从互联网公开渠道获取的,就必然可以随意使用不存在侵权风险”。
建议从事人工智能模型训练相关业务的科技企业,密切关注国内外关于AI训练数据著作权问题的最新立法动态和司法判例进展,在训练数据的来源选择和使用方式上,采取相对审慎的态度,比如优先考虑使用已经获得明确授权许可的数据集、开源许可证明确允许相关使用方式的数据资源,或者探索建立与内容创作者、版权方的数据授权合作机制,同时对于训练数据的来源和使用方式,保留必要的合规审查记录,必要时委托专业的知识产权律师,结合企业具体的业务模式和数据来源情况,进行审慎的合规风险评估,在人工智能技术快速发展和知识产权保护规则仍在演进完善的现阶段,采取相对稳健审慎的合规策略,为企业的长期健康发展奠定基础。