笔者上周参加了理振律所组织的法律研讨会,就“AI生成训练过程中涉及的海量素材是否需要版权授权”展开了深入地讨论。
作为一名从教培领域刚转型到法律领域的新人,非常有幸自己能够与上海广播电视台版权中心的姚老师、北京盈科(上海)律师事务所合伙人王律师等法律专业人士学习。
结合会议讨论的相关问题,自己也对“AI素材版权授权”相关问题做了调研,以下是笔者一些思考,内容会分为三大板块——
1)法律&政策解读
2)热点事件回顾
3)观点&结论分享
【个人观点,供同行参考,如有表述问题,欢迎留言指正】
法律&政策解读
我国(中国)相关法律法规/政策
2023年7月13日,国家互联网信息办公室等七部门联合发布《生成式人工智能服务管理暂行办法》(以下简称“暂行办法”),并自2023年8月15日起施行。
第七条生成式人工智能服务提供者(以下称提供者)应当依法开展预训练、优化训练等训练数据处理活动,遵守以下规定:
(一)使用具有合法来源的数据和基础模型;
(二)涉及知识产权的,不得侵害他人依法享有的知识产权;
(三)涉及个人信息的,应当取得个人同意或者符合法律、行政法规规定的其他情形;
(四)采取有效措施提高训练数据质量,增强训练数据的真实性、准确性、客观性、多样性;
就上述文件可得知,我国在AI生成训练过程中涉及的海量素材还是需要版权授权得。因为约定了开展预训练、优化训练等训练数据处理活动我们是不得侵害他人依法享有的知识产权。
日本相关法律法规/政策
日本政府表示AI训练数据“无版权保护”。2023年6 月6 日,日本文化厅与内阁 AI 战略部门近日发布《关于人工智能与著作权的关系》解释性文件,该文件曾在 5月 15 日举行的日本内阁 AI 战略小组会议上使用。
目前,就笔者调研的相关信息得知日本就该板块持有相当开放的态度,声称训练AI可以使用任何数据,甚至从非法网站获得数据也可以用,当然这一块还需要进一步确认。但是至少我们可以判断在日本AI生成训练过程中涉及的海量素材是不需要版权授权的。
美国相关法律法规/政策
笔者尚未检索到美国出台直接的政策明确AI生成训练过程中涉及的海量素材授权问题,但是就当下热议Openai、Stability AI都属于美国企业,该类产品前期一定是需要经过大量的素材训练的,故侧面反映美国与日本就该问题是持有相似的态度。
但是,美国就AI生成的作品是否受到版权保护有明确的说明——在进行版权登记时需要明确是否包含AI生成的内容,针对AI生成的内容是不受到其版权保护的。
热点事件回顾
我国---小红书近期热点事件
2023年8月,有原画师发现网友用小红书 Trik AI (新的绘图功能)做出来的图片和自己的原作品非常相似,引发了一波 AI 抵制潮。目前,大批原画师发布停止更新作品。
值得注意的是,官方修改了用户协议,使得不经过小红书用户使用者默认同意自己发布的内容成为其AI训练的“素材”。
——来源于小红书用户协议
小红薯官方尚未明确发布任何声明。
我国---B站近期热点事件

2023年8月,B站广告涉嫌AI 洗稿网易游戏登上热搜,而作为被侵权方,网易游戏《一梦江湖》官方回应称,关于B站广告涉嫌洗稿一梦江湖云梦武器的反馈已经收到,目前已将相关内容收集到法务进行处理,我们也将继续跟进相关情况,维护自身合法权益。
目前,B站似乎已经下架这一广告画作,开屏页面上不再显示。后续处理有待观望。
我国---“AI大模型数据被盗第一案”
笔神作文在2023年6月13日下午发布声明,指控合作伙伴学而思“盗取”作文库存数据,来训练即将上线的AI大模型产品。笔神作文表示,将通过司法程序解决纠纷,要求学而思支付1元赔偿金,公开道歉,删除已爬取的数据。
当晚,学而思回应称其对笔神作文的数据使用属于双方合同约定的正常合作范围。6 月 14 日,笔神作文发布其调用量和服务器日志截图,证明学而思在几天内通过“爬虫”技术非法访问、缓存笔神作文 App 服务器的数据 258 万次,属于典型的“扒库"行为,学而思并未对此做出公开回应。
8 月4 日,笔神作文称其决定不再对学而思针对数据调取相关事件提起诉讼,双方经沟通后对有争议的条款已达成一致,双方达成和解,将继续深化合作。
根据目前我司所发布《生成式人工智能服务管理暂行办法》是明令禁止侵犯知识产权,就学而思盗取数据行为明显是违反了商业道德及法律规范。
美国---华盖创意.VS.Stability AI
2023年年初,华盖创意已经在伦敦高等法院提起法律诉讼。彼得斯在接受采访时表示,公司已经向Stability AI发出了“诉前通知书”——一份即将在英国提起诉讼的正式通知。
华盖创意1995年成立于美国西雅图,首创并引领了独特的在线授权模式——在线提供数字媒体管理工具以及创意类图片、编辑类图片、影视素材和音乐产品,目前服务全球120多个国家和地区,全球设有65个分支机构。
AI绘画工具在过去一年迅速流行,艺术界对此反应强烈。虽然有些人说这些工具很有帮助,就像Photoshop一样,但更多人反对使用这类生成式人工智能。
像Stable Diffusion这样的工具依赖于人类创造的巨量图像来获取训练数据,而这些数据通常是在未经创作者知情或同意的情况下从网络上抓取的,且生成式人工智能可以用来模仿特定艺术家的风格。
人工智能公司声称,这种做法受到美国公平使用原则等法律的保护,但许多权利所有者不同意这种做法,称其构成侵权。法律专家在这个问题上意见不一,但一致认为,这类问题必须由法院来决定。

该案例将直接影响了日前我们所讨论的AI生成训练过程中涉及的海量素材是否需要版权授权,笔者会就该案件进行持续跟进,有最新进展会在公众号内发布。
观点&结论
就AI生成训练过程中涉及的海量素材是否需要版权授权,从我国的法律政策而言,已经明确约定不能侵犯他人的知识产权,故无疑是需要授权的。
但基于上周的讨论会,笔者想从“合理使用制度”“使用&生成阶段”重新分析这个问题,以下是笔者的个人观点。
笔者认为,如果认可版权的作用是"保护"创造性地表达思想或感受”的作品",而非保护数据(事实)和想法(文风、画风),从鼓励创新创作、鼓励科技发展的的立法目的,若AI实质上能够在原作品的基础上增加了新的价值的结果,应当属于合理使用。
例:“谷歌图书案”:Google通过数字化技术将图书转变为全面的单词索引系统,以帮助读者、学者和其他人寻找中意的图书。事实上谷歌将数以百万计的图书通过电子扫描的方式获得数字化后的电子版本,这些数以百万计图书显然是未经授权的,但是法院认为Google的使用行为没有“复制”原图书,因为它不是用来呈现图书的内容。相反,它在原作品的基础上增加了新的价值以促进新的信息、观点和创作的形成,构成合理使用。
就如果AI的训练的目的是为了促进科技进步,是否我们可以将AI 与版权的关系在”生成/使用阶段”和”AI 发展学习阶段”分开考虑。
正如谷歌图书案中,Google的使用行为没有“复制”原图书,因为它不是用来呈现图书的内容,代入在AI绘图产品,其训练行为并非是为了“复制”其原绘画作品,它也并非为了呈现绘图作品本身,故该训练行为应当也可以类比作为AI发展的学习阶段,构成合理使用,即海量素材无需授权。
当然,不乏有很多人利用该技术侵犯他人版权,但一般都是发生生成/使用阶段”。
如小红书原画师发现网友用小红书 Trik AI制作了与自己非常相似的作品,网友利用其现有的AI技术侵犯了原画师的版权。
如WormGPT案,网络罪犯利用Chatgpt为代表的生成式 AI 能生成类似人类的文本的技术,自动创建高度可信的钓鱼邮件。
故鉴于此,应当就生成/使用阶段进行严格规制,而不应当对AI 发展学习阶段限制,否则将严重阻碍技术的发展,同时从另一个角度而言对海量的素材全部进行授权从实操层面难度较高(其中还需要区分是否是否已经过了我国《著作权法》所规定的权利保护期),笔者建议直接将其分阶段讨论,就“AI生成训练过程中涉及的海量素材是否需要版权授权”归为AI学习阶段,无需得到授权;就AI生成/使用阶段出台相关政策法律严格限制,规制利用其技术的违法犯罪行为。
