学习心得
生成式人工智能降低了创作门槛,使我们重新回到著作权法立法目标以及核心保护的法益。Pamela Samuelson的《GenerativeAImeetscopyright——OngoinglawsuitscouldaffecteveryonewhousesgenerativeAI》综合分析了美国正在进行的针对生成式人工智能的诉讼,尤其是引入了此前的判例,从原告和被告方的视角选取可以采用的角度。这一场左右互搏式的引经据典,让我们深刻地感受到生成式人工智能对于著作权法的冲击,尤其是将受版权保护的作品作为训练数据是否侵犯著作权,生成式人工智能输出的内容是否侵犯了衍生作品。这些诉讼仍在早期,利益相关者的争论也在继续,期待着新的思路和视角。
诉讼背景
生成式人工智能是一项具有争议的技术,一方面被广泛接受,可以在更广范围的研究和创作,另一方面很多艺术家、作家对于使用其作品进行训练,且不支付任何费用表示很剧烈的反对。正在美国进行的著作权诉讼将预示着未来生成式人工智能的走向。
著作权保护和科技发展已经不是第一次发生冲突了,比如录像机的诞生、互联网的诞生。每次发生冲突时,法院会从选择什么路径是更符合宪法上赋予著作权的目的,宪法要求促进科学和有价值的艺术的发展,也就是说为了公众利益促进创作和传播知识。
目前正在进行的三个著作权侵权诉讼,其中两个诉讼案件的被告均为Stability AI(开发了一款图片生成工具Stable Diffusion),一个原告是Getty Images,另一个是集体诉讼,均诉称未经许可复制其作品训练其模型,且依据用户指令生成的图片侵犯其衍生作品。第三个诉讼案件是Doe v. Github,Inc,直指OpenAI开发的Codex,基于大量的开源软件代码训练的大模型,以及Open AI和Github合作开发的Copilot,基于Codex提供的代码开发协助工具。
获取训练数据
原告诉称Stable Diffusion包含了其作品的复制件,然而这是技术上的错误。Stable Diffusion包含极大数量的参数,但是不包含任何图片的复制件。训练模型需要现将作品进行数字化(tokenizing),才能作为训练数据。模型会使用这些token来进行关联性分析,通常是极大数量的分析。从本质上讲,这种模式是通过提取和分析作品中离散元素的精确事实和它们之间的关联,来确定哪些其他离散元素与这些元素相关或不相关,以及在不同背景下这些关联存在或不存在的频率。
从另一个方面看,Stability AI没有提供训练的数据库。而Stable Diffusion是在LAION-Aesthetics数据库基础上训练的。LAION是德国的非营利性组织所开发的,该数据库包含了超过6亿经过人工选择的以及经过机器学习进行艺术排名,公开该数据库提供给希望据此训练大模型的企业。LAION建立该数据库很有可能是具有合法性的,欧盟规定了非盈利性研究组织复制受著作权保护的作品用于数据挖掘(Text and data mining,TDM)目的是可以豁免的。欧盟在认可了TDM作为一种研究手段可以帮助研究者创造知识,具有社会价值。但是该豁免不能超越合同约定。欧盟又有第二项豁免,针对商业行为者从事TDM可以获得豁免,然而著作权人可以选择退出。
目前来说Stability AI虽然也提供开源方式,但是同样提供订阅服务给用户根据指令生成图片。使用享有版权的图片作为训练数据,目前仍可能存在临时复制件。Stability AI可能会主张合理使用。
合理使用
在美国法项下,合理使用享有著作权保护的作品是不构成侵犯版权的。法院在裁定合理使用时考虑到四个因素:(1)使用的目的;(2)作品的性质;(3)使用的数量和实质占比;(4)对受著作权保护的作品市场利益的影响。其中目的和市场影响是最重要的因素,但是四个因素需要统筹一起来看。
Stability AI原告很有可能主张使用其作品作为训练数据是非转换性使用和商业化使用。但是有些法院裁定数字化受版权保护的作品构成转换性合法使用。如Authors Guild v. Google案中,法院裁定谷歌将研究图书馆收藏的数百万本图书数字化,为其内容编制索引,并在用户搜索查询时提供一些图书内容片段,是一种 "转换性"合理使用。虽然谷歌的使用目的是商业化的,但是不等同于图书销售的商业化。谷歌的行为更促进了公众接触到这些研究书籍,类似于TDM作为一种新的研究手段一样。当然,Stability AI案原告也可能会主张其图片作品是不同于图书馆内的书籍的,而且该案被告也不是将其作品提供给公众。
同时,法院可能会询问复制作品对于转换性使用是否是必须的,在Authors Guild v. Google中法院认可谷歌提出的不复制内容无法实现建立索引。Stability也可能会做出类似抗辩。
关于市场利益影响,Getty作为原告的案件里提出了有利的论证,其基于许可模式收费,而目前Stability AI基于其数据训练了生成式人工智能,直接产出作品,影响其许可收费模式。关于这点也无法完全解决转换性使用的问题,比如2021 Google v. Oracle案中,最高法院驳回了Oracle关于Google使用部分 Java 应用编程接口 (API) 剥夺了Oracle声称有权获得的许可收入的论点。法院指出,法院应考虑受质疑的使用所带来的公共利益、潜在的收入损失以及受质疑的使用所带来的创造性,并将其与潜在的损失进行权衡。不仅谷歌的Android平台以及大量高度创新的软件产品均使用了涉案内容创造了大量的软件程序。因此,法院更倾向于保障公共利益,遵循宪法规定,促进技术和艺术的发展。因此,Stability也很有可能提出有利于公共利益和促进创作的论点,有大量的基于Stability AI的创造性使用,甚至包括很多艺术家基于此诞生新的灵感。
然而Stability AI案原告也会基于Andy Warhol Foundation for the Visual Arts, Inc. v. Goldsmith 2023案中的倾向,转换性使用的判定更重要的是所涉作品的使用是否具有与涉案作品的原使用目的有不同。Stability AI也会强调将作品作为训练数据与作品出版是截然不同的。
另一个对 Stability AI 的合理使用抗辩不利的是,Stable Diffusion 制作的图像是否侵犯了其 LLM 所训练的图像作者的衍生作品权。
输出构成侵权
针对 Stability AI 的集体诉讼指控称,Stable Diffusion 产出的所有图像都是侵权衍生作品,因为所有图像都来自其模型训练的图像。因为产出的图像可能与艺术家的作品产生竞争,从而影响他们的市场利益。用户很有可能在提示词要求绘制采用哪位艺术家特定风格的图像。但是,证明衍生作品构成侵权仅仅证明基于前一部作品是不够的,需要证明来自前一部作品实质数量的原创性表达。集体诉讼的原告也承认Stable Diffusion基于用户指令产出的图像无法识别与训练数据中的某幅作品能很相似。即使以哪位艺术家的风格所产出的图像也很难构成侵权,因为著作权法不保护所谓风格。
之所以不会构成实质性相似,与Stability Diffusion的机制有关。生成式人工智能构建模型时需要处理大量的输入数据,以产生图像元素的抽象表征,如猫在油毡地板上玩球。在生成图像时会增加噪声。文本描述和图像配对会使抽象表征聚类,从而具有了相似表征的类似性。当用户输入提示,要求软件生成特定类型的输出时,生成式人工智能系统就会使用复杂的统计计算、预测将符合用户要求的输出结果。
但是,这不代表生成式人工智能的产出不会构成侵权。比如同一个输入形象(如米奇)在大量作品中出现,将这些作品用来训练模型,而开发者又不遵循最佳实践,去除重复内容、或不增加侵权过滤等,那么用户的某些指令就可能导致侵权。
目前来说很难证明Stability Diffusion产出的作品构成实质性相似,但仍然可以主张会与其原作品构成市场竞争,引用最高法院 Goldsmith案的裁决,将竞争性使用用于评价公平性。Stability AI只能从作品的差异性来进行抗辩。
生成式人工智能遭遇版权保护-学习笔记
作者:朱玲凤来源:那一片数据星辰

学习心得 生成式人工智能降低了创作门槛,使我们重新回到著作权法立法目标以及核心保护的法益。