TDM技术的风险及合规建议——基于全球首例TDM判决的启示

来源:宁人律师事务所

文章摘要
一、TDM技术及其风险 (一)TDM技术 文本与数据挖掘技术(Text and Data Mining,TDM)本质上是一种知识发现的过程,它通过自动化手段分析大量数据,以揭示隐藏在数据背后的模式和知

一、TDM技术及其风险
(一)TDM技术
文本与数据挖掘技术(Text and Data Mining,TDM)本质上是一种知识发现的过程,它通过自动化手段分析大量数据,以揭示隐藏在数据背后的模式和知识。TDM技术路径涉及多个步骤和技术,包括数据预处理、特征提取等。TDM技术的第一步是获取和清理数据。这通常包括从各种来源导入数据,并去除噪声信息,如广告、导航栏和代码等。其次,是将数据转换为机器可以理解的形式。最后,还需通过算法识别数据中的模式、趋势和关联,利用统计、机器学习和其他分析技术,从数据中发现新的知识。
(二)TDM技术的知识产权风险
1.版权风险
TDM技术在进行复制作品时,获取受著作权保护的作品,无论其基于何种目的,基于当前法律制度,会有极高可能被认定为侵犯著作权;且基于当前合理使用穷尽式的列举与TDM技术本身的特质,无法通过合理使用规则来进行规避。
TDM技术所采取的数据有众多来源,在复制作品进行机器学习时,基于TDM技术的最终使用目的,大模型在进行学习后使用受著作权保护的作品提取出的特征,最终的输出内容可能侵犯被学习作品的著作权。
2.不正当竞争风险
当前主流数据集如Wikipedia、WebText2、LAION等,在进行TDM技术时均采用爬虫的技术进行收集。在使用爬虫时应当考虑包括被爬取数据的企业是否和自己具有竞争关系、爬取的方式和爬取数据的频率是否合适、是否违反网站的robots协议强制等,如果上述行为没有加以考虑可能会因爬取行为构成不正当竞争而承担赔偿责任。
二、域外TDM例外规则及审判实践
(一)域外TDM例外规则
1.欧盟
欧盟《数字化单一市场版权指令》中关于TDM技术的例外规则主要包含两个方面。《数字化单一市场版权指令》第3条主要适用于研究机构和文化遗产机构,允许其在合法获取内容的前提下,复制和提取作品或其他受保护对象的内容,以进行科学研究。但这些行为仅限于科学研究目的,并且需要满足一定的条件,例如数据的存储和使用需符合安全标准。《数字化单一市场版权指令》第4条则允许任何类型的受益人(包括私人主体)在合法获取内容的情况下,复制和提取作品或其他受保护对象的内容,用于商业目的。但这一例外附带了严格的限制条件,例如权利持有人可以通过“机器可读方式”明确保留其权利,或者通过合同协议等方式明确排除该例外的适用。
2.英国
英国的TDM例外规则主要体现在其版权法中。根据英国《版权、外观设计和专利法》第29A条,自2014年起,英国允许非商业性研究目的的TDM技术应用,但这一例外仅适用于合法获取的受版权保护的作品。这意味着,研究人员可以复制任何受版权保护的材料进行计算机分析,但前提是这些材料是通过合法途径获得的,并且该活动是为了非商业研究目的。英国政府在2022年提出了扩大TDM例外范围的提案,旨在允许出于任何目的对受版权保护和数据权保护的作品进行TDM,包括商业用途。然而,这一提案在创意产业中引发了争议,因为一些人担心这可能会导致艺术家在AI公司商业使用其作品时没有经济回报。
3.日本
《日本著作权法》第三十条第4款中规定了不以享受作品思想或情感表达情形下,在使用的必要限度内,可以以任何方式进行信息分析活动,只要不对著作权人产生不当损害的内容;在第47条第5款处规定了为了提供新的知识和信息,进行信息处理的人可以对他人作品在必要限度内复制和向公众提供,并对整理后的作品在实现此目的的必要限度内向公众提供,但同时强调上述行为不得对著作权人利益造成不当损害。
4.美国
美国《版权法》第一百零七条规定了合理使用制度,并以四要素作为判断标准,通过综合分析使用者的使用是否符合相关法定要素来判断该使用是否为合理使用。因此,美国针对TDM技术无需新增例外规则。具体而言,四要素标准指的是:第一要素要求该使用是非商业性使用或者是基于非营利性教育目的之使用。第二要素需要考虑的是究竟被使用的作品是描述事实的叙事作品或创作性很强的虚构作品。通常来说,作品的创作性越强,就越应受到法律保护。第三要素要求对使用行为不仅要进行定量分析,还要进行定性分析。被告的使用对版权作品市场的影响。第四要素规定,若被告的使用行为减少了版权人的收益,则被告的使用可能会被认定为不合理的使用。
(二)全球首例TDM技术判决
1.案件背景
Robert Kneschke曾将其摄影作品发布在图片公司“bigstock photo”的网站上,且该图片网站的使用条款明确规定,禁止自动化程序抓取和使用图片。LAION从公开数据源中下载了该照片,并将其纳入LAION-5B数据集。Kneschke通过某平台发现自己的作品链接出现在LAION数据集中,认为LAION未经授权复制其作品并用于AI数据集的创建,侵犯了其的版权,因此提起诉讼,要求禁止LAION的复制行为并进行赔偿。
2.审理焦点
经过审理,法院认为本案争议焦点如下:(1)该AI数据集对图片的使用是否侵犯原告著作权?(2)网站声明是否构成有效的权利保留?(3)被告是否适用TDM的版权例外情形?(4)LAION的AI数据集是否具有营利性?
3.裁判理由分析
法庭勘验原告电脑里的原始数据后认定原告是该图片的作者,受到著作权的保护。而被告将原告图片下载存储,事实上构成复制争议图片。根据《德国版权法》第44a条中,“临时复制”例外适用于短暂且自动删除的技术性存储,如缓存或传输中的中间存储。而LAION的下载行为是有意的,具有明确目的行为,即验证图像和文本描述的对应关系。因此,该复制过程非短暂性,也非偶然存储,不符合第44a条例外的条件。法院认定涉诉图片受版权法保护,被告下载并存储该图片的行为构成复制权的行使。
LAION的下载行为旨在获取信息,即通过分析图像与文本描述的匹配性来提取相关信息,属于《德国版权法》第44b条中TDM例外规则的核心内容。此外,原告网站的声明采用自然语言描述而未采用机器可读格式,因此不构成法律上有效的权利保留,该声明不足以对被告的TDM活动产生法律约束。法院认定被告的行为符合TDM活动的要求,适用《德国版权法》第44b条中的限制条款。法院对《德国版权法》第60d条中“科学研究”进行广义解释,科学研究不仅涵盖直接获取知识的过程,还包括为后续研究准备数据集的步骤。因此,LAION的行为被视为科学研究的一部分。此外,LAION将数据集免费向公众开放,且组织本身为非营利性质,即使商业公司使用其数据集,也不会改变其研究性质。
最终,法院认定被告的行为符合第60d条规定的合理使用情形。已经构成第60d条这一合理使用情形,则无需要再评价被告行为是否属于44b条这一合理使用情形,故被告不构成版权侵权。
三、我国合理使用规则与TDM技术的不适应性分析
虽然在国际上,如欧盟和美国,已经通过立法或司法途径对TDM进行了合理使用的界定.例如,欧盟将TDM的合理使用范围限制在科研及文化遗产机构。但我国《著作权法》目前尚未明确规定TDM行为的合理使用规则。其原因在于,我国著作权法采用的是列举的立法模式,即合理使用情形被限定在法律条文中明确列出的几种情形中。这种模式使得法律在面对新兴技术如TDM时显得不够灵活,难以适应快速变化的技术环境。
(一)我国著作权法中的合理使用采用列举方式限制了范围
我国并没有TDM例外规则相对应的法条,著作权法中的合理使用条款与其较为相似。《中华人民共和国著作权法》第二十四条列举了多种情形下的合理使用行为。这些情形包括个人学习、研究或欣赏,适当引用他人作品,新闻报道,教学科研等。构成合理使用的要件主要包括以下几个方面:作品必须已经发表:被使用的作品必须是已经公开发布的;使用作品的目的必须是出于非商业用途;合理使用不得影响该作品的正常使用,也不得不合理地损害著作权人的合法利益;在合理使用过程中,还需尊重被使用作品著作权人的著作人身权,注明作者姓名和作品名称。我国并没有将TDM技术列举在内,故TDM技术并不能作为“例外”情形落入我国合理使用制度范围之内
(二)TDM技术的复制目的突破了著作权保护的初衷
在数据收集、预处理和模型训练阶段,作品经历了多次转换和抽象处理,并非简单的复制。TDM的复制步骤与传统著作权法中的复制行为在实质上不同,这一步骤的目的不是展示或分发复制品,而是优化算法模型。大模型深度学习时需要大量数据集投喂,其中可能包括文本、图像、音频、视频等受版权保护的作品,然而这些作品会经过清洗、标注等步骤转换为大模型易于处理、学习的格式。这一过程中,虽然原始作品被读取和解析,但并未形成与原作相同或完全一致的复制品,而是转化为模型能够理解的形式特征或编码,且这些训练数据并未对外展示或传播。
(三)TDM技术所挖掘数据本身不受著作权保护
著作权法不保护基本数据、事实和概念。TDM技术复制作品的目的是其中事实,而并非由著作权法保护的作品的表达。数据集在复制作品时,本质也是为了提取作品中的事实要素。人工智能实质上是人类创作的工具,算法黑箱技术的本质是利用算法对数据集进行事实要素的转化与学习,是机械的转码,它无法理解作品独创表达性。例如大模型学习图像作品的过程,是为了通过鉴赏艺术画作,提炼视觉元素的特性和组合规律,掌握色彩与形态间的相互作用原理,最终创作出符合美学原理的艺术作品。因此,在人工智能训练过程中,如果仅使用了如事实、数据及概念等抽象元素,而未涉及具体表达形式,即使这些素材来源于受著作权保护的作品,此类使用也应视为合法行为。
四、TDM技术的合规建议
TDM技术复制行为为获嗯取数据来源时对受著作权保护的作品进行复制,此行为与一般的复制行为无异。在我国当前制度下,合理使用中直接列举复制的行为仅为“图书馆、档案馆、纪念馆、博物馆、美术馆、文化馆复制作品”,此条款对于复制的行为主体要求限制为图书馆等事业单位,这意味着任何除这些单位之外的组织都没有复制作品的权利。TDM中复制行为在人工智能领域最为显著的目的还在于,在大模型领域复制作品并不是目的,而是机器提取作品特征转化为机器语言形成数据集人工智能供大模型进行学习的步骤,该行为的最终目的为大模型通过学习机器语言根据自身算法进行输出。我国合理使用规则与当前大模型数据集复制作品的行为并没有进行合理匹配,即当前数据集在国内获取数据时复制作品进行学习无法利用合法使用规则进行创新,规避后续侵权的风险,故本节为企业提出该技术合规建议。
(一)避免抓取被禁止的页面
当爬虫访问一个网站时,它会首先检查该网站根目录下的robots.txt文件。如果存在该文件,爬虫程序会根据文件中的指示来确定哪些页面可以抓取,哪些页面不可以抓取。因此,开发者必须严格遵守这些指示,避免抓取被禁止的页面。爬虫应该尽量模仿正常用户的行为,例如设置合理的访问频率和时间间隔,以避免对服务器造成过大的负担。这不仅有助于遵守Robots协议,还能减少被封禁的风险。为了进一步模拟正常用户的访问行为,爬虫可以使用不同的用户代理和来源地址。这样可以降低被网站识别为恶意爬虫的可能性。爬虫应该能够处理各种异常情况,例如网络错误、超时错误、状态码错误等,并采取相应的措施,例如重试、跳过、记录等。这有助于确保爬虫在遵守Robots协议的同时,能够稳定运行。
(二)事先获得授权许可
在进行TDM时,基于当前法律制度,爬取受著作权保护作品极易被认定为侵权,数据集企业应在爬取数据前应该与网站或者数据库,作者等著作权人展开合作,获得使用作品授权。此外,在学习了作品之后,人工智能在输出内容应该注重内容审核,避免生成内容直接局部或者全部复制作品。
(三)加强过程可追溯性
生成内容的水印标识为便于追踪和管理,企业应在生成内容中添加水印标识。根据生成式人工智能服务内容标识办法,人工智能服务提供者向公众提供生成文本、图片、音频和视频等内容时应对生成内容进行标识。水印可以包含生成时间、来源、作者等信息,有助于提高内容的可追溯性。在发现问题时,可迅速定位责任人,降低风险。生成内容溯源为确保生成内容的可追溯性,企业应建立生成内容溯源机制。记录生成内容的全过程,包括数据来源、生成算法、审核流程等。一旦发现内容存在问题,可迅速追溯到源头,采取措施予以整改。

技术驱动法律,专业成就未来