摘要:AI编程工具的兴起使开源代码被大规模用于模型训练,由此引发的GPL传染性争议已从理论探讨转向司法实践。本文以Doe v. GitHub案为切入点,分析AI训练数据中GPL代码合规的三层法律问题——训练数据层、模型权重层与模型输出层,并结合美国、欧盟、中国的监管态度,提出企业合规路径。
关键词:GPL许可证;AI训练数据;模型权重;文本与数据挖掘;开源合规
一、现象:训练数据中的“隐形”开源代码
2022年11月,程序员兼律师Matthew Butterick联合Joseph Saveri律师事务所,在加利福尼亚北区联邦地区法院对GitHub、微软及OpenAI提起集体诉讼(Doe v. GitHub, Inc., No. 4:22-cv-06823-JST)。原告主张,GitHub Copilot在训练过程中使用了GitHub平台上大量受开源协议约束的代码,却在生成输出时剥离了版权管理信息(Copyright Management Information, CMI),涉嫌违反《数字千年版权法》(DMCA)第1202条及多项开源协议。该案原告寻求90亿美元的法定损害赔偿,并于2024年12月就DMCA第1202条(b)款是否要求“同一性”(identicality)提起中间上诉(No. 24-7700),目前第九巡回法院正在审理中。更具现实意义的是,AI生成代码的合规风险已从“模型训练端”延伸至“企业使用端”。开发者通过AI编程助手生成代码并集成到专有软件中时,若该代码与训练数据中的GPL代码构成实质性相似,则整个软件可能面临GPL传染性的约束。这一风险目前缺乏明确的司法判例指引,但已引起企业法务部门的高度关注。
二、核心法律问题:GPL传染性是否穿透至AI模型?
传统开源合规分析框架围绕“静态链接—动态链接—独立进程”的技术光谱展开(参见本系列专题六《兰迪研究丨开源协议专题(六)——衍生作品(derivativework)的认定标准》)。然而,当客体从“传统软件模块”转变为“AI模型及其输出”时,这一框架面临根本性的适用困境。
(一)基础概念澄清
在展开法律分析之前,有必要先厘清四个基础概念。具体如下:
1.模型权重(Model Weights)
模型权重是神经网络内部的可学习参数,以浮点数矩阵的形式存储,代表不同层之间神经元连接的强度。在模型初始化时,权重通常被设为随机小值;经过训练后,权重被“冻结”并保存,成为模型的“记忆”或“知识”载体。以GPT-3为例,其包含约1750亿个参数;Meta的Llama系列模型的参数规模亦在数十亿至数千亿之间。需要强调的是,权重文件本身不具备可读性——无法直接从中提取出任何具体的代码片段或文本内容,其知识以分布式编码的方式存储于整个网络之中。
2.模型训练过程
模型训练通常包括以下步骤:首先,将原始文本(包括源代码)通过“分词”(Tokenization)切分为离散的token单元;其次,通过“嵌入”(Embedding)将每个token映射为高维向量;随后,这些向量在神经网络的各层之间传递,权重决定每个神经元对下一层的影响强度。训练过程中,模型通过“前向传播”(Forward Pass)生成预测结果,再通过“损失函数”(Loss Function)计算预测误差;随后利用“反向传播”(Backpropagation)算法,逐层调整权重以减小误差。这一循环重复数百万次后,权重逐渐稳定,模型便“学会”了训练数据中的统计规律。
3.架构、权重与推理代码
一个可运行的AI模型由三部分组成:(1)模型架构(Architecture),即神经网络的层级结构、连接方式及激活函数等设计,通常以代码形式实现;(2)模型权重(Weights),即训练完成后保存的参数文件;(3)推理代码(Inference Code),即加载权重、接收输入并生成输出的程序。其中,架构与推理代码属于可执行的计算机程序,受著作权法保护;而权重文件本身是否构成独立的“作品”,目前在法律上存在争议——因其缺乏人类可读的表达形式,且知识以分布式方式编码,难以对应到具体的独创性表达。
4.文本与数据挖掘(Text and Data Mining, TDM)
文本与数据挖掘是指对大量数字化文本和数据进行自动化分析,以发现模式、趋势及相关性的技术过程。欧盟《数字单一市场版权指令》(Directive (EU) 2019/790,以下简称“DSM指令”)第4条规定,对合法可访问的作品进行TDM属于版权例外,但权利人可通过机器可读的方式(如robots.txt)保留其权利(opt-out)。若权利人有效行使了退出权,则TDM例外不再适用,使用方需获得许可。这一机制是理解欧盟AI训练数据合规框架的关键。
(二)核心法律问题:AI模型训练涉及的开源合规风险
1.训练数据层:使用GPL代码训练是否触发传染性?
GPL v2第2条约束的是“基于本程序形成作品”(work based on the Program)。模型训练过程中,GPL代码被转化为token序列、嵌入向量,最终沉淀为权重矩阵中的浮点数值。从形式上看,权重文件并非代码的“翻译”或“改编”,而是一种全新的、不可读的数学表达。然而,若从功能主义视角审视,模型之所以能够生成与GPL代码功能相似的输出,恰恰源于其对训练数据的学习——这种“功能继承”关系是否足以构成GPL意义上的“衍生作品”,目前全球司法实践尚未给出明确答案。
2.模型权重层:权重文件是否受GPL约束?
这是GPL传染性分析的前提性问题。若权重文件本身不构成著作权法意义上的“作品”,则GPL协议对其无从适用。即便将模型整体(架构+权重+推理代码)视为软件系统,其中架构与推理代码部分若系独立开发,亦不必然受GPL约束。但一个更为棘手的问题是:若模型权重的生成过程被认定为对GPL代码的“改编”,则权重文件是否应被视为GPL代码的衍生作品?这一问题的答案,将直接决定开源模型(如Llama、DeepSeek)的权重发布是否需遵循GPL义务。
3.模型输出层:AI生成的代码片段是否"继承"GPL传染性?
这是企业最关切的问题。当开发者将AI生成的代码集成到专有软件中时,该代码是否受GPL约束?从现行法律框架分析,存在两种对立路径:
路径一:若AI输出与训练数据中的GPL代码构成“实质性相似”(substantial similarity),则该输出本质上是对原代码的“复制”或“改编”,应继承原代码的许可证义务。在罗盒诉风灵案中,法院认定已适用GPL v3协议的代码版本将永久保持开源,其核心逻辑正是基于“后续版本使用了先前开源版本中的源代码”这一事实。若AI输出与GPL训练数据存在代码级相似,类推适用该逻辑,输出代码应受GPL约束。
路径二:AI模型对训练数据的学习是“风格模仿”而非“代码复制”,输出代码是模型基于概率分布重新生成的表达,与任何单一训练样本均不构成实质性相似。Google LLC v. Oracle America, Inc.案的裁判逻辑可提供参照:法院认定,谷歌为互操作性目的重新实现Java API声明代码构成“合理使”(fair use),其核心在于“重新实现”具有转换性。同理,AI模型对GPL代码的“重新实现”——即使功能相似——也可能因表达形式的差异性而免于GPL约束。
上述两种路径的交锋,本质上反映了“代码的功能性”与“表达性”在AI场景下的重新博弈。在司法实践明确之前,企业应采取保守合规策略:假设AI输出可能触发GPL传染性,提前建立隔离与审查机制。
三、全球监管态度比较
(一)美国:合理使用抗辩与Copilot诉讼的启示
美国是目前AI代码生成诉讼最为活跃的司法管辖区。Doe v. GitHub案的最新进展表明,法院对AI训练数据的版权侵权指控持审慎态度。2024年6月至7月,加州北区法院先后驳回了原告的大部分DMCA主张及州法索赔,保留了包括开源许可证违约在内的部分指控继续审理。法院的核心顾虑在于:原告未能提供充分证据,证明Copilot的输出与特定GPL代码之间存在"同一性"(identicality)或实质性相似。
然而,2025年2月11日,特拉华州联邦地区法院在Thomson Reuters Enterprise Centre GmbH v. Ross Intelligence Inc.案中,在审理时认定Ross的合理使用抗辩不能成立。该案中,Ross Intelligence使用Thomson Reuters的Westlaw法律摘要(headnotes)训练其法律研究AI工具,法院认定该行为不构成合理使用(fair use),并指出Ross“旨在通过开发市场替代品与Westlaw竞争”。值得注意的是,该案属于非生成式AI场景,且法院特别强调被告与原告之间存在直接商业竞争关系,因此其对生成式AI训练的类推适用性有限。
此外,美国版权局已明确表态:纯AI生成内容不受版权保护;但若开发者对AI输出进行了实质性修改,则可对修改部分主张版权。这一规则对开源合规具有双重影响:一方面,企业可通过“人工重构”切断AI输出与训练数据的法律关联;另一方面,若重构不足,则AI输出的“非版权性”可能使其更易被认定为训练数据的直接复制,从而触发GPL传染性。
(二)欧盟:AI法案与版权指令的交叉适用
欧盟《人工智能法案》(Regulation (EU) 2024/1689)于2025年8月2日起对通用人工智能模型(GPAI)提供者产生约束力。该法案第53条第1款(c)项明确要求GPAI提供者制定符合欧盟版权法及相关权利法的政策,特别是通过最先进的技术识别并遵守DSM指令第4条第3款所规定的、以适当方式表达的权利保留。这意味着,GPAI提供者必须建立机制,识别训练数据中权利人通过机器可读方式(如robots.txt)表达的TDM退出声明,并排除相应内容。
DSM指令第4条规定的TDM例外,是欧盟法下AI训练数据使用的主要法律依据。该例外允许对合法可访问的作品进行商业目的的文本与数据挖掘,但前提是权利人未以机器可读方式保留权利。对于开源代码而言,这一机制产生了特殊的法律效果:GPL协议本身并未明确禁止将代码作为训练数据使用,但GPL协议的权利人是否可以通过robots.txt等方式行使TDM退出权,从而阻止AI模型对其代码进行训练,目前尚无明确判例。若权利人成功行使退出权,则AI提供者的训练行为将失去TDM例外的庇护,需另行获得许可。
此外,欧盟《数字市场法》(DMA)对科技巨头的生态封锁行为保持高度关注。微软对Cursor的技术封锁事件(参见本系列热点评论篇)在欧盟引发讨论,监管机构认为此类行为"与开源精神背道而驰"。这一态度可能延伸至AI训练数据领域:若科技巨头利用开源代码训练模型,再通过闭源产品排除竞争对手,可能触发DMA的滥用规制。
(三)中国:《生成式AI服务管理暂行办法》的合规框架
中国《生成式人工智能服务管理暂行办法》(以下简称《暂行办法》)第7条第(二)项规定,生成式AI服务提供者"涉及知识产权的,不得侵害他人依法享有的知识产权"。这一条款为训练数据中的开源代码合规提供了直接的监管依据。
结合本系列专题二对GPL协议法律性质的分析,GPL v3在中国司法实践中已被认定为“附解除条件的非典型著作权许可使用合”(罗盒诉玩友案)。若AI服务提供者在训练过程中使用了GPL代码,却未在模型输出中保留版权声明与许可证信息,可能构成对GPL协议的违反,进而导致授权自动终止。在此情况下,提供者继续使用、分发该模型或其输出,将因丧失权利基础而构成著作权侵权。
在输出端侵权责任方面,广州互联网法院审理的“奥特曼案”(2024年2月8日判决)具有重要参考价值。该案中,法院认定生成式AI服务提供者因欠缺投诉举报机制、潜在风险提示和显著标识,未尽到合理注意义务,应承担侵权赔偿责任。该案虽涉及奥特曼形象而非开源代码,但其确立的“平台注意义务”框架可直接类推适用于AI生成代码的开源合规场景:若AI服务提供者未建立有效的开源许可证识别与过滤机制,导致用户生成侵权代码,提供者可能因未尽注意义务而承担帮助侵权责任。
此外,中国法院在GPL传染性认定上已确立“功能耦合”标准(罗盒诉玩友案)。若AI生成代码与企业的专有软件在功能上形成“高度耦合”且“不可分割”关系,即使该代码仅占整体软件的极小比例,仍可能导致整个软件被认定为GPL代码的衍生作品。这一标准对企业使用AI生成代码的合规审查提出了极高要求。
四、多维度合规治理,有效降低开源合规风险
面对AI训练数据开源合规的不确定性,企业应建立"预防—检测—响应"的多维度、全流程治理体系。
(一)训练数据端:建立AI训练数据SBOM
将软件物料清单(SBOM)的概念延伸至AI训练数据领域,要求AI工具提供商披露训练数据集中开源代码的许可证构成。具体包括:(1)训练数据中MIT、Apache-2.0、GPL、LGPL、AGPL等协议的比例;(2)高传染风险代码的过滤或标记机制;(3)数据来源的合法性证明。在采购AI编程工具时,企业应在合同中明确要求提供商承担训练数据合规保证义务,并设置赔偿条款。
(二)输出端:集成代码溯源扫描
在CI/CD流程中嵌入自动化扫描工具(如ScanCode Toolkit、FOSSology),对AI生成的代码片段进行许可证指纹识别。具体动作包括:(1)要求研发团队对AI生成的代码进行明确标注,便于后续审查追溯;(2)对AI输出与已知GPL代码库进行比对,识别高相似度片段;(3)对检测出的高风险代码片段,优先替换为MIT/Apache-2.0许可的等效实现,或通过人工重构切断法律关联。
(三)架构端:强化模块边界隔离
参照本系列专题六提出的“十种模块沟通方”与“五大审查维度”,将AI生成代码视为“高风险输入源”,在架构设计时采取隔离措施:(1)容器化隔离:将AI生成代码的运行环境部署在独立Docker容器中,通过操作系统级隔离降低GPL传染风险;(2)网络/RPC通信:若AI生成代码需与专有软件交互,优先采用HTTP/gRPC等标准化接口,避免代码级集成;(3)功能解耦:确保AI生成代码仅承担辅助功能,而非产品核心功能,降低"功能耦合"认定风险。
(四)合同端:明确知识产权归属与免责
在AI服务协议及企业内部开发规范中,明确以下条款:(1)生成代码归属:约定AI生成代码的知识产权归企业所有,但企业需对代码的许可证合规性负责;(2)合规保证:要求AI工具提供商承诺其训练数据不侵犯第三方开源协议,并定期提供合规审计报告;(3)在对外提供的产品许可协议中,明确知识产权风险提示条款。
五、结论与展望
AI训练数据中的开源合规问题,是技术演进速度远超法律适应能力的典型领域。目前全球尚无明确判例回答“GPL传染性是否穿透至AI模型”这一核心问题,但风险正在从“理论争议”快速转向“实际诉讼”。
对中国企业而言,在《生成式人工智能服务管理暂行办法》的框架下,训练数据合法性已从倡导性要求变为强制性义务。结合中国法院对GPL协议“功能耦合”的实质审查标准,企业若将AI生成代码直接集成到核心产品中,且未建立有效的溯源与隔离机制,一旦该代码与GPL训练数据构成实质性相似,将面临整体开源的严峻后果。
因此,在法律不确定性持续存在的阶段,企业应采取保守合规策略:假设AI输出可能触发GPL传染性,提前在训练数据审查、输出检测、架构隔离、合同设计四个维度建立防御体系。同时,密切关注Doe v. GitHub案的后续进展、欧盟AI法案的执行实践,以及中国首批AI训练数据侵权案件的裁判规则,及时调整合规策略。
参考资料
[1]Doe v. GitHub, Inc., No. 4:22-cv-06823-JST (N.D. Cal.).
[2]Doe v. GitHub, Inc., No. 24-7700 (9th Cir. interlocutory appeal filed Dec. 23, 2024).
[3]Thomson Reuters Enterprise Centre GmbH v. Ross Intelligence Inc., No. 1:20-cv-613-SB, 2025 WL 458520 (D. Del. Feb. 11, 2025).
[4]Google LLC v. Oracle America, Inc., 593 U.S. ___ (2021).
[5]Regulation (EU) 2024/1689 of the European Parliament and of the Council of 13 June 2024 laying down harmonised rules on artificial intelligence (AI Act).
[6]Directive (EU) 2019/790 of the European Parliament and of the Council of 17 April 2019 on copyright and related rights in the Digital Single Market (DSM Directive).
[7] 《生成式人工智能服务管理暂行办法》(国家互联网信息办公室等七部门,2023年7月13日公布,2023年8月15日施行)。
[8]广州互联网法院奥特曼案(全球首例AIGC平台侵权案,2024年2月判决)。
[9]广州知识产权法院(2019)粤73知民初207号民事判决书(罗盒诉玩友案)。
[10]Kocetkov, D., et al. "The Stack: 3 TB of permissively licensed source code." arXiv:2211.15533 (2022).
[11]Lucchi, N. "Generative AI and Copyright: Training, Creation, Regulation." PE 774.095, European Parliament Committee on Legal Affairs (JURI), July 2025.
[12]BigCode Project. "The Stack v1.1 Dataset Card." Hugging Face, 2022. https://huggingface.co/datasets/bigcode/the-stack
开源协议专题(七):如何在AI训练中降低开源合规风险
作者:黄克来源:兰迪律师

摘要:AI编程工具的兴起使开源代码被大规模用于模型训练,由此引发的GPL传染性争议已从理论探讨转向司法实践。本文以Doe v.