序言
2024年开始,本公众号的AI专题将从国家、国际组织的立法、规则等宽泛梳理,进化到专题性梳理。本周聚焦开源人工智能。开源软件是一个成熟的概念,并在软件行业有了很成熟的应用。在人工智能领域,开源在2023年也有了很显著的推进,根据Github的年度统计,我们看到,越来越多的开发人员开始尝试使用 OpenAI 和其他人工智能公司的基础模型,开源生成式人工智能项目甚至进入了 2023 年按贡献者数量排名的十大最受欢迎开源项目。根据Hugging Face在年度总结中提到,使用开源的AI开发者增加了4倍。其预言在2024年开源大模型的能力可能与闭源的大模型持平。
开源人工智能在国际立法上也是有很大的争议和讨论,是否应当对开源人工智能给予豁免,是个无法避开的问题。
今天推送第二篇开源人工智能许可证的实践负责任人工智能许可证(Responsible AI License,以下简称RAIL)。
过往推送:
第一篇 开源人工智能的定义讨论(见本公众号的上一篇)。
01关于RAIL倡议组织
RAIL 倡议组织成立于 2019 年,旨在倡导在许可和合同中采用基于行为的使用限制,以降低开源人工智能技术带来的危害风险。
第一批负责任人工智能许可证("RAIL")已发布,用于许可源代码和最终用户软件,以展示如何将行为使用限制纳入许可证和合同以限制使用。
自第一批许可证的开发和发布以来,RAIL 倡议组织一直与人工智能社区合作,收集反馈并不断改进。例如,正在与 IEEE-SA 合作开发 RAIL 开发人员可以采用的标准。还在 2020 年组织了一次 AAAI 春季研讨会,讨论与 RAIL 的创建、开发和采用相关的问题,在2022年ACM FAccT 会议上的一篇论文还讨论了 RAIL 许可证的运作框架以及未来可能面临的挑战。2022年更是将RAIL许可证升级到了OpenRAIL。
02从RAIL发展到OpenRAIL
OpenRAIL是对与人工智能有关的组件(数据、源代码、模型、应用程序和服务)增加行为限制的许可证,该限制包括:
-行为使用限制,禁止/限制被许可人的某些应用场景;以及
-要求下游使用(包括再分发)至少包括同样的行为使用限制。
基于其约束组件的不同,设置了不同的RAIL许可证,也可以进行组合使用,其组件包括:
-数据:用于预训练或训练人工智能模型的数据集;
-应用程序/服务:任何可执行软件代码或应用程序,包括基于 API 的软件远程访问;
-模型:基于机器学习的组件(包括检查点),由学习到的权重和参数(包括优化器状态)组成,对应于模型架构;
-源代码:与人工智能系统相关的源代码和脚本。
同时,对于开放部分,建议每份RAIL许可证上增加Open,明确许可证颁发者免费提供被许可的组件,并允许被许可人重新许可他们所选择的组件或任何后续衍生作品,只要 "使用限制 "同样适用于重新许可的组件及其后续衍生作品。
具体许可证的选择方式可参考下图:

03OpenRAIL许可证的样例
1. 负责任的人工智能发布许可证 Responsible AI Pubs Licenses
科学研究人员依赖于代码、模型和应用程序的共享。这种开放性可以让方法得到验证,节省时间和资源,并让研究人员更有效地借鉴前人的想法。为了向人工智能("AI")研究界提供以负责任的方式发布模型和源代码的工具,RAIL倡议组织开发了一套 OpenRAIL 和仅供研究使用的 RAIL 许可证,论文作者可以使用与他们的人工智能论文相关的资产。开放式负责任人工智能许可证("OpenRAIL")旨在允许自由、开放地访问、重复使用和下游分发人工智能成果的衍生品,只要使用限制始终适用(包括衍生作品)。其目标是帮助规范语言,提高带有行为使用条款的许可证的完整性和可执行性。这些许可证建立在使用模型行为限制的基础上,旨在降低人工智能负面结果和滥用的风险。具体来说,有模型许可证(AIPubs OpenRAIL-M)和源代码许可证(AIPubs OpenRAIL-S)。如果研究人员同时发布模型和源代码,可以使用多个许可证。这些许可证与 BigScience 和 6000 多个人工智能模型和代码相关资源库使用的许可证类似。
2. 负责任的人工智能最终用户许可 Responsible AI End-User License
RAIL倡议组织建议开发者在现有的最终用户许可协议(如有)之外再加入本许可。即使开发者没有现有的最终用户许可协议,也可以使用最终用户许可。命名规则上是采用OpenRAIL-A,即针对应用程序/服务(Application/software):任何可执行软件代码或应用程序,包括基于 API 的软件远程访问。
3.负责任的人工智能源代码许可 Responsible AI Source Code License
RAIL倡议组织建议开发者在源代码的每个模块中都引用本许可证。也就是说,在每个文件中,最好是在每个代码函数/方法、类、数据结构定义中,尤其是在涉及任何算法处理的方法中。命名规则上采用了OpenRAIL-S,即源代码(Source Code):与人工智能系统相关的源代码和脚本。
4.BigScience 开放式 RAIL-M 许可证 BigScience Open RAIL-M License
下篇将着重介绍BigScience项目的具体实践。
评述开源
OpenRAIL许可证是在借鉴了开源软件的基础上保障了开放性,同时考虑到了人工智能所带来的风险采取了许可证附带行为限制的方式。并且考虑到人工智能开放或限制的组件不同,区分了针对源代码、应用、模型、数据的四种不同许可证。OpenRAIL是目前开源人工智能非常有益的实践。
2024年开始,本公众号的AI专题将从国家、国际组织的立法、规则等宽泛梳理,进化到专题性梳理。本周聚焦开源人工智能。开源软件是一个成熟的概念,并在软件行业有了很成熟的应用。在人工智能领域,开源在2023年也有了很显著的推进,根据Github的年度统计,我们看到,越来越多的开发人员开始尝试使用 OpenAI 和其他人工智能公司的基础模型,开源生成式人工智能项目甚至进入了 2023 年按贡献者数量排名的十大最受欢迎开源项目。根据Hugging Face在年度总结中提到,使用开源的AI开发者增加了4倍。其预言在2024年开源大模型的能力可能与闭源的大模型持平。
开源人工智能在国际立法上也是有很大的争议和讨论,是否应当对开源人工智能给予豁免,是个无法避开的问题。
今天推送第二篇开源人工智能许可证的实践负责任人工智能许可证(Responsible AI License,以下简称RAIL)。
过往推送:
第一篇 开源人工智能的定义讨论(见本公众号的上一篇)。
01关于RAIL倡议组织
RAIL 倡议组织成立于 2019 年,旨在倡导在许可和合同中采用基于行为的使用限制,以降低开源人工智能技术带来的危害风险。
第一批负责任人工智能许可证("RAIL")已发布,用于许可源代码和最终用户软件,以展示如何将行为使用限制纳入许可证和合同以限制使用。
自第一批许可证的开发和发布以来,RAIL 倡议组织一直与人工智能社区合作,收集反馈并不断改进。例如,正在与 IEEE-SA 合作开发 RAIL 开发人员可以采用的标准。还在 2020 年组织了一次 AAAI 春季研讨会,讨论与 RAIL 的创建、开发和采用相关的问题,在2022年ACM FAccT 会议上的一篇论文还讨论了 RAIL 许可证的运作框架以及未来可能面临的挑战。2022年更是将RAIL许可证升级到了OpenRAIL。
02从RAIL发展到OpenRAIL
OpenRAIL是对与人工智能有关的组件(数据、源代码、模型、应用程序和服务)增加行为限制的许可证,该限制包括:
-行为使用限制,禁止/限制被许可人的某些应用场景;以及
-要求下游使用(包括再分发)至少包括同样的行为使用限制。
基于其约束组件的不同,设置了不同的RAIL许可证,也可以进行组合使用,其组件包括:
-数据:用于预训练或训练人工智能模型的数据集;
-应用程序/服务:任何可执行软件代码或应用程序,包括基于 API 的软件远程访问;
-模型:基于机器学习的组件(包括检查点),由学习到的权重和参数(包括优化器状态)组成,对应于模型架构;
-源代码:与人工智能系统相关的源代码和脚本。
同时,对于开放部分,建议每份RAIL许可证上增加Open,明确许可证颁发者免费提供被许可的组件,并允许被许可人重新许可他们所选择的组件或任何后续衍生作品,只要 "使用限制 "同样适用于重新许可的组件及其后续衍生作品。
具体许可证的选择方式可参考下图:

03OpenRAIL许可证的样例
1. 负责任的人工智能发布许可证 Responsible AI Pubs Licenses
科学研究人员依赖于代码、模型和应用程序的共享。这种开放性可以让方法得到验证,节省时间和资源,并让研究人员更有效地借鉴前人的想法。为了向人工智能("AI")研究界提供以负责任的方式发布模型和源代码的工具,RAIL倡议组织开发了一套 OpenRAIL 和仅供研究使用的 RAIL 许可证,论文作者可以使用与他们的人工智能论文相关的资产。开放式负责任人工智能许可证("OpenRAIL")旨在允许自由、开放地访问、重复使用和下游分发人工智能成果的衍生品,只要使用限制始终适用(包括衍生作品)。其目标是帮助规范语言,提高带有行为使用条款的许可证的完整性和可执行性。这些许可证建立在使用模型行为限制的基础上,旨在降低人工智能负面结果和滥用的风险。具体来说,有模型许可证(AIPubs OpenRAIL-M)和源代码许可证(AIPubs OpenRAIL-S)。如果研究人员同时发布模型和源代码,可以使用多个许可证。这些许可证与 BigScience 和 6000 多个人工智能模型和代码相关资源库使用的许可证类似。
2. 负责任的人工智能最终用户许可 Responsible AI End-User License
RAIL倡议组织建议开发者在现有的最终用户许可协议(如有)之外再加入本许可。即使开发者没有现有的最终用户许可协议,也可以使用最终用户许可。命名规则上是采用OpenRAIL-A,即针对应用程序/服务(Application/software):任何可执行软件代码或应用程序,包括基于 API 的软件远程访问。
3.负责任的人工智能源代码许可 Responsible AI Source Code License
RAIL倡议组织建议开发者在源代码的每个模块中都引用本许可证。也就是说,在每个文件中,最好是在每个代码函数/方法、类、数据结构定义中,尤其是在涉及任何算法处理的方法中。命名规则上采用了OpenRAIL-S,即源代码(Source Code):与人工智能系统相关的源代码和脚本。
4.BigScience 开放式 RAIL-M 许可证 BigScience Open RAIL-M License
下篇将着重介绍BigScience项目的具体实践。
评述开源
OpenRAIL许可证是在借鉴了开源软件的基础上保障了开放性,同时考虑到了人工智能所带来的风险采取了许可证附带行为限制的方式。并且考虑到人工智能开放或限制的组件不同,区分了针对源代码、应用、模型、数据的四种不同许可证。OpenRAIL是目前开源人工智能非常有益的实践。
