ChatGPT与其他类似的智能工具, 通过深度学习技术等机器学习算法, 处理和分析大量的自然语言任务, 对自然语言进行解构与生成, 并不断地像“人类”一般, 在对话中调试、优化原本的算法, 以便能够更好满足用户对话需求。
可见, AIGC技术的核心在于算法。AIGC的内容是自动生成的, 但是算法是人为的。算法的安全性、可靠性决定了AIGC的安全性和可靠性。
一 算法的可靠性考量
AIGC基于来自公开领域的训练数据, 基于模型对大量数据的学习和推理, 并结合模型对用户需求的理解, 不但能保证生成速度与内容丰富性, 还能确保其输出观点满足社会性的要求, 能在极短时间内产出大量研究型、检索类的工作成果。
技术先进并不意味着其不存在局限。
首先, AIGC 存在“Garbage in Garbage out”的困境。公开领域的数据良莠不齐, 加入模型训练的数据中, 无法避免存在事实性的错误、谣言、虚假图片等。在训练数据存在问题的情况下, 难以确保模型训练结果准确。
其次, 即使假定公开领域的数据准确, 其也未必客观, 而训练后模型生成的结果也可能存在偏向。以互联网为例, 社会学理论“沉默的螺旋”可以解释为何不同平台的言论倾向截然不同的现状——即, 在一个群体内, 观点互相认可的人会不断发言促成讨论, 而观点不同的小众人群, 会倾向于沉默, 最终在群体中只有一种主流声音。互联网的发展本身也是更高维度的“沉默的螺旋”, 网络主流受众的声音越大, 而借助传统媒体、渠道发声的人声音越小。自此, 即使训练数据来自公开渠道, 也不可避免可能在某一因素上存在社会性的偏差与误解。
此外, 模型是人类工程师训练的产物, 在人类工程师介入搭建、调试算法模型的过程中, 还可能因为人类的因素导致偏向, 例如性别、阶级、乃至社会意识形态上的。一个典型案例是, 研究员对Dalle 2(一个智能图像生成AI)模型进行基于偏见陈述等领域的定性调查时, 发现模型存在“强化刻板印象”的倾向, 且这种偏见来源于系统设计的多个环节, 甚至与监控团队工作人员的背景和履历的局限性相关[1]。最终导致的结果是, Dalle 2预览生成图像更倾向于西方白人面孔, 输入“私人助理”、“护士”, 极大可能生成女性图像, 特别是少数族裔女性。提到“律师”“CEO”则生成大量白人和男性穿着西式服装的图片。
可见, 虽然AIGC技术是技术中立的, 但是由于算法和素材的人为干预, 其生成的内容并非一定是中立的。在技术中立性原则的前提下, 不可避免地需要对技术使用效果进行评价与把控, 并从结果监测上反推并调整模型的缺陷。
中国的司法实践中, 也对使用算法的局限性有着深刻的认识, 并认为企业在使用相应先进算法机制的时候, 有更高的注意义务防止相应算法产生不良后果。
在2022年宣判的“算法推荐第一案”中北京爱奇艺科技有限公司诉北京字节跳动科技有限公司(以下简称“字节公司”)侵害《延禧攻略》信息网络传播权一案, 法院对字节公司使用信息流推荐算法传播侵权作品的行为进行了如下评价: “字节公司以其服务特点和技术优势…,…也为自身获取了更多的流量和市场竞争优势等利益。但……也存在着提高侵权传播效率、扩大侵权传播范围、加重侵权传播后果的风险。……与不采用算法推荐、仅提供信息存储空间服务的其他经营者相比, 理应对用户的侵权行为负有更高的注意义务。”[2]此外, 法院也进一步强调了, 虽算法机制本身无法直接用于筛选侵权短视频, 但算法并不只是互联网企业服务中的全部, 相应的算法机制的使用者仍可以“其服务和运营的相应环节中施以必要的注意、采取必要的措施加以完善。” [3]
二 算法透明原则要求的实践与意义
通常而言, AIGC技术的算法是技术开发者的核心资产和重要的商业秘密, 是不为公众所知的黑匣子。但是, 另一方面, 当AIGC产生对公众有影响的内容时, 其算法本身就不得不落入公众视野, 受到公众质疑, 以确保其可靠性。
(一) 算法透明原则
除了对技术使用效果进行管理以外, 各国也逐渐对技术本身进行监管。其中保持决策合理公平、实现算法问责的主要机制之一即为“算法透明原则”——要求算法所有者在一定程度上对算法的机制、决策过程或对个人权益影响的情况进行披露、公示, 旨在数据隐私、消费者权益保等领域保护公众知情权。
实现算法透明的技术难度在于, 如《中篇:AIGC之知识产权》所述, 机器学习算法存在“算法黑箱效应”。当前机器学习技术称为“深度学习”, 其基于通过非线性的神经网络提供海量的数据, 再经过巨大的神经网络处理该些数据, 导致了算法的推演并不完全依人类逻辑, 故有些部分无法被人们翻译解读, 也就造成了其部分推演无法被完整解释的情况。[4]从法律层面讨论, 不断调试且进化的算法模型可能构成商业秘密或其他能够受到保护的客体, 对其进行过分披露会侵害公司的权益, 损害公司的竞争优势。
(二) 境外算法透明原则的实践
目前, 各法域面对“算法透明原则”也在逐步发展。General Data Protection Regulation (“GDPR”)下, 当数据控制者进行了完全自动化的决策程序, 且给数据主体带来了法律后果或其他类似的显著后果时, 应当披露以下内容:
自动化的决策程序(包括用户画像)的存在;
其中所涉逻辑的有意义信息; 以及
对数据主体的意义以及预期后果[5]
在解释何为“其中所涉逻辑的有意义信息”时, 欧盟WP29工作组在针对个人自动化决策和用户画像的相关指引中解释, 该等披露并不要求是对算法的披露, 或是对算法的复杂描述[6]。GDPR的Recital 58也强调, 实践中的技术复杂性以及角色的不断增加, 数据主体难以理解数据处理的情况, 此时透明性原则尤为相关[7]。故, GDPR所要求的“有意义信息”是以数据主体作为导向的, 可以认为, 有意义信息的衡量标准是, 是否能够让数据主体足够了解决策的原因[8]。
而在解释与说明算法的意义以及预期后果时, 欧盟WP29工作组认为控制者可以通过使用工具(例如图表)、举例假设等的方式让自己的说明内容更为具象化。GDPR也考虑到了算法透明的局限性, 在Recital 63[9]中明确, 基于透明原则做出的披露不应对商业秘密以及其他知识产权有负面影响。
美国加州于2023年正式生效的隐私权法案(The California Privacy Rights Act, “CPRA”), 目前暂未对与隐私有关的算法进行直接规制, 但是CPRA条文中已经保证将把“颁布规范以规制自动化决策工具, 包括用户画像以及要求企业向个人提供与其中所涉逻辑的有意义信息”纳入CPRA整体的法规制定计划中[10]。此外, 美国也在2022年公开了更新的《算法问责法案》(Algorithmic Accountability Act of 2022)的草案, 提出了企业在进行自动化决策、以及重大的关键决策程序[11]时, 应当进行相应的影响评估, 并向相关的机关提供该等影响评估文件的要求。影响评估中应当分析对消费者可能造成的重大负面影响与改善措施, 以还覆盖了对系统的当前与历史性能的测试和评估, 以及隐私保护、数据安全措施、决策的公平性、非歧视性等方向的评估。
(三) 我国算法透明实践
如《上篇:政策与监管》所述, 在我国具有舆论属性或者社会动员能力的算法推荐服务提供者, 需要通过互联网算法备案系统进行备案。在备案中, 申请备案方需要提交“拟公示内容”, 对自己使用的算法的基本原理和运行机制进行解释。
我国《互联网信息服务算法推荐管理规定》同时要求, 所有算法推荐服务者应当以显著方式告知用户其提供算法推荐服务的情况, 并以适当方式公示算法推荐服务的基本原理、目的意图和主要运行机制等。
除了根据法律法规的要求外, 在个人信息保护领域, 通过计算机程序对用户进行分析与决策的, 本身也需要做出类似披露。《个人信息保护法》下, 自动化决策指“指通过计算机程序自动分析、评估个人的行为习惯、兴趣爱好或者经济、健康、信用状况等, 并进行决策的活动。”(《个人信息保护法》第73条); 个人信息处理者应当以显著方式、清晰易懂的语言真实、准确、完整地向个人告知……个人信息的处理目的、处理方式, 处理的个人信息种类、保存期限 (《个人信息保护法》第17条) ; 个人信息处理者进行自动化决策的时候, 应当保证决策的透明度、结果公平、公正。对个人权益有重大影响的决定, 个人有权要求个人信息处理者予以说明, 并有权拒绝个人信息处理者仅通过自动化决策的方式作出决定。(《个人信息保护法》第24条)
此外, 自动化决策的行为本身就是法律规定的事前进行个人信息保护影响评估的情形之一(《个人信息保护法》第55条)事前评估的其中一个参考项即是是否向用户说明了自动化决策的基本原理或运行机制(《信息安全技术个人信息安全影响评估指南》附录A.7)。
目前, 据公开资料显示, 已经有两家生成合成类算法技术的AI智能客服(“菜鸟物流智能客服算法”、“天猫小蜜智能客服算法”)在互联网信息服务算法备案系统中进行了备案。从目前公示的内容来看, 备案方对算法运行原理和机制的解释较为简单, 主要强调其未对用户的个人信息进行使用或脱敏后方进行使用, 且倾向于解释智能客服的用途和功能。
此外, 对于较为热门的“个性化推荐”类算法, 即通过处理个人信息从而生成个性化信息流、推送等的算法机制, 每家企业的公示的侧重点皆有不同。“淘宝推荐算法”“抖音个性化推荐算法”“大众点评首页推荐算法”旨在强调, 其提供了相应的技术方案以防个性化推荐类算法下“信息茧房”“信息同质化”负面效果的发生。相反地, “网易传媒信息推送算法”“网易传媒信息流推荐算法”则对其使用的“内容标签系统”“用户画像系统”, 推荐机制中的“召回”“过滤”“粗排”“精排”“重排”流程进行了功能性的详细描述。而“微博个性化推送算法”也详细解释了若干算法机制, 并辅以流程图的方式帮助用户理解微博的个性化推送算法机制。此外, 还有部分公示内容中, 例如“淘宝推荐算法”还提供了用户关闭个性化信息展示的路径。也可以给落入备案要求及公示要求中的企业一些实践的参考。(以上请见https://beian.cac.gov.cn/公示内容)
结语
2023年1月, 微软宣布正和ChatGPT开发团队OpenAI进行洽谈, 计划将其整合到云服务、搜索引擎、甚至office中。AIGC软件正从娱乐软件迈向效率工具, 带来的知识产权问题不容忽视。互联网算法备案系统正式实施, 意味着我国是国际上较早对算法机制进行明确规范和监管的国家之一。而无论是备案、还是公示要求, 用户都需要明白, 算法透明本身并非目的, 而不过是基于对技术使用效果的审慎态度、对个人权益的平衡、对公共安全与国家安全的考量后的调整工具与手段。
注释
[1] 《DALL·E2Preview-RisksandLimitations》https://github.com/openai/dalle-2-preview/blob/main/system-card.md?utmsource=Sailthru&utmmedium=email&utmcampaign=Future%20%20%20Perfect%204-12-22&utmterm=Future%20Perfect#explicit-content
[2] (2018)京0108民初49421号案
[3] (2018)京0108民初49421号案
[4] Big data, artificial intelligence, machine learning and data protection, ICO, Sept, 2017 https://ico.org.uk/media/for-organisations/documents/2013559/big-data-ai-ml-and-data-protection.pdf
[5] General Data Protection Regulation Article 13(2)(f), 14(2)(g), 15(1)(h) …provide the data subject with the following further information necessary to ensure fair and transparent processing: the existence of automated decision-making, including profiling, ……, at least in those cases, meaningful information about the logic involved, as well as the significance and the envisaged consequences of such processing for the data subject.
[6] Guidelines on Automated individual decision-making and Profiling for the purposes of Regulation 2016/679
[7] GDPR Recital 58 This is of particular relevance in situations where the proliferation of actors and the technological complexity of practice make it difficult for the data subject to know and understand whether, by whom and for what purpose personal data relating to him or her are being collected, such as in the case of online advertising.
[8] The WP29 Guidelines on Automated individual decision-making and Profiling for the purposes of Regulation 2016/679 The information provided should, however, , be sufficiently comprehensive for the data subject to understand the reasons for the decision.
[9] GDPR Recital 63 That right should not adversely affect the rights or freedoms of others, including trade secrets or intellectual property and in particular the copyright protecting the software.
[10] CPRA 1798.185 (a)(16) On or before July 1, 2020, the Attorney General shall solicit broad public participation and adopt regulations to further the purposes of this title, including, but not limited to, the following areas: …Issuing regulations governing access and opt-out rights with respect to businesses ‘use of automated decisionmaking technology, including profiling and requiring businesses’ response to access requests to include meaningful information about the logic involved in those decisionmaking processes, as well as a description of the likely outcome of the process with respect to the consumer.
[11] Algorithmic Accountability Act of 2022 Section 2(1) The term “augmented critical decision process” means a process, procedure, or other activity that employs an automated decision system to make a critical decision.
监管、知识产权与算法安全——下篇: AIGC之算法安全
作者:杨迅 夏雨薇 杨蕾来源:通力律师事务所

ChatGPT与其他类似的智能工具, 通过深度学习技术等机器学习算法, 处理和分析大量的自然语言任务, 对自然语言进行解构与生成, 并不断地像“人类”一般, 在对话中调试、优化原本的算法, 以便能够更