前沿人工智能安全性的临时国际科学报告

来源:那一片数据星辰

文章摘要
摘要 本报告为《前沿人工智能安全的国际科学报告》的阶段性报告,发布于2024年5月,作为首尔AI峰会的成果,旨在建立关于先进人工智能(AI)风险的国际共识,并为未来全面报告奠定基础。

摘要
本报告为《前沿人工智能安全的国际科学报告》的阶段性报告,发布于2024年5月,作为首尔AI峰会的成果,旨在建立关于先进人工智能(AI)风险的国际共识,并为未来全面报告奠定基础。该报告由来自全球75位跨学科背景的AI专家共同撰写,包括各国提名的专家咨询小组成员以及欧盟和联合国代表。尽管时间紧迫,报告力求平衡地探讨通用人工智能的能力、风险及潜在风险,并在缺乏科学共识的领域明确指出研究空白,以促进进一步探索。
报告未包含私营部门代表的直接输入,以避免利益冲突,但认可公司作为AI能力进步的主要驱动力及风险评估与缓解研究的积极参与者。报告强调了需在后续版本中更全面地讨论“AI鸿沟”问题,即全球范围内不均等地享受AI带来的好处,以及AI发展与部署对环境的影响。报告还计划扩大证据收集范围,邀请公司和民间社会提交材料,以增强报告的全面性和实用性。
报告采用的证据包括科学、技术和社会经济等多方面内容,部分引用资料虽未经同行评审,但承诺仅引用高质量来源。高质量标准包括原创性、全面引用现有文献、方法论透明度及在科学界的影响力等。鉴于AI领域的快速发展,报告提供了当前科学理解的状态快照,而非确定性的结论,同时避免提出具体的政策建议,将政策选择权留给决策者。
结构概览
1.引言



  • 背景介绍:国际AI安全峰会的召开背景及其达成的共识。

  • 报告目的:构建国际共享的AI安全科学理解。

  • 参与人员:报告编写团队、高级顾问及专家成员构成。
    2.方法论与证据评估

  • 证据选取标准:原创性、文献综合、方法论透明度、科学界影响力。

  • 时间限制与挑战:快速协作下的报告局限性。

  • 改进方向:下一阶段报告将如何增强证据评估与合成。
    3.AI风险与影响

  • AI能力与风险概述:平衡评估AI的正面潜力与潜在危害。

  • 全球AI鸿沟:不平等的AI利益分配问题。

  • 环境影响:AI发展对自然环境的长远影响。
    4.研究方法与案例分析

  • 实证研究:AI在招聘、管理绩效中的应用案例。

  • 后市场监督:用户反馈与系统实际表现的研究价值。

  • 深度伪造与语言模型:现实世界中的研究启示。
    5.模型透明度与解释

  • 透明度提升措施:文档化、第三方访问、黑箱分析等。

  • 内部机制研究:理解模型输出背后的逻辑与功能。
    6.未来展望与参与途径

  • 征集证据:公开呼吁公司与民间组织提交证据。

  • 下一步计划:加强报告的广度、深度与证据覆盖。
    详细内容
    1.引言
    引言部分为报告设定了背景,阐述了高级人工智能(AI)的快速发展以及它如何影响我们的生活和工作方式。以下是对引言部分的详细展开:
    背景和重要性:

  • 引言首先强调了人工智能(AI)的快速发展,以及它在改善我们生活方面的潜力。

  • 报告指出,尽管AI技术为社会和经济带来了变革性的好处,但同时也存在潜在的风险和危害。
    AI的双重性:

  • AI的发展被描述为一把双刃剑,它既有可能带来积极的变化,比如在医疗、教育和科学研究等领域,也有可能带来负面的影响,如失业、隐私侵犯和对民主过程的操纵。
    国际合作的必要性:

  • 鉴于AI的全球性质,报告强调了国际合作在确保AI安全和负责任发展中的重要性。

  • 报告提到了2023年11月在布莱切利公园举行的AI安全峰会,这是首次国际AI安全峰会,旨在建立一个共享的、基于科学的对高级AI风险的理解。
    报告的目的和范围:

  • 引言部分明确了报告的目的是促进对高级AI安全性的国际科学理解,并随着时间的推移不断发展这一理解。

  • 报告的范围限定在近年来特别快速发展的通用AI(General-purpose AI, GPAI)上,这是一种能够执行广泛任务的AI。
    通用AI的定义和特点:

  • 报告对通用AI进行了定义,它不同于专门执行单一任务的窄AI(Narrow AI)。

  • 通用AI的能力正在迅速提高,例如,最新的大型语言模型(LLMs)能够进行多轮对话、编写简短的计算机程序、翻译多种语言等。
    研究的动态性和不确定性:

  • 引言提到,尽管通用AI的研究正在迅速发展,但这一领域的科学认识还不成熟,存在许多不确定性。

  • 报告指出,对于通用AI的未来进步速度和潜在影响,专家们的意见不一。
    风险管理和政策制定:

  • 报告强调了风险管理的重要性,并指出需要开发和激励系统化的风险管理实践。

  • 报告认为,尽管存在技术方法来评估和减少风险,但目前还没有能够完全保证系统安全性的方法。
    报告的贡献和期望:

  • 引言最后强调了这份中期报告是向最终报告迈进的第一步,并期望通过这份报告促进关于AI安全性的建设性讨论。

  • 报告期待未来的工作能够继续这一努力,并在最终版本中纳入更多的证据和科学观点。
    通过引言部分,报告为读者提供了一个关于高级AI安全性讨论的框架,并强调了国际合作、风险管理和政策制定在确保AI技术安全发展中的关键作用。
    2. 能力
    2.1 通用AI如何获得其能力?

  • 深度学习和神经网络:通用AI模型和系统主要基于深度学习,这是一种利用大量数据和计算资源训练人工神经网络的方法。这些网络的结构模仿了人脑的生物神经网络,尽管两者在复杂度和能力上存在显著差异。

  • Transformer架构:大多数最先进的通用AI模型都采用了Transformer神经网络架构,这种架构在处理大量训练数据和计算能力方面表现出了极高的效率。

  • 预训练和微调:通用AI模型的开发包括预训练和微调两个阶段。预训练阶段,模型在大量数据上学习通用背景知识;微调阶段,模型针对特定任务进行调整,以提高其性能。
    2.2 目前的通用AI系统能够做什么?

  • 多模态输入和输出:通用AI系统能够处理和生成文本、图像、视频等多种模态的数据。例如,语言模型可以进行多轮对话、编写程序、解决数学问题等。

  • 技能和局限性:尽管通用AI在某些领域表现出色,但它在执行复杂任务、避免错误陈述、发展全新复杂概念等方面仍然存在局限性。

  • 上下文特定性:通用AI系统的性能高度依赖于上下文,即它们在特定环境下的表现可能与在其他环境下的表现大相径庭。
    2.3 最近的能力趋势及其驱动因素

  • 计算、数据和算法的进步:通用AI能力的快速提升得益于计算资源的增加、数据集的扩大和算法效率的提升。

  • 模型性能的提高:随着模型规模的增长,它们在预测下一个词、解决问题和执行任务方面的表现得到了显著提高。
    2.4 未来几年的能力进展

  • 资源的快速扩展:如果计算资源和数据集继续以当前的速度扩展,预计到2026年底,一些通用AI模型将使用比2023年最密集计算模型多40到100倍的计算资源。

  • 算法进步:尽管存在关于是否需要新的研究突破来实现通用AI能力大幅进步的争论,但算法的持续改进预计将推动这一领域的发展。

  • 风险和挑战:随着通用AI能力的增长,可能会出现新的挑战和风险,如劳动力市场影响、全球AI鸿沟、市场集中风险等。
    在“能力”部分,报告详细讨论了通用AI系统如何通过先进的技术和大量的数据训练获得其能力,目前它们能够执行的任务,以及未来可能的发展趋势。同时,报告也指出了在评估和理解这些系统时所面临的挑战和风险。
    3. 评估和理解通用AI系统的方法论
    3.1 通用AI评估用于评估模型能力和影响

  • 模型评估的目的:评估通用AI模型的目的是确定模型的一般能力和局限性,并评估其对社会的潜在影响和风险。这包括了解模型设计选择与模型输出之间的关系,以及预测系统对社会的广泛影响。

  • 评估的挑战:评估通用AI系统时存在挑战,因为这些系统的能力和潜在影响很难量化。评估结果通常伴随着局限性和不确定性,需要在解释结果时予以记录。
    3.2 方法论用于模型性能分析

  • 案例研究:通过案例研究,研究者可以定性地评估模型性能,依赖于模型输出的示例和人类判断。这种方法通常用于展示模型在特定任务上的表现。

  • 基准测试:使用标准化的基准测试来评估机器学习模型的性能。这些基准测试可能包括图像处理、语言模型评估等,但它们可能无法完美地代表现实世界任务。

  • 红队和对抗性攻击:在部署系统之前,通过对抗性攻击和红队评估来识别最坏情况的行为、恶意使用机会以及系统意外失败的潜力。红队由一组人组成,他们通过攻击系统来发现漏洞。

  • 审计:审计提供了一种机制,用于审查和确保对AI开发过程中的设计选择负责。审计可以揭示训练数据中的问题内容,分析模型和产品选择所做出的权衡,并指出下游风险。
    3.3 模型透明度、解释和解释

  • 文档化:通过文档化和沟通定义模型的工程决策,可以提高透明度。例如,模型卡片是记录模型信息的一种成功方法。

  • 模型解释和可解释性技术:这些技术可以提高研究人员对通用AI系统内部运作方式的理解。包括研究如何解释模型输出作为给定输入的结果,以及解释神经网络中参数、神经元、子网络或层表示的角色。

  • 解释的挑战:尽管解释性技术有助于支持问责制,但在实践中很难确保对通用AI系统运作方式的解释是正确的。存在所谓的“可解释性幻觉”,即解释技术可能提供误导性的模型工作原理解释。
    3.4 研究通用AI系统的挑战

  • 评估的复杂性:现代通用AI系统是复杂、分散项目的结果,涉及数据收集、训练运行、系统集成和部署应用。这些复杂性使得任何单一行动者都难以理解整个过程。

  • 访问和透明度:评估AI系统所需的不同技术需要不同程度的访问权限。例如,黑盒访问允许对目标模型进行查询和分析输出,但许多类型的评估技术依赖于更高级别的访问权限。

  • 社会影响的评估:尽管理解整体社会影响是许多AI评估的最终目标,但许多评估都未能达到这一目标。这需要细致的分析、跨学科合作和包容性。

  • 增加参与和代表性:扩大参与审计过程的范围,可以增加纳入过程中的经验范围,从而更全面地发现和描述当前或预期的伤害。

  • 透明度的挑战:尽管透明度对于评估AI系统至关重要,但在实践中很难实现。透明度努力并不总是对问责制有意义的干预。
    在“评估和理解通用AI系统的方法论”部分中,报告详细讨论了用于评估通用AI模型和系统的方法和挑战,包括模型评估的目的、案例研究、基准测试、红队和对抗性攻击、审计、模型透明度、解释和解释技术,以及研究通用AI系统所面临的挑战。这些方法和挑战共同构成了对通用AI系统进行科学评估和理解的基础。
    4. 风险
    4.1 恶意使用风险

  • 个体伤害:通用AI系统可能被用于制造和传播虚假内容,如深度伪造视频,这可能对个体的隐私和名誉造成伤害。

  • 信息操作:AI技术可以用于生成和传播虚假信息,影响公众舆论和政治过程。这些技术生成的内容越来越难以与真实内容区分。

  • 网络攻击:通用AI可能提升个人进行网络攻击的能力,通过自动化和提高效率来扩大攻击规模。

  • 双重用途科学风险:AI系统可能加速科学领域的进步,但同时也可能被用于恶意目的,尤其是在生物科学领域。
    4.2 故障风险

  • 产品功能问题:当通用AI模型或系统的功能被误解或错误传达时,可能导致用户对AI系统的期望不切实际,从而在系统未能达到预期功能时造成伤害。

  • 偏见和代表性不足:AI系统可能在种族、性别、文化、年龄和残疾等方面表现出偏见,这在高风险领域如医疗、招聘和金融贷款中可能造成严重后果。

  • 失去控制:尽管目前普遍认为通用AI系统不构成重大的失去控制风险,但未来随着技术的发展,这种风险可能会增加。
    4.3 系统性风险

  • 劳动力市场风险:通用AI可能对劳动力市场产生显著影响,导致许多人失去工作,尽管经济学家预计自动化可能带来的工作损失可能会被新工作创造和非自动化部门需求的增加所抵消。

  • 全球AI鸿沟:AI研究和发展目前集中在少数西方国家和中国,这可能导致全球不平等的加剧。

  • 市场集中风险和单一故障点:通用AI发展的市场集中可能导致系统性风险,因为关键部门广泛采用少数通用AI模型和系统可能导致大规模的同步故障和中断。

  • 环境风险:通用AI发展和部署中计算使用的增长迅速增加了与通用AI相关的能源使用,可能导致CO2排放的显著增加。

  • 隐私风险:通用AI模型或系统可能“泄露”有关个人的数据,尤其是当训练模型使用敏感个人数据时,可能导致严重的隐私泄露。

  • 版权侵犯:通用AI模型的训练使用大量版权数据,这对传统的知识产权法律以及数据的使用、同意、补偿和控制体系构成挑战。
    4.4 跨领域风险因素

  • 技术跨领域风险因素:包括确保通用AI系统可靠行为的难度、对系统内部运作的有限理解、以及通用AI“代理”能够自主行动并减少人类监督的发展。

  • 社会跨领域风险因素:包括技术进步速度与监管响应速度之间的潜在差距,以及AI开发者为了快速发布产品而可能忽视风险管理的竞争激励。
    在“风险”部分,报告详细讨论了与通用AI相关的各种风险,包括恶意使用、系统故障、系统性风险和跨领域风险因素。这些风险覆盖了从个体伤害到全球性挑战的广泛问题,并强调了需要进一步研究和政策制定来减轻这些风险。
    5. 减轻风险的技术方法
    5.1 风险管理和安全工程

  • 风险评估:风险评估是识别、评估和优先级排序风险的过程,它涉及利用资源最小化、监控和控制高优先级风险。尽管通用AI的风险评估方法还不够成熟,但可以采用多种技术进行评估,如提升研究、预测、德尔菲研究和现场测试。

  • 风险管理:风险管理借鉴了其他安全关键行业的实践,包括计划审计和检查、确保可追溯性、冗余防御机制以及风险管理指南。这些方法有助于在AI系统的生命周期中规定流程、评估和交付物。
    5.2 训练更值得信赖的模型

  • 与开发者意图对齐:AI对齐是指确保通用AI系统的行为与其开发者的目标和利益一致。这包括确保模型训练目标激励预期目标,并确保输出从训练环境转换到现实世界。

  • 减少虚假陈述:通过微调通用AI模型,使其更加真实,可以减少虚假陈述的倾向。此外,允许模型在执行任务时访问知识数据库,有助于提高生成内容的可靠性。

  • 提高对故障的鲁棒性:对抗性训练是一种提高AI系统鲁棒性的方法,它通过构建旨在使模型表现不佳的“攻击”并训练系统适当处理这些攻击。

  • 移除危险能力:通过“机器非学习”技术,可以移除通用AI系统中的某些不受欢迎的能力,如制造爆炸物、生物武器、化学武器和网络攻击的能力。

  • 分析和编辑模型内部工作:研究模型的内部工作可以帮助建立特定能力的存在或缺失。尽管理解模型的内部计算可能有助于调查它们是否学习了值得信赖的解决方案,但这种方法在实际应用中仍面临挑战。
    5.3 监控和干预

  • 检测通用AI生成的内容:区分真实与通用AI生成的内容对于防止生成模型的恶意使用至关重要。这包括使用专门的分类器或评估给定示例是否由特定通用AI模型生成的可能性。

  • 检测异常和攻击:开发了一些方法可以帮助检测AI系统的不寻常输入或行为。一旦检测到,这些例子可以发送到故障处理过程或标记以进行进一步调查。

  • 解释模型行为:理解部署的通用AI系统行为的原因对于评估和确定由通用AI系统引起的伤害的责任至关重要。然而,让通用AI语言模型解释其决策往往会产生误导性答案。

  • 构建AI系统中的安全措施:尽管没有完美的安全措施,但拥有多层保护措施和冗余的安全保障可以增加安全保障水平。一旦检测到,干预可以识别并保护免受部署的通用AI系统的潜在有害行为。
    5.4 通用AI系统中的公平性和代表性技术方法

  • 偏见和歧视的减少:通用AI模型可能会捕捉并有时放大其训练数据中的偏见,导致资源分配不均、代表性不足和歧视性决策。技术角度来看,偏见的原因通常是数据,可能未能充分代表目标人群的少数群体。

  • 公平性的定义和挑战:公平性没有普遍接受的定义,并且在不同的文化、社会和学科背景中有所不同。实现通用AI系统中的公平性需要在系统的设计、训练、部署和使用阶段解决偏见问题。
    5.5 通用AI系统的隐私方法

  • 隐私风险:通用AI系统存在多种隐私风险,如数据保密性的丧失、对数据使用方式的透明度和控制权的丧失,以及新的隐私侵犯形式。

  • 隐私保护技术:隐私保护是积极研究和发展的领域。然而,现有的技术工具难以扩展到大型通用AI模型,并且可能无法为用户提供有意义的控制。
    在“减轻风险的技术方法”部分中,报告探讨了多种技术方法来减轻与通用AI相关的风险,包括风险管理和安全工程、训练更值得信赖的模型、监控和干预,以及在通用AI系统中实现公平性和代表性的技术方法。这些方法旨在通过不同的技术手段提高通用AI的安全性和可靠性,同时保护用户的隐私和数据安全。
    6. 结论
    未来通用AI的不确定性

  • 多种可能的结果:报告指出,通用AI的未来轨迹非常不确定,即使在不久的将来,也可能出现从非常积极到非常消极的各种结果,以及两者之间的任何情况。
    通用AI的潜力

  • 积极前景:通用AI在教育、医疗应用、广泛领域的研究进步以及提高生产力和繁荣方面具有巨大潜力。
    风险的现实性

  • 当前和未来的风险:报告强调,通用AI的恶意使用和故障今天已经造成伤害,例如通过深度伪造、欺诈和有偏见的输出。未来随着通用AI能力的进一步发展,可能会出现新的风险,如大规模失业、通用AI支持的恐怖主义,甚至人类失去对通用AI系统的控制。
    风险缓解的技术方法

  • 现有技术的限制:尽管存在减少模型偏见、提高对通用AI模型内部工作理解、评估其能力和潜在风险以及使它们不太可能响应可能导致伤害的用户请求的技术方法,但目前没有现有技术能够为高级通用AI模型或系统的安全性提供定量保证。
    未来并非不可避免

  • 社会和政府的选择:通用AI的发展方式、设计解决的问题、我们是否能够充分利用通用AI的经济潜力、谁从中受益以及我们暴露自己于何种风险,这些问题以及许多其他问题取决于社会和政府今天和未来为塑造通用AI发展所做的选择。
    紧急性和预防原则

  • 采取行动的紧迫性:鉴于通用AI对我们生活许多方面的潜在深远影响,以及进步可能继续迅速,预防原则意味着迫切需要促成共识,并将资源投入到理解和解决这些风险中。
    科学和公共讨论的重要性

  • 为正确选择提供基础:建设性的科学和公共讨论对于社会和政策制定者做出正确选择至关重要。
    中期报告的贡献

  • 专家合作的成果:这份中期报告是30个国家、欧盟和联合国提名的专家代表以及世界其他领先专家之间极快速合作的产物。尽管AI研究领域迅速发展,许多重要问题尚未达成共识,但报告汇集了75位国际专家的多样视角,在短时间内取得了显著成果。
    未来工作的方向

  • 改进报告:报告主席对于如何改进报告提出了期望,包括扩大科学工作的考虑范围、更明确地评估特定研究的说服力、更好地综合证据以提供对特定问题的更细致和简洁的科学状态评估。

  • 扩大报告输入:报告计划扩大输入来源,包括私营部门代表和民间社会组织的证据提交,以通知下一版完整报告的发展。
    *更深入地讨论特定主题:报告主席希望在未来的报告中更详细地讨论全球“AI鸿沟”和AI发展与部署对环境的影响。
    主席的注释

  • 对中期报告的个人看法:主席对中期报告的编写过程和成果表示满意,并强调了平衡报告内容的挑战,同时提出了对未来报告的期望。
    不同观点

  • 记录分歧:报告记录了专家咨询小组在报告内容上的一些分歧,例如Ciarán Seoighe(爱尔兰)对报告总体基调过于消极的担忧,并建议未来的报告应包括对生成性AI社会影响的评估和人/基本权利评估的重要性。
    术语表

  • 关键术语的定义:报告提供了AI领域中使用的关键术语的定义,如自适应性、AI代理、AI部署者、AI开发者、AI生命周期、AI风险、算法透明度、对齐、应用编程接口(API)、人工通用智能(AGI)、自治性、黑盒、能力、云实验室、认知任务、计算、跨语言差异、深度学习、部署、虚假信息、生态系统审计、评估、FLOPS、基础模型、前沿AI、GPU、护栏、启发式、输入、大型语言模型(LLMs)、大规模多任务语言理解(MMLU)、误泛化、虚假信息、模态、模型卡、窄AI、开放式领域、预训练、提示、红队、风险因素、安全性和安全性、脚手架、半导体、合成数据、系统集成、迁移学习、变换器架构、权重、白盒。
    在“结论”部分,报告总结了通用AI未来发展的不确定性,强调了其潜力和当前已经出现的风险,并讨论了风险缓解的技术方法和未来工作的方向。报告主席对参与专家的贡献表示感谢,并对未来的报告提出了改进的期望。同时,报告记录了专家小组在某些问题上的分歧,并提供了AI领域关键术语的定义。

技术驱动法律,专业成就未来