写在前面的话:为什么要讨论前沿AI的风险阈值
欧盟《人工智能法案》的GPAI分级体系与产业界的安全框架演进,揭示了AI治理中技术标准与法律规则的交织困境。当前国际协调进程虽取得初步共识,但在风险量化、执行机制等关键环节仍面临结构性挑战。
欧盟AI法案的GPAI分级框架:简化的代价
根据2024年7月正式生效的《欧盟人工智能法案》(Regulation (EU) 2024/1689),系统性风险GPAI(通用目的AI)模型的分类标准已明确为单一量化阈值辅以行政裁量机制(第51条)。这一修正反映了立法者对技术动态性的回应,也揭示了法律框架与技术创新间的张力。
系统性风险判定的法律要件 法案第51(1)条确立了两类认定路径:
算力推定标准:训练计算量超过 10的25次 FLOPs的模型被自动推定为具有系统性风险(第51(2)条)。该阈值直接对应GPT-4级模型的训练规模,构成法律上的客观推定要件。
行政裁量机制:欧盟委员会可基于独立科学专家组的“专业警示”(qualified alert),认定未达算力阈值但具有等效风险的模型(第51(1)(b)条)。裁量依据包括模型在生物安全、网络安全等领域的突破性能力(附件XIII)。
产业安全框架的差异化路径
Anthropic的ASL 2.1体系
在2024年更新的《负责任扩展政策》中,Anthropic将AI安全等级(ASL)扩展至四级,并引入两项关键革新:
①能力触发机制:当模型在生物武器设计、自主代码优化等8项高风险任务中达到人类专家水平的80%时,自动升级至ASL-3;
②安全缓冲区规则:要求模型能力距离风险阈值至少保持6个月的技术代差,通过限制训练计算量增速(每季度不超过1.5倍)实现。
该框架的争议点在于其"能力先行"逻辑——ASL-3判定仅需模型在实验室环境下展示特定能力,无需实际危害发生。这可能导致过度保守的研发限制,例如Claude 3因在模拟测试中展现生物分子设计潜力而被暂停商业部署[4]。
OpenAI的风险聚合策略
OpenAI的预备框架采用三维评估矩阵:
①风险维度:网络安全、生物威胁、说服力、自主性;
②严重等级:低(Low)、中(Medium)、高(High)、严重(Critical);
③处置规则:以四类风险中最高等级决定全局处置措施。例如若生物威胁评级为"高"而其他为"中",则整个模型需停止部署直至风险缓解至"中"以下[5][6]。
该方法强调风险联动的复杂性——模型在单一领域的突破可能触发全局限制。但批评者指出,其评估数据未完全公开,且第三方审计仅覆盖15%的风险场景,可能低估长尾风险。
风险阈值的国际协调挑战
标准割裂与互认困境
当前主要存在三类阈值体系:欧盟的算力基准(10^25 FLOPs)、Anthropic的能力触发(ASL分级)、OpenAI的风险聚合(预备框架)。首尔AI安全峰会虽推动建立"不可容忍风险"概念,但各国对具体指标仍未达成共识。
执行机制的碎片化
欧盟通过AI办公室实施集中监管,有权直接调取模型权重进行检查;美国则采用联邦与州分立监管,FTC主要关注商业实践而非技术风险。这种差异催生"监管套利"现象。尽管首尔峰会提出建立"阈值突破全球通报机制",但各国对信息共享范围存在分歧。
技术标准的法律化
技术标准的法律化已成为AI治理的核心战场。欧盟试图通过刚性算力阈值确立监管权威,产业界则以动态能力框架保持灵活性,这种张力本质上是"预防原则"与"创新优先"的价值冲突。未来两年,风险阈值体系可能向"混合模式"演进:基础性指标(如算力、参数规模)由国际条约强制规定,而能力与风险指标作为补充性标准。正如OECD专家所言,真正的挑战不在于设定阈值,而在于构建可审计的测量协议——没有科学的度量,任何法律框架都将沦为空中楼阁。
下面本公众号会提供OECD在巴黎AI行动峰会上主导的关于前沿人工智能的阈值研讨会主要成果的全文翻译。
前沿人工智能的风险阈值:来自人工智能行动峰会的见解
多少个炎热的日子构成热浪?水位上升到什么程度算洪水?多少人算作人群?
我们生活在一个由阈值定义的世界中。阈值为现实的混乱连续体带来了秩序,并帮助我们做出决策。它们可以被视为预定义的点,超过这些点后,就需要采取额外的缓解措施。
越来越多的人对将阈值作为治理先进人工智能系统(即前沿人工智能)的工具表现出兴趣。像谷歌DeepMind、Meta和Anthropic这样的人工智能开发企业已经发布了安全框架,其中包括其系统风险不可接受的阈值。经济合作与发展组织(OECD)最近就阈值主题进行了专家调查和公众咨询。
为了深化这一讨论,英国人工智能安全研究所(AISI)和OECD人工智能部门在人工智能行动峰会上召集了领先专家,讨论阈值在人工智能治理中的作用。来自核能和航空业的代表与前沿模型论坛、谷歌DeepMind、Meta、Humane Intelligence、SaferAI和欧盟人工智能办公室的专家一起参加了讨论。本文总结了讨论中的一些关键见解。

注:这些术语目前没有普遍接受的定义。阈值的类型可能远不止这些,也不限于模型属性。我们考虑将能力阈值定义为将人工智能能力与相应缓解措施相对应的阈值。然而,其他人可能对其有不同的定义,仅将其视为能力,而将缓解措施视为一种响应,而不是阈值的定义属性。
警惕类比
核能和航空业使用精确的概率阈值来表达可接受的风险水平。例如,美国联邦航空管理局(FAA)设定的阈值是,每飞行小时“可能导致无法继续安全飞行和着陆的故障条件”的概率不应超过1×10⁻⁹(十亿分之一)(Koessler等,2024)。
与会者指出,为前沿人工智能风险设定类似的阈值存在挑战。挑战包括:(a)前沿人工智能系统按定义是新颖的且不断演变,缺乏过往事件数据;(b)前沿人工智能系统是通用的,这使得很难估算它们可能带来的风险。尽管如此,仍有人反驳称,核能行业在开始讨论阈值时也是新颖的。
测量至关重要
与会者指出,当阈值可以被评估时,它们才有用。许多开发人员建立了可以通过模型评估来衡量的能力阈值;其他组织,包括政府,也可以评估这些能力。他们讨论了与衡量能力、风险和计算阈值相关的挑战。
与会者讨论了开展多种类型模型评估的价值,包括人类研究。人类研究对于追踪已知风险和识别新风险至关重要。它们还可以帮助人们了解前沿人工智能系统的能力,并启动与非人工智能专家关于技术发展方向的讨论。
一些与会者提出了在不同抽象层次(如风险和能力)之间转换阈值的挑战。这可能会影响阈值的效率、稳健性和有效性。围绕“风险建模”过程的不确定性导致了阈值设定的多样化方法。
正在形成的共识
人工智能开发人员发布安全框架,重点关注缓解一组相似的风险。与会者指出,人工智能开发人员通常为化学、生物、放射性、核(CBRN)、网络安全和自主性风险设定能力阈值。然而,也有人警告不要在证据基础不同的情况下,将相同的标准应用于每个领域。例如,网络犯罪是一个已知问题,而自主性风险则更为新颖。
与会者还警告要警惕群体思维。不同的利益相关者可能会根据他们的专业知识、影响力范围或感知价值而优先考虑不同的风险。应定期根据广泛的潜在危害场景重新评估CBRN、网络安全和自主性风险的阈值。
设定阈值应具有包容性
阈值回答了这样一个问题:安全到什么程度才算足够安全?与会者承认,因此阈值充满了价值判断。概率风险阈值的量化偏见可能会掩盖这一事实的程度。
与会者强调了政府、人工智能开发人员、民间社会、学术界和公众之间在设定人工智能风险阈值方面持续互动的重要性。人工智能行动峰会的讨论开启了这一紧迫的进程。
开放性问题:测量和协调
AISI和OECD人工智能部门欢迎就阈值进行进一步的研究和合作。人工智能行动峰会讨论中提出的一些开放性问题包括:
测量:应采用哪些会计和评估方法来衡量每种类型的阈值?如何减少可操纵性并激励负责任的风险管理?
协调:如何促进人工智能专家和非人工智能专家在阈值设定中的合作并达成共识?
应对:有效的阈值治理是什么样的?如果超过阈值,应采取哪些行动?
欧盟《人工智能法案》的GPAI分级体系与产业界的安全框架演进,揭示了AI治理中技术标准与法律规则的交织困境。当前国际协调进程虽取得初步共识,但在风险量化、执行机制等关键环节仍面临结构性挑战。
欧盟AI法案的GPAI分级框架:简化的代价
根据2024年7月正式生效的《欧盟人工智能法案》(Regulation (EU) 2024/1689),系统性风险GPAI(通用目的AI)模型的分类标准已明确为单一量化阈值辅以行政裁量机制(第51条)。这一修正反映了立法者对技术动态性的回应,也揭示了法律框架与技术创新间的张力。
系统性风险判定的法律要件 法案第51(1)条确立了两类认定路径:
算力推定标准:训练计算量超过 10的25次 FLOPs的模型被自动推定为具有系统性风险(第51(2)条)。该阈值直接对应GPT-4级模型的训练规模,构成法律上的客观推定要件。
行政裁量机制:欧盟委员会可基于独立科学专家组的“专业警示”(qualified alert),认定未达算力阈值但具有等效风险的模型(第51(1)(b)条)。裁量依据包括模型在生物安全、网络安全等领域的突破性能力(附件XIII)。
产业安全框架的差异化路径
Anthropic的ASL 2.1体系
在2024年更新的《负责任扩展政策》中,Anthropic将AI安全等级(ASL)扩展至四级,并引入两项关键革新:
①能力触发机制:当模型在生物武器设计、自主代码优化等8项高风险任务中达到人类专家水平的80%时,自动升级至ASL-3;
②安全缓冲区规则:要求模型能力距离风险阈值至少保持6个月的技术代差,通过限制训练计算量增速(每季度不超过1.5倍)实现。
该框架的争议点在于其"能力先行"逻辑——ASL-3判定仅需模型在实验室环境下展示特定能力,无需实际危害发生。这可能导致过度保守的研发限制,例如Claude 3因在模拟测试中展现生物分子设计潜力而被暂停商业部署[4]。
OpenAI的风险聚合策略
OpenAI的预备框架采用三维评估矩阵:
①风险维度:网络安全、生物威胁、说服力、自主性;
②严重等级:低(Low)、中(Medium)、高(High)、严重(Critical);
③处置规则:以四类风险中最高等级决定全局处置措施。例如若生物威胁评级为"高"而其他为"中",则整个模型需停止部署直至风险缓解至"中"以下[5][6]。
该方法强调风险联动的复杂性——模型在单一领域的突破可能触发全局限制。但批评者指出,其评估数据未完全公开,且第三方审计仅覆盖15%的风险场景,可能低估长尾风险。
风险阈值的国际协调挑战
标准割裂与互认困境
当前主要存在三类阈值体系:欧盟的算力基准(10^25 FLOPs)、Anthropic的能力触发(ASL分级)、OpenAI的风险聚合(预备框架)。首尔AI安全峰会虽推动建立"不可容忍风险"概念,但各国对具体指标仍未达成共识。
执行机制的碎片化
欧盟通过AI办公室实施集中监管,有权直接调取模型权重进行检查;美国则采用联邦与州分立监管,FTC主要关注商业实践而非技术风险。这种差异催生"监管套利"现象。尽管首尔峰会提出建立"阈值突破全球通报机制",但各国对信息共享范围存在分歧。
技术标准的法律化
技术标准的法律化已成为AI治理的核心战场。欧盟试图通过刚性算力阈值确立监管权威,产业界则以动态能力框架保持灵活性,这种张力本质上是"预防原则"与"创新优先"的价值冲突。未来两年,风险阈值体系可能向"混合模式"演进:基础性指标(如算力、参数规模)由国际条约强制规定,而能力与风险指标作为补充性标准。正如OECD专家所言,真正的挑战不在于设定阈值,而在于构建可审计的测量协议——没有科学的度量,任何法律框架都将沦为空中楼阁。
下面本公众号会提供OECD在巴黎AI行动峰会上主导的关于前沿人工智能的阈值研讨会主要成果的全文翻译。
前沿人工智能的风险阈值:来自人工智能行动峰会的见解
多少个炎热的日子构成热浪?水位上升到什么程度算洪水?多少人算作人群?
我们生活在一个由阈值定义的世界中。阈值为现实的混乱连续体带来了秩序,并帮助我们做出决策。它们可以被视为预定义的点,超过这些点后,就需要采取额外的缓解措施。
越来越多的人对将阈值作为治理先进人工智能系统(即前沿人工智能)的工具表现出兴趣。像谷歌DeepMind、Meta和Anthropic这样的人工智能开发企业已经发布了安全框架,其中包括其系统风险不可接受的阈值。经济合作与发展组织(OECD)最近就阈值主题进行了专家调查和公众咨询。
为了深化这一讨论,英国人工智能安全研究所(AISI)和OECD人工智能部门在人工智能行动峰会上召集了领先专家,讨论阈值在人工智能治理中的作用。来自核能和航空业的代表与前沿模型论坛、谷歌DeepMind、Meta、Humane Intelligence、SaferAI和欧盟人工智能办公室的专家一起参加了讨论。本文总结了讨论中的一些关键见解。

注:这些术语目前没有普遍接受的定义。阈值的类型可能远不止这些,也不限于模型属性。我们考虑将能力阈值定义为将人工智能能力与相应缓解措施相对应的阈值。然而,其他人可能对其有不同的定义,仅将其视为能力,而将缓解措施视为一种响应,而不是阈值的定义属性。
警惕类比
核能和航空业使用精确的概率阈值来表达可接受的风险水平。例如,美国联邦航空管理局(FAA)设定的阈值是,每飞行小时“可能导致无法继续安全飞行和着陆的故障条件”的概率不应超过1×10⁻⁹(十亿分之一)(Koessler等,2024)。
与会者指出,为前沿人工智能风险设定类似的阈值存在挑战。挑战包括:(a)前沿人工智能系统按定义是新颖的且不断演变,缺乏过往事件数据;(b)前沿人工智能系统是通用的,这使得很难估算它们可能带来的风险。尽管如此,仍有人反驳称,核能行业在开始讨论阈值时也是新颖的。
测量至关重要
与会者指出,当阈值可以被评估时,它们才有用。许多开发人员建立了可以通过模型评估来衡量的能力阈值;其他组织,包括政府,也可以评估这些能力。他们讨论了与衡量能力、风险和计算阈值相关的挑战。
与会者讨论了开展多种类型模型评估的价值,包括人类研究。人类研究对于追踪已知风险和识别新风险至关重要。它们还可以帮助人们了解前沿人工智能系统的能力,并启动与非人工智能专家关于技术发展方向的讨论。
一些与会者提出了在不同抽象层次(如风险和能力)之间转换阈值的挑战。这可能会影响阈值的效率、稳健性和有效性。围绕“风险建模”过程的不确定性导致了阈值设定的多样化方法。
正在形成的共识
人工智能开发人员发布安全框架,重点关注缓解一组相似的风险。与会者指出,人工智能开发人员通常为化学、生物、放射性、核(CBRN)、网络安全和自主性风险设定能力阈值。然而,也有人警告不要在证据基础不同的情况下,将相同的标准应用于每个领域。例如,网络犯罪是一个已知问题,而自主性风险则更为新颖。
与会者还警告要警惕群体思维。不同的利益相关者可能会根据他们的专业知识、影响力范围或感知价值而优先考虑不同的风险。应定期根据广泛的潜在危害场景重新评估CBRN、网络安全和自主性风险的阈值。
设定阈值应具有包容性
阈值回答了这样一个问题:安全到什么程度才算足够安全?与会者承认,因此阈值充满了价值判断。概率风险阈值的量化偏见可能会掩盖这一事实的程度。
与会者强调了政府、人工智能开发人员、民间社会、学术界和公众之间在设定人工智能风险阈值方面持续互动的重要性。人工智能行动峰会的讨论开启了这一紧迫的进程。
开放性问题:测量和协调
AISI和OECD人工智能部门欢迎就阈值进行进一步的研究和合作。人工智能行动峰会讨论中提出的一些开放性问题包括:
测量:应采用哪些会计和评估方法来衡量每种类型的阈值?如何减少可操纵性并激励负责任的风险管理?
协调:如何促进人工智能专家和非人工智能专家在阈值设定中的合作并达成共识?
应对:有效的阈值治理是什么样的?如果超过阈值,应采取哪些行动?
