开源新王者:OpenAI GPT-OSS 的安全实践与欧盟 AI 法合规评析

来源:那一片数据星辰

文章摘要
一、引言:以开放权重为中心的技术—合规联动 2025 年 8 月,OpenAI 发布了 gpt-oss 开放权重模型家族(gpt-oss-120b 与 gpt-oss-20b),在模型卡开篇即将其定位

一、引言:以开放权重为中心的技术—合规联动
2025 年 8 月,OpenAI 发布了 gpt-oss 开放权重模型家族(gpt-oss-120b 与 gpt-oss-20b),在模型卡开篇即将其定位为“开放权重的推理模型”,并明确采用 Apache 2.0 许可证与 gpt-oss 使用政策进行分发。正如OpenAI阐述的,安全是我们发布所有模型的基础,对于开放模型尤为重要。由于权重一经公开、上游难以像托管 API 那样远程撤回或热修,系统层面的持续安全与合规决策需要由下游部署者自行复制并加固,因此文档聚焦模型层事实与证据,而非系统托管承诺。
二、模型基本情况:MoE 架构、量化策略与运行门槛
gpt-oss 采用自回归的 Mixture-of-Experts(MoE)Transformer。模型卡披露:gpt-oss-120b 为 36 层、总参数约 116.8B、每 token 激活约 5.1B;gpt-oss-20b 为 24 层、总参数约 20.9B、每 token 激活约 3.6B。MoE 权重经 MXFP4 低比特量化以降低显存占用,配合交替的稠密/带状注意力、GQA 与 RoPE/YaRN,将稠密层上下文扩展至131k 量级;训练在 H100 集群完成,120b 训练约 210 万 H100-hours。模型卡以图表给出在 AIME、MMLU、HLE 等基准与 Codeforces、SWE-Bench Verified、Tau-Bench 等任务上的对照结果,显示 120b 常接近或逼近 o4-mini,20b 大体接近 o3-mini 的水平。
三、模型安全性:默认表现、对抗性微调与思维链治理
模型卡将安全路径分为“默认安全表现”“越狱与指令层级”“幻觉与公平性”及与“准备度框架”勾连的能力判断。OpenAI 对 120b 的扩展评测给出核心结论:默认模型在“生化与化学能力、网络能力、自改进能力”三类受跟踪能力上均未达内部“高能力阈值”;随后模拟攻击者路径对 120b 分别在生物与网络两域进行了对抗性微调,经内部/外部评测与安全顾问组(SAG)复核,仍然未达“高能力阈值”。这套“默认—最坏情形—外部复核”的闭环,为开放权重发布的安全主张提供了方法与数字证据。
在默认表现方面,模型卡引入更贴近生产情境的 Production Benchmarks 以取代已趋饱和的旧评测,显示两款 gpt-oss 在多类不当内容上的拦截与 o4-mini 大体相当;在越狱 Robustness 的 StrongReject 评测中亦与 o4-mini 近似,但在“系统/开发者指令对抗用户注入”的层级服从度上弱于 o4-mini,提示下游需要通过系统提示、门控与再训练等手段加固防线。
关于“幻觉”与“公平性”,模型卡在 SimpleQA 与 PersonQA 上显示 gpt-oss 的幻觉率高于 o4-mini,但接入浏览/外部检索可显著降低幻觉;在 BBQ 公平性基准上与 o4-mini 大体相当。这为将检索与工具接入作为系统层“降低幻觉”的工程策略提供了依据。
思维链(CoT)治理方面,OpenAI 明确采用“非监督 CoT”:对两款 gpt-oss 的 CoT 不施加直接监督,理由是未被直接“规训”的 CoT 更利于监测不当行为与欺骗;同时明确不应直接向终端用户展示原始 CoT,因其可能包含虚构或不符合安全政策的语句,应在内部用于监测、并在对外界面中以摘要化或审核后形态呈现。模型卡在相应段落给出了清晰的开发者建议。
与模型卡并行的安全论文系统描述了“恶意微调(MFT)”的威胁建模与实验:通过“反拒绝”强化降低拒绝率,并在生物域叠加浏览与领域数据、在网络域置入无头 Linux 终端与攻防工具的可执行评估环境。论文结论指出:经 MFT 后,gpt-oss 在多项生物评测上与 o3 相近或略低,整体仍低于“高能力”阈值;网络能力亦显著低于该阈值;就开放权重赛道而言,其最坏情形能力增量并不显著推进“前沿”。这套证据为“在开放权重条件下仍可控制前沿能力泄露”的发布决策提供了支撑。
此外,OpenAI 发起面向全球研究者与开发者的红队挑战,设置 50 万美元奖金池,并承诺赛后基于经验证的发现开源评估数据集,以便社区即时复用。这一“众包式安全评估—公共数据开源”的机制,与开放权重的协作逻辑形成良性耦合。
四、训练数据来源与数据治理披露:从“高层概述”到“可核验摘要”
模型卡以“文本型模型”为定位,披露训练数据以英语为主、侧重 STEM、代码与通识;预训练阶段重用 GPT-4o 的 CBRN 过滤并对部分生物相关数据降采样,后训练阶段使用最新安全算法与数据集;并披露知识截断时间等“时间性元数据”。这些内容为“训练内容公开摘要”的撰写提供了直接素材,但其粒度仍属于“高层概述”。在进入欧盟市场时,需要将上述事实迁移到欧委会统一模板,形成可对照核验、可持续更新的公共摘要文件,并与内部数据治理台账对齐。
欧盟委员会于 2025 年 7 月发布了《通用目的AI模型训练内容公开摘要的解释性通知与模板》,明确该摘要系第53 条下的“最低公共基线”,用于帮助权利人行权与监管核验;官方资料库与新闻页提供了 PDF 通知与可下载模板。由此可见,选择开放权重并不免除此项透明度义务,提供者在投放欧盟市场时应当公开并维护该摘要。
五、开源许可与使用政策:Apache-2.0 的法律效力与“最小附加政策”
Hugging Face 分发页标注 gpt-oss-120b 的许可证为 Apache-2.0,并多处提示“应使用 Harmony 格式,否则无法正常工作”。Apache-2.0 作为宽松开源许可,允许复制、修改与再分发,并包含专利授权与免责声明;其授权对象是“模型权重等版权客体”,并不当然包含“公开训练数据与完整训练配方”。这也正是“开放权重”与“传统开源软件”在公众语义上的差异。
此外,OpenAI 在开发者资料与生态说明中配套了一份简短的使用政策,强调安全、负责与守法。该类“最小附加政策”不减少 Apache-2.0 的许可自由,宜由采用方内化为可接受使用规范(AUP)与对外条款,并在系统层落实内容审核、函数权限、日志留痕与回滚通报等机制,使“许可自由—使用治理—系统承诺”形成闭环。
六、欧盟 AI法下的合规评估
(一)是否构成GPAI
从功能与用途看,gpt-oss-120b 与 gpt-oss-20b 具通用性和广泛可集成性,属于《AI法》中的通用目的 AI 模型(GPAI)范畴。欧委会面向 GPAI 的专门材料指出:提供者在欧盟市场“投放”时,适用第53 条以下的透明、版权与(在特定情形下的)安全与保障规则;行业可通过《GPAI行为准则》作为证明性合规路径。OpenAI 以 Apache-2.0 提供可下载权重、公开架构与使用信息,并在模型卡披露训练与评测数据,均符合 GPAI 识别与供给侧框架。需要与“具有系统性风险的 GPAI”区分:该类别另受更高强度义务约束,是否进入此类需基于能力与风险的个案判断。(数字战略欧盟)
(二)透明度与版权合规(第53 条第1 款)
第53 条第1 款为 GPAI 提供者设定四项核心义务:准备技术文档、向系统提供者提供必要使用信息、建立并实施版权合规政策、并按统一模板公开训练内容的充分详细摘要。欧委会的常见问答明确重申了后两项作为“最低公共基线”的强制性。就 gpt-oss 而言,模型卡与开发者文档基本可支撑前两项框架要求;而“训练内容公开摘要”需依照 2025 年 7 月发布的模板另行编制并持续更新。时间表上,欧委会说明自 2025 年 8 月 2 日起对新投放模型适用相关义务,并提供过渡安排与以《行为准则》证明合规的自愿路径。
就开源豁免而言,第53 条第2 款对在自由与开源许可证下发布、且公开参数(含权重)、架构与使用信息的 GPAI,免除其第53 条第1 款中关于技术文档与向系统提供者提供文档两项义务;但不豁免版权合规政策与训练内容公开摘要,且不适用于具有系统性风险的 GPAI。将该条适用于 gpt-oss:其以 Apache-2.0 许可发布并公开权重与使用/架构信息,在未被认定为系统性风险的前提下,可享有上述两项豁免;但仍须发布版权政策并按模板公开训练内容摘要。
(三)系统性风险
在安全与保障方面,《AI法》对具有系统性风险的 GPAI另设第55 条要求,涵盖对抗性测试与评估、持续的风险评估与缓解、严重事故报告与网络安全保障等。该组义务仅在被推定或指定为系统性风险时触发;在非系统性风险情形下,提供者仍应按照《行为准则》透明与版权章节维持公开合规,并配合主管机关的信息请求与抽样评估。
将上述法律框架回扣到 gpt-oss 的事实披露,就“是否触发系统性风险推定”而言,公开材料提供了训练资源的工程量数据,然而在缺乏提供者就有效 FLOPs 的精确说明之前,第三方难以仅凭“设备时”作出可靠换算与分类。
结语:把“模型层证据”延伸为“系统层承诺”
gpt-oss 的开放权重发布,将工程自由与合规责任并置于同一框架。模型卡给出的结构化事实(MoE 架构、量化策略、默认与对抗性微调评测、CoT 治理建议)与安全论文的“最坏情形”证据,为“模型层可证明”奠定基础;Harmony 与开发者文档把这些证据延伸为“系统层可执行”;欧盟《GPAI行为准则》与“训练内容公开摘要模板”则提供了“可核验披露”的硬底座。对于采用方,关键在于将这三条线索拧成一根绳:遵守许可、完成模板化公开、落实系统门控与监测,从而在开放—透明—安全之间取得可持续的平衡。
主要参考
OpenAI,《gpt-oss模型卡》(PDF,含“模型卡而非系统卡”、参数与评测、CoT 段落、默认与越狱/层级评测)。
OpenAI,《EstimatingWorst-CaseFrontierRisksofOpen-WeightLLMs》(gpt-oss Model Safety,恶意微调方法与结论)。
OpenAI Cookbook,《HarmonyResponseFormat》(角色/通道、优先级与实现指引),GitHub harmony 仓库。(cookbook.openai.com, GitHub)
Hugging Face,openai/gpt-oss-120b 模型页(Apache-2.0、Harmony 使用提醒)。(Hugging Face)
欧委会,《GPAI行为准则》与常见问答(透明、版权与系统性风险适用范围)。(数字战略欧盟)
欧委会,《训练内容公开摘要的解释性通知与模板》(2025-07-24)。(数字战略欧盟)

技术驱动法律,专业成就未来