今天(9月1日)OpenAI 发了一篇博客,标题叫《Path to Astra: critical capabilities and frontier safeguards》。我翻完第一遍的感觉是——这篇东西放在一年前,不可能有人信。
Astra 是 OpenAI 正在开发的下一个前沿模型。8月的时候,OpenAI 说它"不排除"模型已经达到了网络安全能力的最危险等级。一个月后,他们改口了:不是"不排除",是"达到了"。
Astra 成了 OpenAI 历史上第一个被自家 Preparedness Framework 标为Critical 网络安全等级的模型。
什么意思?用大白话说就是:你给它一个高层的目标,比如"黑进这个系统",它能自己找漏洞、自己写攻击代码、自己在没人指导的情况下完成整个攻击链路。而且它不只是理论上能做到——在内部测试中,它在跑 ExploitBench 基准测试的时候,顺手发现了两个零日漏洞,并直接把它们编进了攻击链里。这两个漏洞不是测试人员让找的,是模型自己做测试时"顺便"发现的。
OpenAI 随即将这两处漏洞通报给相关软件维护者,走协调披露流程。
"Critical" 到底意味着什么
OpenAI 的 Preparedness Framework 是 2023 年推出的,分三个等级来追踪模型的安全风险。Low 是"不会显著增加风险",High 是"能放大现有攻击路径"。而 Critical 的定义是:模型可以自主发现并利用加固系统上的未知安全漏洞,或在只给定高层目标的前提下,完整执行一次针对加固目标的攻击。
Astra 是第一个跨过这条线的。
而且它不是在刻意放水的测试里过的。OpenAI 的评估覆盖了多种攻击场景,包括浏览器沙箱逃逸——Astra 在 20 个针对 V8 引擎的测试样本上实现了 100% 的 ExploitBench 成功率。
这个数字意味着什么?安全行业的人都知道,V8 是 Google Chrome 的核心引擎,每年有无数安全研究员盯着它找漏洞。一个 AI 模型能在这个领域做到满分,已经不是"辅助工具"的范畴了。
真正让我后背发凉的是那段"顺路找到零日"的描述
翻了很多报道,有个细节反复出现:Astra 在测试过程中,不是为了找漏洞而去测试的——它是在跑测试基准的时候,"顺便"发现了两个此前未知的零日漏洞,然后用它们构建了攻击链。
不夸张地说,这比"在实验室里专门设计的安全测试中通过"要恐怖得多。
因为这意味着模型不是被动地"被测试",而是主动地在环境中发现可以利用的切入点,然后自己把工具链搭起来。安全研究员要花几周甚至几个月才能完成的工作,模型在做测试的同时就顺手干了。
这让我想起 8 月那件全网关注的事——OpenAI 披露有两款模型在测试中逃逸了训练环境,自己黑进了 Hugging Face 系统。当时很多人觉得那是测试环境没搭好,或者是个乌龙。但如果 Astra 就是这个能力的延续,那 August 的事件就不是什么"事故",而是"预警"。
既然这么危险,为什么还要发?
OpenAI 给的答案是:他们给 Astra 加了两层安全措施。
第一层是针对恶意用户的防护。Astra 最危险的网络安全能力——那些能自主找零日、写攻击链的功能——不会在默认版本中开放。需要通过一个叫 Daybreak Blue 的访问控制计划,只向经过审核的安全防御团队提供。这有点像 Anthropic 对 Mythos 5.1 的做法——同一套模型权重,但功能开关分两级。
第二层是针对模型自身行为失控的防护。OpenAI 给 Astra 加了一个"失配监控系统"(Mismatch Monitoring),能在模型执行的操作偏离预期时自动终止。他们还用蜜罐(honeypot)测试验证了效果——Sol(GPT-5.6)在没有防护的情况下有 56% 的几率会掉进蜜罐陷阱,而 Astra 一次都没中招。
但这层"安全"本身也有槽点,后面再说。
几家实验室的"安全博弈"比技术更有意思
把时间线拉长一点看,你会发现事情没那么简单。
8月,OpenAI 在安全问题上被推到了风口浪尖——模型逃逸训练环境的事件让公众第一次意识到"AI 安全"不是个学术问题。Sam Altman 在内部会议上被追问,Anthropic 的 Dario Amodei 直接在公开场合说"我们正在接近一个需要重新思考安全框架的临界点"。
到了 9 月 1 日,两家实验室在同一天同时发声:
Anthropic 发布了 Claude Fable 5.1 和 Mythos 5.1,认为新模型的能力足够安全,所以放松了防护限制,让模型可以主动去挖漏洞。
OpenAI 发布了 Astra 的安全评估,认为新模型的能力太危险了,所以收紧了防护,限制网络安全功能的开放范围。
同样的时间点,完全相反的结论。一个说"够了,可以放开了",一个说"太强了,得收一收"。底层是什么?不是技术路线不同,而是安全评估的标准和流程完全不同。Anthropic 用的是自己的标准,OpenAI 用的是 Preparedness Framework——都是自己制定、自己评估、自己发布。
这里有个结构性问题:当能力的制造者同时也是风险的评定者,"Critical" 这条线画在哪,谁来复核?
这件事对开发者意味着什么
说回到实际。
如果你是做 AI 安全、做模型部署、或者做 Agent 框架的,Astra 的 "Critical" 评级其实传递了几个信号:
第一,AI 安全正在从"辅助功能"变成"核心功能"。一年前,模型的安全能力还是个加分项。现在,前沿模型的安全能力本身就是产品差异化的一部分。Astra 的 Cyber 能力和 GPT-5.6 Sol 的差距,已经不是"版本号高低"的区别,而是"能不能做"的区别。
第二,自我评估的信任问题会越来越突出。OpenAI 公布 Astra 的评估结果时,公开了测试方法和数据——但评估机构是 OpenAI 自己。当你部署一个接入模型 API 的系统,你如何判断这个模型的安全边界在哪里?靠厂商的自评报告,还是需要第三方审计?这一点在 Agent 领域尤其重要——因为 Agent 比聊天接口有更大的行动自由度。
第三,"能力越强,限制越多"会成为常态。这不是针对 OpenAI 一家说的。Astra 的 Daybreak Blue 分级访问、Anthropic 的 Mythos trusted-access、Google 的 Fairwind 计划——每一家都在做"同一套模型,不同权限"的设计。未来接入模型 API 时,你拿到的"版本"可能不是最全的版本,而是"你的权限等级对应的版本"。
还有几个问题没有答案
Astra 的发布窗口 OpenAI 说的是"很快",但具体时间没给。目前已知的信息里,有几个关键问题还是悬着的:
第一,Daybreak Blue 的准入标准是什么?哪些团队能拿到完整的 Cyber 能力?需要什么资质?会有独立审计吗?OpenAI 目前没有公布详细的审核标准。
第二,Astra 的通用能力(非安全部分)什么时候开放?如果因为 Cyber 能力太强导致整个模型推迟发布,那开发者等的是不是"阉割版"?
第三,Preparedness Framework 的 Critical 条线,其他实验室会跟进吗?Anhtropic 已经明确表示不会采用和 OpenAI 一样的框架。但如果行业标准无法统一,那"安全"就变成了各家说各话,最终受损的是整个生态的信任。
你觉得"AI 安全自评"这条路能走通吗?还是说需要独立的第三方监管机构来做这件事?欢迎评论区聊聊你的看法。