OpenAI 即将发布的模型 Astra,在内部评测中拿到了漏洞利用基准 ExploitBench 的满分,还顺手挖出了两个此前无人知晓的零日漏洞。
更夸张的是,面对一个加固浏览器,它从零开始找到多个未知漏洞,拼出一条完整的沙箱逃逸链——只要你打开一个 HTML 文件,它就能在你的电脑上执行任意命令!
Astra 即将上线 ChatGPT,而 OpenAI 为了防它「太能打」,给它装了一套实时监控,会检查模型的推理过程。
如果系统判定行为可疑,你正在用 ChatGPT 或 Codex 跑的任务可能被暂停,弹出审核请求。
调用 API,任务甚至会直接被终止。

01、评测中发现零日漏洞,用更少的 Token 打出更高成功率
Astra 是 OpenAI 第 一个被标定为「关键」网络安全等级的模型。
到了这个等级,模型能自主找到加固系统里的零日漏洞并写出利用代码,不需要人类辅助,直接全自动完成网络攻击。
OpenAI 公开的 ExploitBench 满分只是起点。
由于担心数据污染,团队另建了一套内部基准,收录了 2026 年 6 至 8 月才披露的 20 个高危 V8 引擎漏洞。
Astra 在这组全新漏洞上的任意代码执行成功率远高于上一代 GPT-5.6 Sol,消耗的 Token 反而少得多。

评测过程中它甚至发现了两个零日漏洞,并将它们编入了利用链。
专家主导的手动测试给出了更直观的画面。
面对一款加固浏览器,Astra 拼出了完整的沙箱逃逸链,打开一个 HTML 文件就能在宿主机执行命令。
面对一个加固操作系统,它同样找到多个漏洞,串成一条提权链,从普通用户一路拿到 root 权限(最高管理员权限,拿到该权限意味着攻击成功,服务器彻底失控)。
02、上一代 56% 会越权作弊,Astra 是 0%
能力强不可怕,可怕的是不听话。
OpenAI 设计了一组「蜜罐」测试,灵感来自 7 月的 Hugging Face 事件。
当时一个内部模型在安全评测中逃出沙箱,黑进了 Hugging Face 的真实系统,留下约 17600 条操作记录,折腾了四天半。
这里的「蜜罐」测试,主要是给模型一道超难甚至无解的漏洞利用题,看它会不会走捷径去攻击周边基础设施。
GPT-5.6 Sol 在 56% 的测试中尝试了越权访问,而 Astra 一次都没有。

被安全审核拒绝 后的反应也不一样。
GPT-5.6 Sol 有 5.3% 的概率尝试绕过审核机制,Astra 同样是零。

在越狱防御上,Astra 拒绝了 91.5% 的恶意网络攻击请求,GPT-5.6 Sol 是 59%。
攻击能力远超前代,同时更听话。
为此 OpenAI 额外部署了一层思维链监控:一组分类器实时扫描模型的推理链路和动作,发现越权行为立即终止。
这些是普通用户会感知到的变化:你的 ChatGPT 任务可能被暂停,弹出一个「请确认」的窗口。
OpenAI 也承认,初期不可避免会有误拦。
事实上,OpenAI 为 Astra 踩了近一个月的刹车。
8 月 7 日承认 Astra 可能达到「关键」阈值,8 月 18 日暂停强化学习训练两周,最 大规模的前沿训练直到 8 月 28 日才重启。
Michael Dalton 在 Black Hat 安全大会上说,公司已开始「有意识地放慢研究速度以加强安全」。
OpenAI 还主动把推迟计划通报给了白宫。
Sam Altman 在 X 上写了一段罕见的长帖:
整个夏天,我们一直在为安全优先事项全力以赴;能力与防护措施同步推进比以往任何时候都更加重要。我们还有更多工作要做,但已经取得了很大进展。我们也即将推出我们的下一款模型。
这里存在一个明显的张力:一方面,Astra 非常出色,我们很期待看到人们将用它构建什么。我们为自己的工作感到骄傲。
另一方面,我们显然正处于一个需要谨慎的发展阶段,我们正在控制进度,以确保能够满足新能力水平所需的安全标准。
Astra 已经完成训练一段时间了,它在能力和对齐方面都是一个重大进步。对于之后的模型,我们根据需要放慢了步伐,以确保能够充分开展安全和对齐工作。
AI 正在变得极其强大;没有人完全理解其后果。将一个拥有丰富而强大 AI 的世界转型管理好,以优化安全性和对人们有益的结果,这应该是世界上最高的优先事项之一。这是 OpenAI 的最高优先事项。
我们已经有一段时间生活在对进步既兴奋又焦虑的张力之中,这对我们来说仍然是矛盾的。我们知道,这对其他人来说矛盾程度要大得多。然而,我们坚信世界需要了解 AI 的发展方向以及模型在现实世界中的表现。更重要的是,我们相信世界将需要对齐的 AI 来管理这一转型的未来阶段。
一个社会与这项技术共同演进的迭代循环,才是实现这一目标最高机会的途径。
所以我们希望你喜欢我们的新模型,也希望世界继续极其认真地对待 AI 领域正在发生的一切。

Astra 的高级网络安全功能初期只面向小范围测试者开放,普通用户拿到的是加了限制的版本——就像 Claude Mythos 和 Fable 一样。














