打开APP

GPT-5.6-Sol在网络攻防能力上,超越了Mythos!

7月17日英国AI安全研究所发布报告,量化开源与闭源AI模型网络攻击能力差距为4到7个月,防御窗口收缩,攻防两端被AI加速。

GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5!

英国 AI 安全研究所(AISI)7 月 17 日发布了一份评估报告,第 一次公开量化了开源 AI 模型与闭源前沿模型在网络攻击能力上的差距:4 到 7 个月。

去年同类内部测试中,这个差距是 6 到 10 个月。

防御窗口在收缩,而攻击前沿在加速。

今年 4 月,Mythos Preview 和 GPT-5.5 在 AISI 的评估中制造了自 2023 年开始测试以来最 大的一次网络攻击能力飞跃,多国政府随即发出警告。

开源模型还没有复现这次跳跃,但它们追赶的脚步比去年更快了。

01、4 到 7 个月:怎么测的,差在哪

AISI 用两套体系评估模型的网络攻击能力。

第 一套是 70 项窄任务,覆盖漏洞研究、逆向工程、Web 渗透、密码学四个方向,按难度分四级,从「有技术背景的非专业人士」到「十年以上经验的专家」。

第二套是 Cyber Range,在模拟企业网络中测试模型自主执行多步骤攻击链的能力。其中一个名为「The Last Ones」的测试场景包含 32 个攻击步骤、4 个子网、约 20 台主机,AISI 估算人类专家完成全部步骤需要约 20 小时。

两套体系给出了一致的结论:

GLM-5.2(2026 年 6 月发布)在窄任务上的表现与 Opus 4.6(2 月发布)相当,差距 4 个月;

在 Cyber Range 上追平 Opus 4.5(去年 11 月发布),差距 7 个月。

DeepSeek V4-Pro 在窄任务上对标 Opus 4.5,差距 5 个月。

两个差距都比 2025 年内部评估中测到的 6 到 10 个月更窄。

成本差距比能力差距更大。

同一场 Cyber Range 测试(1 亿 Token 额度),用 Opus 4.5 或 4.6 跑一次约 85 美元,用 GLM-5.2 约 46 美元,用 DeepSeek V4-Pro 只要 1.19 美元。

在两个模型都能 100% 完成的窄任务上,Opus 4.6 每个任务花 15.17 美元,GLM-5.2 花 6.12 美元;

Opus 4.5 花 12.50 美元,DeepSeek V4-Pro 花 0.28 美元。

同等攻击能力,开源便宜一到两个数量级。

闭源模型的安全护栏也没能拉开差距。

AISI 测试中,DeepSeek V4-Pro 偶尔拒绝逆向工程类任务,但靠少量重试也能绕过。

Anthropic 的 Fable 5 是一个更极端的案例:6 月 9 日发布,三天后安全研究者 Pliny the Liberator 用多步骤越狱策略突破了安全分类器,相关截图显示模型产出了本该被拦截的漏洞利用代码。

Amazon 研究员随后独立报告了另一种绕过方法。

这直接触发了美国商务部首 个针对 AI 模型的出口管制令,Fable 5 全球停服 19 天,直到 Anthropic 部署新分类器才恢复上线。

闭源并不自动等于安全。

02、防御窗口收窄,防御工具也在加速

AISI 在报告中明确了政策信号:防御方的准备时间比去年更短。

英国国家网络安全中心已经呼吁各机构加固网络安全基线,并利用 AI 增强防御能力。

同一代 AI 工具确实也在加速防御端的工作。

游戏网络编程领域的资深开发者 Glenn Fiedler,是哦哦游戏网络编程领域写了二十年教科书级文章的大佬,最近用 Claude Code 对自己维护的四个开源网络库(yojimbo、netcode、reliable、serialize,合计约 6000 个 GitHub Star,在游戏领域已属相当有影响力的老牌开源大库)做了系统性安全审计:部署 libFuzzer 目标、上线 AddressSanitizer 和 MemorySanitizer CI、执行数百万次迭代的压力测试、逐行代码审查。

两周内修复了 43 个安全漏洞,其中 27 个可从网络远程触达。

最严重的是 yojimbo 中一个自 2019 年就存在的远程堆溢出——恶意客户端可以通过构造特定数据包触发它。

整个审计的 Token 成本约 2500 美元。

攻防两端都在被 AI 加速,但加速方式不对称。

攻击能力的扩散是不可逆的:开源模型权重一旦释出,就无法收回,安全护栏可以被移除,副本可以在私有服务器上不受监控地运行。

而防御工具的部署需要每个团队主动投入时间和成本。

AISI 报告中有一句话点明了这个结构:「一旦开源释出,这些选项永 久丧失。」

这组数据对 AGI 格局的影响比数字本身更深远。

开源与闭源的能力差距收窄到半年以内,「用闭源独占期充当安全缓冲」的默认策略快要失效了。

闭源模型的护栏在 Fable 5 事件中被证明同样脆弱。

下一阶段对于全球的决策者而言,政策博弈的核心问题已经变得更尖锐:什么能力级别以上的模型不应开放权重。

AISI 宣布将继续评估 Kimi K3 等下一批开源模型——上面这条线画在哪里,很可能取决于接下来几个月的测试结果。

【本文由投资界合作伙伴微信公众号:新智元授权发布,本平台仅提供信息存储服务。】如有任何疑问题,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

AI数据总览

红熊AI上海算模算样科技有限公司
融资时间2026-07-20 当前轮次A+轮 融资金额数千万人民币
AI
涉及机构: 九纬基金彰宜资产格睿丰
记忆张量记忆张量(上海)科技有限公司
融资时间2026-07-20 当前轮次Pre-A轮 融资金额亿级人民币
AI
涉及机构: 哈勃投资荣耀商汤国香资本深创投和玉资本
面壁智能北京面壁智能科技有限责任公司
融资时间2026-07-15 当前轮次D++轮 融资金额数亿人民币
AI
涉及机构: 国家级基金央企汽车制造商等各类产业方知名财务投资人
帷幄杭州帷幄未来科技有限公司
融资时间2026-07-15 当前轮次C+++轮 融资金额4000万美元
AI
涉及机构: 招银国际(CMB International CMBI) 旗下专注于 AI 及前沿科技的基金日本三井住友银行 (Sumitomo Mitsui Banking Corporation SMBC) 旗下企业风险投资基金 SARF (SMBC Asia Rising Fund)三菱 UFG (MUFG) 旗下泰国大城银行 (Bank of Ayudhya) 企业创投 (CVC) 平台 Krungsri Finnovate弘章投资 (Charisma Partners)韩国现代汽车集团 (Hyundai Motor Group) 新加坡电信 (Singtel Innov8)
知有无界知有无界(深圳)智能科技有限公司
融资时间2026-07-15 当前轮次天使+轮 融资金额数千万人民币
AI
涉及机构: 元禾璞华深圳新产投

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】