打开APP

GPT-6发布,AGI来没来不知道,但AI4S真的飞升了

凌晨OpenAI发布GPT-6 Astra,在多领域刷新SOTA,科研能力显著提升,成本降低,操作能力增强,给AI4S行业带来冲击与思考。

今天,AI科技圈全体狂欢。

凌晨,OpenAI发布了新一代旗舰模型GPT-6 Astra,号称地表最强AI大模型。

它在计算机使用、浏览、软件工程、网络安全、科学和专业工作领域,全部刷新SOTA。

OpenAI副总裁Greg Brockman称这是一次“世代跃迁”,甚至表示它开启AGI的新时代。

目前,绝大多数的报道都是代码、视频生成能力,但关于AI怎么做科学研究这块,几乎没人细讲。

但如果把视线从AGI叙事上移开,再看一眼GPT-6 Astra的能力数据,会发现一个更值得AI4S关注的变化。

AI模型正在跨过一道新的门槛。

这一次,真正值得细读的,不是它离AGI还有多远,而是它已经开始具备什么样的科学能力

Greg Burnham将其描述为:“一个时代的结束,另一个时代的开始。”

01

科研Agent,能力更强了

首先,需要介绍一下Terminal-Bench这个基准。

它已成为AI智能体能力评估的重要标杆,几乎所有前沿实验室都在使用它来追踪和比较各自智能体的性能。

Terminal-Bench Science 0.1,则被称为“科学版Terminal-Bench”,专门测试智能体能否用代码和终端工具完成科研工作流的评测

它一共包含70个由领域研究人员策划的任务,覆盖生命科学、物理科学、地球科学、数学科学和工程科学五大领域。

在这个基准上,Astra以64.6%的成绩刷新了SOTA,作为对照的Claude Fable 5.1,是52.6%。

图像

不仅如此,Astra跑出这个成绩所用的预估API成本,还比对照组低了约31%。

也就是说,这不只是能力上的领 先,还是效率上的领 先。

放回AI4S的场景里理解一下,以前“文献调研→提出假设→跑模拟→核对数据→给出下一步建议”这条链条,是分成好几轮对话,靠人工衔接。

现在,这条链条理论上已经能被一个Agent自己串起来跑完。

一位科学家直接用Astra做出了一个复杂的生物医学应用,专门用来分析流式细胞术的数据。

流式细胞术是免疫学里最基础的技术之一,让科学家能一次性分析血液、组织或者其他样本里,成千上万甚至几百万个单细胞,用带荧光标记的抗体,把特定的细胞类型揪出来,顺便测一下它们表达了什么蛋白质。

以前该领域一直被商业软件占领。

图像

这位科学家表示,他们实验室这么多年,每年都要为分析这类数据的商业软件,掏出几千美元的订阅和授权费。

现在,他把所有订阅全取消了。因为他用Astra几乎已经自己搭出了一个功能齐全、研究级别的同类应用。

而且他还补了一句,这个UI/UX,已经比他用过的很多商业工具都要好。

以前我们聊AI4S,聊的还是AI能不能帮科学家提效。这个案例已经不是提效了,这是一个科学家,靠自己写Prompt,把一整个商业软件公司,给绕过去了。

那些靠卖分析软件订阅费吃饭的公司,这一刻,可能真的要开始睡不着觉了。

不仅如此,Agent成本大幅下降意味着,原来只有大药企、头部实验室才能使用的科研Agent能力,中小型团队可能也开始玩得起了。

02

科研跑分:从能聊到能考

官方报告中,专门给出了Advancing scientific discovery(推进科学发现)这一章。

在这一章,GPT-6 Astra拿了一系列SOTA(最 佳表现)。

GPQA Diamond能够测试研究生水平的生物学、化学和物理学科学推理能力。GPT-6 Astra在对比测试中取得了96.0%的新高分。

HealthBench Professional是用于评估大语言模型在真实临床工作场景中表现的基准,GPT-6 Astra得分最高63.4%,比上一代Sol的60.5%又高了一截。

这两个还算是传统项目,大家都在卷。真正有意思的是接下来这几个,之前很少有模型愿意测试的难度极高的垂类基准。

LifeSciBench:评估AI在整个生命科学研究中的实用性。

GeneBench-Pro:专注于计算生物学与基因组学中的高阶统计推理能力。

MedChemBench:专注于药物化学中的推理与决策能力。

GPT-6 Astra分别在三个基准中,拿到了60.3%、37.8%、49.3%的分数,都略有提升,同时成本大幅度下降。

但这里有个细节,OpenAI在脚注里写了一句:Claude Fable 5和5.1,没有被放进这几项的对比里。

理由是,它们在这些题目上,大部分选择了直接拒答。

不是答错,而是拒答。两个模型的表现,其实是两条完全不同的安全路线。

Anthropic一条更保守,碰到敏感的生化类问题,宁可不答也不冒险;而OpenAI一条选择在监管框架内,尽量把答案给出来。

这对之后科学家怎么选AI模型,这应该会有实实在在的影响。

03

桌面操作能力,史诗级提升

还有一组数据,容易被忽略,但对AI4S行业的冲击可能是最直接的。

ScreenSpot-Pro,测的是Agent在不借助外部工具的情况下,直接识别并操作屏幕上的界面元素。

Astra拿到92.7%,对照的GPT-5.6 Sol是76.9%。

OSWorld 2.0,测的是Agent在真实桌面环境里完成任务的能力,Astra拿到72.6%,Sol是65.7%,Claude Opus 5是70.2%。

BenchCAD,测的是操作专业软件完成实际工作,Astra拿到95.9%,Sol是83.3%。

说明Agent已经能像人一样,直接用鼠标键盘操作那些从来没开放过API、只能靠人工点来点去的老旧专业软件。

不管是ChemDraw、LIMS系统,还是实验室里Excel记录流程。

官网给的两个具体科研场景。

第 一个测序,让Astra直接进到专业生物信息学软件MultiQC里,核查基因测序的质量,把遗传变异可视化出来,帮研究者判断接下来该往哪个方向继续深挖。

第二个追踪细胞,GPT-6 Astra 在 Jupyter中构建并运行细胞追踪工作流程,将原始显微镜图像转换为带标记的轨迹和谱系记录,以帮助研究人员跟踪单个细胞的运动和分裂。

这才是这次AI for Science真正的跨越。

以前AI在科研里扮演的角色,更像是一个博学的学士,本质上还是问答形式。

现在它开始变成一个愿意动手干脏活累活的实验室助理,自己打开软件、自己检查数据、引导科学家做出判断。

如果通用Agent已经不需要专门适配API,直接看屏幕操作就能完成任务,那垂直工作台集成的含金量,正在被悄悄稀释。

04

写在最后

回到开头那句话。

一个时代结束,另一个时代开始。我觉得这句话放在这里,倒也没那么标题党。

以前我们说AI4S,除开基础大模型外,聊得更多是垂直平台怎么把专业软件的接口打通,集成到一个工作台中。

这是一道很深的护城河,因为大多数科研软件压根没开放过API,得靠人一点点适配。

但这次Astra展示的东西,不仅是模型能力的大幅提升,还在展示:不需要平台开放接口,AI直接看屏幕操作就行了。

当通用大模型的科学能力每往前挪一步,垂直AI4S平台就必须回答一个问题——你比它多做对了什么。

是数据的专有性,是流程的领域know-how,还是验证环节的不可替代性?

这个问题AI4S行业迟早要正面回答。

真正能留下来的,可能只有最稀缺的能力。一方面,手里有没有别人拿不到的专有数据;另一方面,是否具有基于物理世界的验证能力,这还是AI模型的短板。

至于AGI来没来,交给别人吵去吧。

【本文由投资界合作伙伴微信公众号:智药局授权发布,本平台仅提供信息存储服务。】如有任何疑问题,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

相关企业

AI数据总览

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】