打开APP

GPT-4.1淘汰了4.5:主打一个性价比,但仍不如DeepSeek R1

OpenAI发布GPT - 4.1系列(含4.1、4.1 mini、4.1 nano ),为API专供,主打性价比,长上下文等能力突出,将取代GPT - 4.5 。

4.1与4.5孰大?OpenAI刚刚给出答案:

发布GPT-4.1,比GPT-4.5强的那种。

新模型系列更新,一共带来三个版本:GPT-4.1,GPT-4.1 mini、GPT-4.1 nano——

与通常中杯大杯超大杯的设置不同,这回翻译过来,是中杯、小杯、超小杯。

OpenAI表示,4.1系列是API*,不过列位非开发者先别急哈,人家也补充了,在ChatGPT里,4.1的能力将主要通过“融入最新版本的GPT-4o”体现。

能力方面,总结起来4.1系列纸面上最突出的优势有两点:

长上下文,3个型号均拥有100万token上下文窗口;

性价比,用内部老哥的说法就是:

现在你可以用4%的价格,畅享GPT-4o模型品质。

OpenAI还表示,GPT-4.1系列会在API里取代GPT-4.5 Preview,后者将于今年(2025年)7月14日下架。

GPT-4.1:主打性价比

展开来看,OpenAI整体上是把GPT-4.1和GPT-4o拿来对比的。

以延迟为横轴,以智能为纵轴,可以看到,GPT-4.1比GPT-4o强了一丢丢,而4.1 mini则超出了4o mini一大截。

定量比较的结果是,编码方面,GPT-4.1在衡量真实世界软件工程技能的SWE-bench Verified上得分为54.6%,比GPT-4o的分数提高了21.4%,比GPT-4.5强了26.6%。

指令遵循方面,在MultiChallenge基准中,GPT-4.1得分38.3%,而GPT-4o的得分是27.8%。

长上下文方面,在多模态长下文理解基准Video-MME上,GPT-4.1刷新SOTA,在长篇无字幕类别中得分72.0%,比GPT-4o高了6.7%。

值得注意的是,GPT-4.1 mini在多项基准测试中超过了GPT-4o。

比如在智能评估基准MMLU上,GPT-4.1 mini的得分为87.5%,超过了GPT-4o的85.7%,同时延迟降低一半,成本降低83%

GPT-4.1 nano则被定位为OpenAI“目前速度最快、成本*”的模型。并且在部分测试中有超出GPT-4o mini的表现。

编码能力

OpenAI着重强调了GPT-4.1的编码能力。除了在各种编程任务上都超过GPT-4o,OpenAI还演示了其在前端编程方面的实际优势:

能够创建功能更强大、更美观的Web应用。

人类评分的结果显示,在80%的对比测试中,GPT-4.1的网站都比GPT-4o的网站更受欢迎。

比如给出同一段提示词:

Prompt: Make a flashcard web application. The user should be able to create flashcards, search through their existing flashcards, review flashcards, and see statistics on flashcards reviewed. Preload ten cards containing a Hindi word or phrase and its English translation. Review interface: In the review interface, clicking or pressing Space should flip the card with a smooth 3-D animation to reveal the translation. Pressing the arrow keys should navigate through cards. Search interface: The search bar should dynamically provide a list of results as the user types in a query. Statistics interface: The stats page should show a graph of the number of cards the user has reviewed, and the percentage they have gotten correct. Create cards interface: The create cards page should allow the user to specify the front and back of a flashcard and add to the user’s collection. Each of these interfaces should be accessible in the sidebar. Generate a single page React app (put all styles inline).

GPT-4o生成的网站长这样:

而4.1的结果明显更美观:

手快的网友则已经搞出了大家更想看的——小球测试。

BTW,OpenAI提到,GPT-4.1会在API里取代GPT-4.5,GPT-4.5 Preview将在3个月后(2025年7月14日)彻底关闭,但这位老哥表示:我还是更喜欢4.5啊啊啊。

不过,老哥也坦承:4.5虽好,但4.1确实便宜太多啦(30倍价差)。

百万长上下文

再来看一眼长上下文方面,GPT-4.1的具体表现。

大海捞针实验中,面对100万token上下文检索,3个型号均能100%过关。

OpenAI还开源了一个新的评估平台OpenAI-MRCR,以测试模型检索和理解多条信息、并理解信息之间相互关系的能力。也就是说更接近实际应用中,大家对长上下文的真实需求。

结果如下:

还发布了一个用于评估多跳上下文推理的数据集Graphwalks。所谓多跳,即在长上下文中进行多次逻辑跳跃,比如编写代码时在多个文件之间跳转。

在这个基准上,GPT-4.1与o1性能相当,轻松击败了GPT-4o。

性价比仍不如DeepSeek R1

价格方面,相对于自家贵得要命的模型,GPT-4.1系列无疑是便宜的。

尤其是对比要被替代的GPT-4.5 Preview,2刀/百万tokens vs 75刀/百万tokens,价格属于大砍一刀只剩零头了。

但精明的网友们发现,还是比不上DeepSeek R1:

图源:x@bongrandp

One More Thing

以上,你觉得GPT-4.1如何?

反正这个命名方式确实是蛮值得吐槽的。

但没准儿,OpenAI的意思是…4.10>4.5?

至少奥特曼本尊有被说服到(doge)。

他还自嘲了一波:

我们能不能在今天夏天之前搞定我们的模型命名?在此之前每个人都可以再花几个月时间来取消我们(我们活该)。

参考链接:https://openai.com/index/gpt-4-1/

【本文由投资界合作伙伴微信公众号:量子位授权发布,本平台仅提供信息存储服务。】如有任何疑问题,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

AI数据总览

红熊AI上海算模算样科技有限公司
融资时间2026-07-20 当前轮次A+轮 融资金额数千万人民币
AI
涉及机构: 九纬基金彰宜资产格睿丰
记忆张量记忆张量(上海)科技有限公司
融资时间2026-07-20 当前轮次Pre-A轮 融资金额亿级人民币
AI
涉及机构: 哈勃投资荣耀商汤国香资本深创投和玉资本
面壁智能北京面壁智能科技有限责任公司
融资时间2026-07-15 当前轮次D++轮 融资金额数亿人民币
AI
涉及机构: 国家级基金央企汽车制造商等各类产业方知名财务投资人
帷幄杭州帷幄未来科技有限公司
融资时间2026-07-15 当前轮次C+++轮 融资金额4000万美元
AI
涉及机构: 招银国际(CMB International CMBI) 旗下专注于 AI 及前沿科技的基金日本三井住友银行 (Sumitomo Mitsui Banking Corporation SMBC) 旗下企业风险投资基金 SARF (SMBC Asia Rising Fund)三菱 UFG (MUFG) 旗下泰国大城银行 (Bank of Ayudhya) 企业创投 (CVC) 平台 Krungsri Finnovate弘章投资 (Charisma Partners)韩国现代汽车集团 (Hyundai Motor Group) 新加坡电信 (Singtel Innov8)
知有无界知有无界(深圳)智能科技有限公司
融资时间2026-07-15 当前轮次天使+轮 融资金额数千万人民币
AI
涉及机构: 元禾璞华深圳新产投

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】