打开APP

国产算力破局,超节点才是胜负手

近段时间GLM 5.2等上新及相关纪要外泄凸显算力紧张,国产大模型发展需迈过算力门槛,超节点或成破局关键,其面临技术分歧但受众多企业关注。

算力的重要性,再度得以凸显。

近段时间,GLM 5.2、Kimi K3.0上新叠加DeepSeek投资人会议纪要外泄,将算力紧张的现实摆上了桌面。

这意味着,国产大模型要再进一步,必须迈过算力门槛。

围绕算力的争议一度平息,为何当下再掀波澜?国产算力走到哪一步了?超节点会成为破局的关键抓手吗?

01、算力门槛无法绕过

曾几何时,堆算力在全球风靡一时,被业界戏称为“力大飞砖”。

由于种种缘由,这条路在国内并不好走,算力紧张一直困扰着行业,直到DeepSeek面世,通过算法优化等手段降低了对算力的依赖,才打破了以往的粗放思维。

这之后,借助技术手段为算力做减法,成为行业的共识:灵活启动MoE架构的参数规模,可以减少单次推理的计算量;优化注意力机制,可以缓解长上下文的显存压力;借助开源模型打造垂直模型,可以减低模型的训练量……

毕竟,花小钱办大事是国人最喜闻乐见的操作。

此背景下,永远缺算力的叙事在国内逐渐沉寂了下去,而消除算力溢价的叙事大行其道,相关担忧的声音自然逐渐平息。

不曾想,国产大模型后来居上,纷纷跻身国际第 一梯队,随之而来的则是算力相对不足,不得不采取限购、涨价等措施以抑制越来越火旺的需求

于是乎,另辟蹊径可以绕过算力门槛的逻辑破产了。

复盘来看,单次推理效率优化,不等于可以满足算力总需求,一旦需求量高企,令模型满负荷工作,算力就可能出现缺口

以Kimi K3为例,模型参数高达2.8T,但为了提高效率单个Token只激活104B参数,通常情况下足以游刃有余,但Kimi K3出圈之后Token消耗激增,Token的总吞吐量也水涨船高,最终抬高了对算力的需求。

“伯虎财经”表示:“Kimi K3主打长程编程和Agent任务,一次任务不是问答一轮,而是模型反复读代码、调用工具、自我纠错,用户看到的是一个请求,后台可能跑了几十次推理。”

这个现象,高度契合经济学的杰文斯悖论。

百度百科显示,1865年经济学家威廉·斯坦利·杰文斯提出一个理论,当技术进步提高了资源利用效率之后,反而可能导致资源的总消耗量增加,而不是减少。

通俗易懂地说,大模型的推理成本下降了,但模型能力却在不断变强,可以满足更多、更复杂的应用场景,从而吸引越来越多用户入局,一旦边界彻底打开,基本盘就会越做越大,在需求激增之下,算力扩容成为必由之路。

其实,针对算力的基础建设一直没有放松

公开资料显示,2025年国内智能算力规模为1590 ExaFLOPS,到了2026年上半年,智能算力规模达2185EFLOPS,同比增长177%,呈现爆发式增长。

02、超节点堪称大模型的最 佳搭子

智能算力规模爆发式增长背后,则是国产AI芯片走到了舞台中央。

譬如,昆仑芯发布了第四代AI芯片M100,主要针对大规模推理场景(尤其是MOE模型)进行优化设计,以全国产对标NVIDIA H20,主打高性价比推理应用。

摩根大通的数据显示,百度昆仑芯片收入预计将从2025年的约13亿元飙升至2026年的83亿元,同比增长超6倍。

再譬如,平头哥发布了新一代AI芯片真武M890,性能较上一代提升了3倍,可以满足更大的大模型训练及推理需求。

官方数据显示,真武AI芯片累计出货56万片,服务20多个行业的400多家客户,其中在智驾行业已部署超13万卡、客户涵盖小鹏、理想、蔚来等头部造车新势力。

一言以蔽之,国产AI芯片崛起为国产算力提供了“定心丸”

尤为值得一提的是,超节点走出了实验室,成为国产AI芯片下一个新战场,也为国产算力带来更大的想象力

所谓超节点,即将数张、数十张、数百张AI芯片融为一体,组成具备一台计算机特征的超级计算系统,从而大幅提升性能缩小与国外高端芯片的差距,并大幅降低Token的成本。

沐曦股份研发副总裁黄向军表示:“随着模型规模越来越大,尤其是万亿参数的大模型,客观上需要更大规模的GPU,通过高带宽连接在一起。此外,MOE的模型专家间的通信,无论是训练还是推理都要求延迟越低越好,超节点这个架构比普通的服务器更适合。”

需要注意的是,超节点并不是简单的堆芯片。

超节点的核心竞争力是借助超大带宽、超低时延、软硬协同等技术优势,最 大程度实现“高效率、低成本”夙愿,将字面算力变成可用算力

CHIP实验室主任罗国昭表示:“一个2万亿参数的MoE模型往往需要同时调用多个专家网络,每完成一步推理,都需要不同GPU之间频繁交换数据。如果互联带宽不足,大量GPU不得不停下来等待数据同步,即使理论算力充足,也难以真正发挥出来。这也是业内常说的‘GPU不是在计算,而是在等待’。”

不难看出,超节点是解决当下算力紧张的最 优解。

尽管如此,作为新物种的超节点也面临诸多技术分歧,其中排在首位的就是规模到底多大合适,不同企业有不同的答案。

一种声音认为,节点越大越好

随着大模型进入万亿参数时代、上下文长度突破千万以及并发推理持续增长,超节点走向百卡、千卡甚至万卡是必然的。

唯有大节点,才可以满足大模型的全场景需求。

这条技术路径的典型代表是昇腾,其推出的384卡超节点已销售了750多套,目前已迭代至1024卡超节点,实现了业界最 大的256TB跨物理节点的内存统一编址空间,且将推出8192卡超节点,进一步探索超节点的满配技术上限。

另外一种声音认为,节点越经济越好

大模型既要高带宽、高性能,也要低时延、强稳定,因而需要进行平衡,更为重要的是配置的AI芯片数量相对较少,成本也会随之降低,适合中小企业的实际需求,避免出现算力浪费。

如此一来,小节点也大行其道。

这条技术路径的典型代表是浪潮信息,先是推出64卡超节点,契合小节点的主流路线,最新产品降为32卡。

浪潮信息副总裁赵帅表示:“我们自己内部用万亿大模型做AI Coding,效率绝 对比用千亿大模型好,这就是万亿参数大模型带来的价值,所以再次推出32卡产品,让更多企业真正用得起。”

总而言之,超节点最初并不受重视,随着交付能力的提升以及算力紧张的肉眼可见,一跃成为大模型的最 佳搭子,百度、阿里巴巴、浪潮信息、沐曦科技、摩尔线程等大大小小的玩具纷纷入局,为AI基础设施生态注入了新动力。

那么,国产算力破局正当时。

【本文由投资界合作伙伴微信公众号:锌刻度授权发布,本平台仅提供信息存储服务。】如有任何疑问题,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

相关企业

先进制造数据总览

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】