打开APP

唐杰预告「GLM史诗级升级」!技术论文入选顶会COLM

7月16日月之暗面放出Kimi K3,引发外界对智谱的追问,唐杰回应“史诗级Plus”。智谱IndexCache思路已被GLM-5.2用过,7月21日智谱落地国产算力数据中心并收购中科加禾。

对于智谱的这波“回撤”,外界已经有很多说法,但最扎眼的导火索可能来自同行。

7月16号,月之暗面放出了Kimi K3。总参数2.8万亿,原生支持视觉理解和100万Token上下文,Kimi称它为全球首 个开源的3万亿级模型。

接下来的几天,大家都知道了。

不过,也就是这周开盘前一天,有网友跑到智谱首席科学家唐杰的微博评论区,追问在千问、Kimi接连完成史诗级进化后,智谱还有戏吗?

唐杰只回了一句:史诗级Plus

模型名没有,发布时间没有,参数规模也没有,气氛这一块先给足了。

不过,顺着这条评论往上翻,还真能找到一条技术线索。

唐杰微博原po里介绍的,是智谱与清华团队的一篇论文——

IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse

论文3月挂上arXiv,7月被COLM接收。

在po文里,唐杰表示IndexCache只改几行代码,就能把DSA留下的一笔隐性开销削掉。

按理说,一篇3月上线的论文,到了7月又被单独拎出来,本来就有点显眼,再加上唐杰这种大佬,现在也很少单独宣传某篇工作。

细思之下,史诗级Plus的回应恰好出现在这条技术帖下面。

这……上下文顿时变得微妙起来。

所以,这篇论文和史诗级Plus,到底有什么关系?

IndexCache

简单来说,IndexCache并不是一种新的注意力机制,它主要面向的是长上下文推理,解决DSA在上下文变长后,索引器反而成为计算瓶颈的问题。

以往DSA的思路,是在每层注意力前放一个轻量级索引器。

索引器先从完整上下文里挑出最重要的部分Token,让主注意力只处理这些Token,从而大幅降低计算量。

但问题在于,虽然主注意力不用再看完整上下文,但索引器仍要扫描一遍,而且模型的每一层都要重新扫描。

由此,上下文越长,索引器越容易从省算力的帮手,变成新的计算瓶颈。

在论文测试的30B模型中,上下文拉到200K时,索引器已经占掉81%的预填充时间。

IndexCache的创新之处就在于抓住了这个明显的重复动作。

相邻模型层选出的重要Token高度相似,top-k索引重合率达到70%到100%。既然几层挑出的结果差不多,就没必要每层都重新算。

所以,它的核心思路就是:少数层负责计算索引,其他层直接复用。

在具体实现方面,模型只保留少数索引器,算出top-k后缓存;其余层跳过计算,直接沿用最近的结果。

对现有模型,可以根据损失变化搜索哪些层适合保留。

训练新模型时,则让一个索引器同时学习服务后面几层。推理代码只需增加一次条件判断,也不额外占用GPU显存。

实验效果上,在30B模型上,IndexCache最多能砍掉75%的索引器计算,模型效果基本不变。

200K上下文下,生成第 一个Token前的速度最高提升1.82倍,后续出字速度提升1.48倍。

在GLM-5上的初步实验中,砍掉一半索引器计算后,长上下文和推理能力也基本保持不变。

到这,这篇论文的内容也就差不多结束了,但这和史诗级plus有啥关系?

GLM-5.2已经用过了

虽然唐杰在微博里说史诗级plus,但略显遗憾的是,这篇工作的核心思路其实已经在一个月前发布的GLM-5.2里用过了。

在GLM-5.2里,这套思路名叫IndexShare

具体的,GLM-5.2每四个Transformer层共享一个索引器。第 一层负责选出top-k索引,后面三层直接复用。

这和IndexCache的核心思路基本一致。上面的论文给出免训练搜索、多层蒸馏和完整实验,GLM-5.2则把四层共享一次索引真正装进了模型。

靠着IndexShare等改动,GLM-5.2把上下文窗口推到100万Token。在100万上下文下,每Token计算量降低2.9倍。

而这种工程优化释放出的信号,不是智谱准备换掉DSA,而是还在沿着这条路线继续榨效率。

对模型厂商来说,能不能支持百万Token是一回事,能不能以可接受的成本真正用起来,又是另一回事,而IndexShare就表明智谱仍在通过跨层复用压低长上下文的推理成本。

难不成?这GLM-5.3,又是极 致的性价比??

One more thing

除了模型软件侧的优化外,刚刚,智谱又落下了一块更重的拼图。

据悉,就在今天7月21日,智谱已落地1GW级国产AI算力数据中心,并全部采用国产AI芯片。

与此同时,智谱还完成了对国产AI异构算力软件公司中科加禾(XCore Sigma)的收购。后者源自中科院计算所编译实验室,长期研究异构算力软件栈和编译优化,被业内视为国内顶 尖AI Infra团队之一。

两项动作,一个解决算力从哪里来,一个解决算力怎样用得更彻底。

1GW国产算力为大模型训练提供资源,中科加禾则通过编译器、Runtime和推理引擎,提高不同国产芯片的利用率,降低模型训练与推理成本。

从IndexCache、IndexShare,再到国产算力中心和AI Infra收购,智谱最近补的似乎不只是一款模型,而是从芯片、软件栈到模型的整条链路。

这些动作和史诗级Plus有没有关系,目前还没有答案。

但留给智谱的悬念,显然又多了一层。

史诗级plus,你快来吧!

参考链接

[1]https://arxiv.org/abs/2603.12201

[2]https://z.ai/blog/glm-5.2

【本文由投资界合作伙伴微信公众号:量子位授权发布,本平台仅提供信息存储服务。】如有任何疑问题,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

相关上市企业

AI数据总览

红熊AI上海算模算样科技有限公司
融资时间2026-07-20 当前轮次A+轮 融资金额数千万人民币
AI
涉及机构: 九纬基金彰宜资产格睿丰
记忆张量记忆张量(上海)科技有限公司
融资时间2026-07-20 当前轮次Pre-A轮 融资金额亿级人民币
AI
涉及机构: 哈勃投资荣耀商汤国香资本深创投和玉资本
面壁智能北京面壁智能科技有限责任公司
融资时间2026-07-15 当前轮次D++轮 融资金额数亿人民币
AI
涉及机构: 国家级基金央企汽车制造商等各类产业方知名财务投资人
帷幄杭州帷幄未来科技有限公司
融资时间2026-07-15 当前轮次C+++轮 融资金额4000万美元
AI
涉及机构: 招银国际(CMB International CMBI) 旗下专注于 AI 及前沿科技的基金日本三井住友银行 (Sumitomo Mitsui Banking Corporation SMBC) 旗下企业风险投资基金 SARF (SMBC Asia Rising Fund)三菱 UFG (MUFG) 旗下泰国大城银行 (Bank of Ayudhya) 企业创投 (CVC) 平台 Krungsri Finnovate弘章投资 (Charisma Partners)韩国现代汽车集团 (Hyundai Motor Group) 新加坡电信 (Singtel Innov8)
知有无界知有无界(深圳)智能科技有限公司
融资时间2026-07-15 当前轮次天使+轮 融资金额数千万人民币
AI
涉及机构: 元禾璞华深圳新产投

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】