打开APP

Token在暴增,利润为何「困」在英伟达?

AI产业发展阶段,Token经济消耗剧增,英伟达等上游硬件厂商利润丰厚,多数中下游企业亏损,未来利润或随算力缓和、Token渗透重新分配。

大厂的Token仪表盘上,数字正在疯狂跳动。

当下,仅豆包一家大模型的日均Token调用量就已突破180万亿;国家数据局的统计显示,全国日均调用量在今年3月已超过140万亿——无论从哪个口径衡量,这都是一条两年内从“近乎为零”飙涨超千倍的曲线。

这是一组足以让任何一个行业眼红的数字。AI编程、Agent工作流、多模态内容生成……越来越多场景被卷入这条消耗曲线,Token经济正在以前所未有的速度膨胀。

但最 先兑现这场繁荣的,并非模型厂商和AI应用。

“几乎所有人都在亏钱,而所有的利润都流向了英伟达——或者说,流向了上游硬件。”共绩科技的联合创始人黄力昂用一句话,给这场繁荣泼了一盆冷水。

这个判断并不夸张。

就在这个季度,英伟达交出了一份让整条产业链相形见绌的财报:2027财年第 一季度(即2026年2月至4月),公司营收达816亿美元,同比增长85%,GAAP毛利率高达74.9%;

而几乎同一时期,OpenAI第 一季度的经营亏损高达93亿美元——调整后营业利润率约为-122%,相当于每收入1美元,就要倒贴约1.22美元。

于是,一个略显荒诞的对照浮现出来:一边是消耗量呈指数级攀升、被寄予“新增长极”厚望的Token经济,上游GPU、HBM厂商持续刷新利润纪录;另一边,从模型厂商、Token工厂,到算力中心和AI应用,大多数企业仍在增长中承受亏损,甚至陷入“越卖越亏”的困境。

不过,这或许只是AI产业发展的一个阶段。

回看互联网和云计算的发展史,几乎每一轮技术浪潮的早期,利润都先被上游基础设施层截获——光缆、服务器、交换机厂商最 先赚钱,而做网站和应用的还在摸索商业模式。

今天,利润停留在距离物理瓶颈最近的GPU和HBM;但随着算力供需逐渐缓和、Token持续向应用渗透,利润也将沿着产业链重新分配。

真正值得追问的是:Token经济的红利何时流向下游欢迎添加微信 EATINGNTAE ,一起追踪Token产业链的后续变化。

01、为什么暴涨的是Token,暴利的却是HBM和GPU?

要理解Token经济的价值流向,一条铁律足以概括:离物理瓶颈越近,话语权越重。算力芯片与存储芯片,卡住的正是这条产业链最窄的咽喉。

英伟达816亿美元营收、74.9%毛利率,只是这场盛宴的开胃菜。更值得关注的是存储芯片——这个曾被视作周期性配角、跟随PC和手机兴衰沉浮的行业,如今正以近乎粗暴的方式证明自己的“主角时刻”。

美光科技2026财年第三季度(截至5月底)财报显示,公司营收414.6亿美元,同比暴增346%;净利润282.4亿美元,毛利率一路攀升至84.9%——这个数字甚至超过了英伟达。

GPU的缺货已经持续了足够久,市场早有预期;HBM的供给紧张却是最近才真正爆发。需求在一夜之间爆发,供给却只能以季度为单位缓慢释放,价格自然被推到极 致。

在迈富时CFO马进看来,这并不意外:“硬件环节目前由于供需极度不平衡,利润率处于‘暴利’水平。”

但为什么“贵”所产生的超额利润,几乎没有溢出到产业链的其他环节?

九章云极的判断指向了这个问题的核心:“AI工业化初期,上游重资产的算力与能源是刚性瓶颈,具备强议价权。”

HBM的产能就掌握在三四家公司手里,GPU的先进制程几乎只有台积电能做。没有替代品,扩产又慢——客户没有议价的筹码,只能接受。

换句话说,在这个阶段,谁掌握着不可替代、又扩产缓慢的物理产能,谁就握有定价权——这恰恰是芯片厂商,尤其是存储芯片厂商目前所处的位置。

问题是,这样的盈利水平能持续多久?

短期来看,迈富时CFO马进认为,硬件产能扩张周期长达两到三年,供给紧张不会快速缓解,未来一两年硬件仍将处于景气上行期。

这与存储巨头们自己的判断基本一致——美光、SK海力士、三星的管理层在财报电话会上不约而同地表示,供应紧张至少持续到2027年甚至2028年。

但把时间拉长,马进认为,随着上游产能逐步释放,以及国产芯片的替代比例逐步提升,供给不足的问题终将被解决。

这意味着,这场“暴利”很可能只是一个阶段性产物,而非能够长期维系的常态。

如果说上游硬件的暴利是全球性现象,那么就眼下而言,国产芯片能否分享这场盛宴,是另一个问题——这个答案并不乐观。

云天励飞的副总裁罗忆的判断颇为直接:国产芯片大部分仅能覆盖100 TPS/用户(单位用户每秒生成Token数)以下的场景,与英伟达Rubin等最新一代产品相比,差距依然明显,在真正商业闭环的场景下对性能有更极 致的追求,国产芯片目前还难以形成有效替代。

同时,英伟达的代际节奏几乎是每年一代,国产芯片追赶的参照系本身就在高速移动。

比技术差距更现实的,是商业门槛。

“任何芯片要真正投入使用,都必须先经过第三方认证、积累典型客户案例,再在市场上经受各种模型、算子算法库和高负载任务的检验。”某国产芯片销售小明说,“企业在招标时都有业绩门槛。一个新品牌要在芯片行业站稳脚跟,过程非常漫长。”

芯片行业人士王闻则从产业格局上点出了另一层困境——在他看来,国内互联网大厂在生态构建上拥有先天优势,而独立芯片厂商“本质上还是只是挣一份硬件钱”,既缺乏对上层业务的深刻理解,又要同时面对MaaS层和Agent层两套生态的建立难度,“一口气打穿两层,比互联网大厂难得多”。

你怎么看独立芯片厂商的出路?欢迎添加微信 EATINGNTAE 分享你的判断。

性能代差、商业门槛、生态壁垒——三重约束叠加之下,国产芯片即便身处一个“暴利”的上游周期,能够切到的蛋糕仍然有限。

不过,IO资本赵占祥也指出了一个关键的时间窗口。

在他看来,正是因为算力极度紧缺,客户才对各种新的计算芯片架构持开放态度,“谁来了我都让你试”——只要你能供货,客户就愿意给你机会。

这恰恰是国产芯片目前最 大的机会:在英伟达供不应求、交付周期不断拉长的窗口期里,客户没有挑三拣四的余地。但如果算力不再短缺,供应商格局已经稳定,新架构再想进入市场就会难得多。

这也带出一个更值得追问的问题:如果说上游的暴利源自“供需失衡”——需求太猛、产能太慢,价格自然上天——那么同样面对Token需求的爆发式增长,为什么到了中游的模型厂商这里,故事就完全翻了个面?

02、为什么Token卖得越多,反而亏得越快?

上游硬件商靠“卖铁”坐收暴利,但对模型厂商而言,这张入场券的代价,是将上游的暴利全额计入自己的成本。这是一个结构性的困局:前者的定价权越强,后者的成本刚性就越难以消解。

OpenAI的财报,正是这套逻辑最残酷的注脚。

这个“越卖越亏”的公式,在中游几乎是普遍现象。

不过也有企业正在摆脱烧钱的引力。2026年第 一季度,Anthropic营收48亿美元;据披露,第二季度营收预计将环比翻倍至约109亿美元,增速达130%。更引人关注的是,公司预计将在第二季度首次实现单季度运营盈利,运营利润约5.59亿美元——这在当下几乎全员烧钱的模型层里,称得上是一个异数。

但需要说明的是,即便如此,Anthropic自己也判断,全年层面的盈利可能要等到2028年才能实现——单季度的盈利拐点,与“长期赚钱”之间,仍隔着一段距离。

中游最 好的样本,眼下也只是刚刚摸到盈亏平衡线,远谈不上像上游硬件商那样“暴利”。

海外巨头尚且如此,国内模型厂商的处境更不轻松。以智谱为例,2025年全年营收7.24亿元,同比增长131.9%,但年内净亏损高达47.18亿元。

九章云极提醒,模型厂商对极 致性能的追求,本身就被捆绑着一笔绕不开的溢价:只要还在用英伟达的卡,上游的定价权就会持续以采购成本的方式,反噬中游本已稀薄的利润空间。

成本端已经失血,收入端同样不容乐观。

在迈富时CFO马进看来,模型层长期壁垒只会越来越低,未来全球能够存活的大模型公司会越来越少,市场终将向头部大厂集中——即便今天还能维持一定议价权的厂商,也很难逃开最终被卷入价格战的宿命。

英伟达的定价权,压向的不只是模型厂商。同一张GPU,落在算力运营商和云厂商手里,同样意味着高昂的采购成本,而他们的解法是:与其把卡按小时租出去赚一笔微薄的差价,不如把算力“加工”成更高附加值的产品——Token——直接卖给需要它的模型厂商和应用开发者。

2025年黄仁勋就将数据中心重新定义为“生产Token的工厂”,试图把行业的注意力从“算力”转向“Token产出效率”。

某大厂程序员小张一句话点破了这套叙事背后的商业驱动力:相比按小时出租裸金属GPU,卖Token能让云厂商拿到更好的利润率。

行业测算显示,传统“裸金属”算力租赁毛利率大致在20%至30%区间,而专注Token运营的厂商,毛利率普遍能做到40%至50%,海外的Together AI、Fireworks AI等公司也大致维持在47%左右,明显高于单纯出租算力的同行。

但这门“更好的生意”,在实际操作中远没有听起来那么轻松。Token工厂的运营都有哪些坑?欢迎添加微信 EATINGNTAE 交流。

Token价格的持续下降,正在加速淘汰一批玩家。

共绩科技的联合创始人黄力昂观察到,没有模型优化能力的算力持有方,单位算力的收入随Token单价下跌而直接缩水,成本端却没有同步改善的空间,利润被双向挤压——这批玩家正在被逐步淘汰。

而具备优化能力的企业,则通过提升单位算力的Token产出量,用“量”的增长覆盖了“价”的下跌,反而在降价周期中实现了单位收益的提升。

换言之,在Token工厂这门生意里,拥有GPU只是入场券,真正的盈利能力取决于优化能力——能否把每一张卡的算力榨取到极限,直接决定了利润的厚薄。

九章云极将这种能力拆解为三个层次:一是全栈软硬协同优化,从芯片驱动到计费系统全局调度;二是动态精细化的资源切分,将GPU的算力、显存、带宽进行毫秒级切分与重组;三是规模化的稳定交付,支撑日均万亿级Token调用而不宕机。这三项能力,缺一不可。

这对大量缺乏调度和优化能力、只会“囤卡”的算力中心而言,并不是一个好消息。

而这种分化之所以会发生,根源其实比“技术差距”更深一层。国产芯片销售小明指出,在此之前,整个行业的主要精力并没有真正放在提升算力运营能力上,一个直观的信号是:那些“算力综合运营服务商”的榜单上,几乎找不到世界500强级别的企业,也鲜有国资巨头的影子,“这充分说明,行业目前还处在一个非常初级的起步阶段。”

中游远未走完它的洗牌期,模型厂商在成本与价格战的夹缝里失血,Token工厂在效率竞赛中优胜劣汰,少数赢家正在浮出水面,但更多人还在亏损中等待拐点。

03、Token最终会流向哪里,利润就会流向哪里?

Claude Code年化营收突破25亿美元、国内企业级MaaSToken调用量超千万亿——下游应用层不断刷新的消耗数据,正在重新点燃市场对AI商业化前景的想象。

在这股热潮中,太初元碁的首席产品官洪源判断,AI编程是目前Token消耗增长最快的方向。

事实正在印证这个判断,以Claude Code为代表的AI编程Agent,已经把处理单个任务的Token消耗量,从Chatbot时代的几千个,直接推高到8万至15万个;自2026年1月以来,Claude Code的周活跃用户也已实现翻倍。

AI编程正在从一个“效率工具”,蜕变为真正意义上的工业级Token消耗场景。

但消耗量的膨胀,并不会自动兑换成利润。Claude Code这种消耗与营收齐飞的故事,在当下的AI应用层并不多见,更多场景还卡在“只烧钱不赚钱”的关口。

云天励飞副总裁罗忆提供了一把理解下游的钥匙:Token本身只是基础设施,类似电力或燃料,客户真正需要的,并不是Token,而是基于Token的应用。

他的判断相当干脆:当前行业的现状更像是“每个人都在手搓电器”,而未来真正应该崛起的,是“用电器”的产业。

具身智能就处在最典型的“手搓电器”阶段——各家卯足劲造机器人,能走、能抓取、能简单决策,但高度定制、难以复用。也因此,它成了一个略显矛盾的场景:一边是巨大的Token消耗,机器人在物理世界中持续感知、规划、执行,每一个动作都伴随着Token的流动;另一边,这些消耗换来的仍然是原型和Demo,离商业闭环还很远。

罗忆的判断是,这类应用仍处于烧钱阶段——Token需要先转化为可以规模化部署、稳定创造价值的智能硬件或行业软件,才能真正兑现商业价值。

换句话说,即便大量Token被消耗在具身智能的训练和推理中,只要“电器”本身还没有跑出来,这部分投入就仍然只是成本,而非利润。

而更关键的挑战在于,即便“电器”真的造出来了,商业闭环也并非天然成立——烧出了产品,不等于烧出了生意。AI视频生成领域的一起一落,就是最直观的注脚。

2026年3月24日,OpenAI正式宣布关停仅上线半年的AI视频应用Sora。据外媒披露,Sora每天支出高达约1500万美元,年化约54亿美元,但App累计收入仅140万美元,用户留存率接近于零。

几乎在同一时间,字节跳动的Seedance给出了另一种解法——它把AI视频生成能力嵌入抖音、剪映、即梦等已有的超级流量体系,将高昂的算力成本,转化为带货短视频、短剧引流等“内生需求”,形成了一个能够自我造血的闭环。

字节的做法,是“靠一己之力把整个生态盘活了”——补贴创作者生成内容,再通过矩阵分发、广告分成和商城导流完成变现,投入与产出都在同一个体系内闭环运转。

一个折戟、一个跑通,两者的差距其实并不在技术本身:Sora不缺技术,缺的是一个愿意持续付费的场景;Seedance赢的也不是模型,而是它一出生就嵌在了一个能自我造血的体系里。

至于利润能否向下游转移,罗忆给出了两条可能的路径:要么像字节这样,靠自己把闭环做完;要么像AI编程领域那样,整个行业慢慢形成共识,跑出一套可复制的模式,而不是被一家垄断。

在罗忆看来,应用层是价值的主要承载者,随着越来越多场景跑通商业模式,利润最终会向下游移动。“毕竟,Token本身不创造价值,只有被转化为具体的生产力或消费体验时,才算真正变现。”

路径有了,但下游凭什么接住利润?

马进的回答直指核心:如果一个应用能为客户创造10倍的回报,即便上游成本翻倍,它也能通过提价把压力传导出去。真正解决了核心痛点的应用,一定会拥有更强的定价权和利润保障。

不过,这种乐观还需要一个前提:应用得先真正落地。黄力昂认为,利润向下的转移不会自动发生,需要等到Agent应用越来越落地,才会逐步向下游释放。

把时间拉长来看,英伟达赚走绝大部分利润,更像是产业早期供需极度失衡的阶段性产物,而非最终格局。

过去两年,最稀缺的是GPU和HBM,利润就停在那里。当算力不再是最稀缺的资源,利润自然会沿着产业链继续移动。下一阶段的赢家,未必是今天造芯片的人,而是能把Token真正变成商业价值的人。

【本文由投资界合作伙伴微信公众号:雷峰网授权发布,本平台仅提供信息存储服务。】如有任何疑问题,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

AI数据总览

帷幄杭州帷幄未来科技有限公司
融资时间2026-07-15 当前轮次C++轮 融资金额4000万美元
AI
涉及机构: 招银国际资本三井住友银行Krungsri Finnovate弘章资本现代汽车新电投资SingTel Innov8
面壁智能北京面壁智能科技有限责任公司
融资时间2026-07-15 当前轮次D++轮 融资金额数亿人民币
AI
涉及机构: 国家级基金央企汽车制造商等各类产业方知名财务投资人
帷幄杭州帷幄未来科技有限公司
融资时间2026-07-15 当前轮次C+++轮 融资金额4000万美元
AI
涉及机构: 招银国际(CMB International CMBI) 旗下专注于 AI 及前沿科技的基金日本三井住友银行 (Sumitomo Mitsui Banking Corporation SMBC) 旗下企业风险投资基金 SARF (SMBC Asia Rising Fund)三菱 UFG (MUFG) 旗下泰国大城银行 (Bank of Ayudhya) 企业创投 (CVC) 平台 Krungsri Finnovate弘章投资 (Charisma Partners)韩国现代汽车集团 (Hyundai Motor Group) 新加坡电信 (Singtel Innov8)
面壁智能北京面壁智能科技有限责任公司
融资时间2026-07-15 当前轮次战略融资轮 融资金额未披露
AI
涉及机构: 国家级基金央企汽车制造商等各类产业方知名财务投资人
知有无界知有无界(深圳)智能科技有限公司
融资时间2026-07-15 当前轮次天使+轮 融资金额数千万人民币
AI
涉及机构: 元禾璞华深圳新产投

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】