打开APP

寒武纪Day 0适配DeepSeek V4意味着什么

经历了长达15个月的“静默期”和多次更新传闻,DeepSeek V4终于亮相。然而,这并非一次轻盈的亮相。

4月24日,深度求索(DeepSeek)发布了旗舰模型V4的预览版本并同步开源。

已经上线的DeepSeek V4模型分为Pro和Flash两个版本,Pro版本的参数为1.6万亿,激活490亿,预训练数据33万亿;而Flash版本的参数为2840亿,激活130亿,预训练数据32万亿。两个版本模型的上下文都是1M(百万词元)。

经历了长达15个月的“静默期”和多次更新传闻,DeepSeek V4终于亮相。然而,这并非一次轻盈的亮相。

在V4两个版本模型对API访问的价格介绍中,DeepSeek用一行小字表明了现实的骨感:受限于高端算力,目前V4 Pro的服务吞吐能力有限,预计下半年昇腾950超节点批量上市后,Pro的价格会大幅下调。

随后,华为计算发文表示,昇腾一直同步支持DeepSeek系列模型,本次双方更是通过芯模技术协同,实现了昇腾超节点的全系列产品支持DeepSeek V4系列模型。

由华为昇腾代表的国产高端算力,与DeepSeek的模型算法进行协同适配,不再犹抱琵琶半遮面。

DeepSeek在同步发出的V4技术报告中称:“我们在英伟达GPU和华为昇腾NPU两个平台上均验证了细粒度EP(专家并行)方案。”这是DeepSeek*次在正式文档中把华为昇腾和英伟达并列写进硬件验证清单。

一位从事大模型研究的高校学者还是从DeepSeek的小字说明中判断:“国产算力支持下的DeepSeek V4大规模商用仍需时间。”

该学者早就发现DeepSeek在产品端的算力紧缺。2026年初至今,DeepSeek曾突发多次服务中断,备受关注的便是3月30日—31日的连续宕机事件。

在他看来,DeepSeek在一众国产大模型厂商中,以底层工程极限优化著称,即便在产品服务出现宕机风险时,也未公开提及其在芯片等物理设备方面的缺口问题,而今在新模型亮相之初就袒露算力受限,一定程度上揭示了国产模型厂商在国产算力适配上存在着阵痛。

Day 0适配

一位与DeepSeek有模型服务合作的供应商人士认为,V4之所以姗姗来迟,深层原因在于算力架构的重构。

AI开源社区与模型托管平台Hugging Face的亚太生态负责人王铁震指出,目前各家国产大模型都在积极展开国产算力适配,而DeepSeek在过去超一年时间的V4研发中,也在试图大规模采用国产芯片替代方案。眼下,DeepSeek除了持续推进与华为昇腾算力的适配,还与包括寒武纪、沐曦等在内的众多国产算力厂商展开适配。

王铁震透露,行业内尤其关注国产大模型与国产算力是否达到“Day 0”适配。

“Day 0 相当于大模型上线的当天,算力已完成全链路兼容、性能优化、稳定性验证。开发者开箱即用,零等待、零额外适配即可直接训练/推理该模型。”一位国产芯片厂商内部人士透露,过去只有英伟达的算力芯片能做到与各家模型的Day 0适配,其他GPU往往要滞后数月。

就在DeepSeek V4官方信息发布后,寒武纪通过其官方公众号表示,已基于vLLM 推理框架完成对DeepSeek V4已上线两个模型版本的Day 0适配。

寒武纪与DeepSeek最新模型完成Day 0适配,意味着国产GPU已经具备了与英伟达高端算力芯片同等的生态响应速度。而前述国产芯片厂商内部人士表示,其所在厂商也在与DeepSeek V4进行产品适配。在此之前,已经完成与十几个国产大模型的Day 0适配。

今年初,电信天翼云自主研发的“息壤”智算平台宣布完成了国产算力芯片与DeepSeek V3系列大模型的深度适配优化,伴随DeepSeek的模型迭代与更新,智算平台的优化适配也在进行中。

聚焦中国AI市场,国产大模型此前多依赖英伟达CUDA生态,而今算法要全面适配国产算力,需要对底座架构进行重构。

前述大模型研究学者与国产芯片厂商内部人士有个共识,算力自主可控是必然趋势,他们将上述芯模技术底层的重构理解为“算力平替”的过程。从DeepSeek V4耗时长达一年多的研发进程,不难窥见这个过程的艰难。

“不只是简单的代码迁移,MoE(混合专家模型)架构在国产芯片上的通信延迟优化是世界级难题。”某头部模型厂商的技术工程师分析,DeepSeek选择在此时坦承吞吐有限,本质上也是在等待国产芯片“超节点”范式的成熟。

多模态缺失

4月24日上午,在DeepSeek V4预览版上线后,不仅半导体芯片国产替代板块个股大涨,与国产算力及DeepSeek相关的概念股均出现异动。

截至收盘,寒武纪(688256.SH)报1352.5元/股,涨超2.2%。同步走强的还有相关概念股,像龙芯中科(688047.SH)收盘报153.86元/股,同样涨超2个点。以主营大数据服务及数据安全的拓尔思(300229.SZ),作为DeepSeek概念股,在24日午前涨至18.9元/股,仅短短5分钟后便出现下跌,跌幅超过2%‌。收盘报18.34元/股,较当日开盘价涨幅不及1%。

前述头部模型厂商技术工程师认为,此前传闻DeepSeek V4会有多模态版本,可以具备支持图片、视频理解与生成等能力,而今上线的预览版本能力,依然固守文本生成与推理领域。

形成鲜明对比的是,就在DeepSeek V4上线的前几个小时,OpenAI发布了新一代大模型GPT-5.5,其能力展示中特别突出了对工具调用的多模态视觉理解能力。

即使不对标GPT、Gemini等海外头部模型,在2026年的国产大模型战场上,阿里千问、腾讯混元等均已实现“全模态一体化”。而V4已上线的两个模型版本仍走单模态路线,前述头部模型厂商技术工程师推测,DeepSeek在多模态识别能力上或出现短板。

“多模态需要指数级的算力和更复杂的数据工程。”他认为,这极为考验模型厂商的生态布局。他所在的头部大厂不断挖角DeepSeek的技术人才。“我们团队的数据负责人就来自DeepSeek。”

这种核心人才的流失是令人担忧的。多位受访者确信DeepSeek在国产模型*梯队中的技术护城河,但也提出,继核心科学家罗福莉入职小米、郭达雅转投字节跳动后,内部负责核心数据工程、多模态预训练的关键人士流失,或令其模型在多模态能力开发创新方面遇到更大困难。

前述模型技术工程师分析,模型缺乏多模态识别能力或将意味着该厂商错失大量实时视频交互、视觉分析等高价值商业场景。

V4预览版的发布,让市场看到了国产模型与算力在底层架构上的协同进展,但这并不意味着DeepSeek可以松口气。在大模型万亿参数和全模态竞争的当下,它还需要交出一份答卷,在下半年昇腾950超节点到位前,顶着多模态应用技术的压力,它的模型服务、产品迭代,甚至是人才组织架构,能否保持稳定。

前述模型技术工程师透露,在腾讯、阿里等巨头有意与DeepSeek接洽首轮外部融资事宜外,近期数家推动国产替代相关动作的国资型产业投资基金,也在与DeepSeek展开深度洽谈。在其看来,研发进度缓慢的DeepSeek,在算力资源之外,也对外来资金表现出极度渴求。

【本文由投资界合作伙伴微信公众号:经济观察报授权发布,本平台仅提供信息存储服务。】如有任何疑问题,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

相关上市企业

相关企业

AI数据总览

帷幄杭州帷幄未来科技有限公司
融资时间2026-07-15 当前轮次C+++轮 融资金额4000万美元
AI
涉及机构: 招银国际(CMB International CMBI) 旗下专注于 AI 及前沿科技的基金日本三井住友银行 (Sumitomo Mitsui Banking Corporation SMBC) 旗下企业风险投资基金 SARF (SMBC Asia Rising Fund)三菱 UFG (MUFG) 旗下泰国大城银行 (Bank of Ayudhya) 企业创投 (CVC) 平台 Krungsri Finnovate弘章投资 (Charisma Partners)韩国现代汽车集团 (Hyundai Motor Group) 新加坡电信 (Singtel Innov8)
面壁智能北京面壁智能科技有限责任公司
融资时间2026-07-15 当前轮次战略融资轮 融资金额未披露
AI
涉及机构: 国家级基金央企汽车制造商等各类产业方知名财务投资人
知有无界知有无界(深圳)智能科技有限公司
融资时间2026-07-15 当前轮次天使+轮 融资金额数千万人民币
AI
涉及机构: 元禾璞华深产投南通宝月湖投资
幻码跃迁上海幻码跃迁量子科技有限公司
融资时间2026-07-14 当前轮次种子轮 融资金额数千万元
AI
涉及机构: L2F光源创业者基金领投云启资本小苗朗程共同参与光源资本同时担任孵化方
爱诗科技北京爱诗科技有限公司
融资时间2026-07-14 当前轮次C轮 融资金额29.8 亿元人民币
AI
涉及机构: 阿里巴巴领投Lollapalooza Capital(王慧文家办)常春藤资本惠远资本钟鼎资本韩国未来资产OCBC 生态下 Lion X 基金蓝色光标CloudAlphaiGlobe Partners 等参与

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】