打开APP

昆仑万维方汉:2026是「世界模型元年」,提出三大产业预判

昆仑万维宣布核心模型重磅升级——Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型,全面覆盖世界模型、AIGC创作等前沿赛道。

7月19日,正值2026世界人工智能大会(WAIC)期间,昆仑万维“世界模型与多模态范式跃迁”专场论坛在上海西岸国际会展中心隆重举行。作为深耕AI科技领域的领军企业,昆仑万维在这场论坛上宣布核心模型重磅升级——Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型,全面覆盖世界模型、AIGC创作等前沿赛道。昆仑万维董事长兼CEO方汉在论坛上宣布:2026年为“世界模型元年” ,标志着AI从内容生成走向对物理世界的理解与交互的关键转折。

方汉:2026是“世界模型元年”,三大产业预判锚定未来方向

在论坛主旨演讲环节,昆仑万维董事长兼CEO方汉正式宣布2026年为“世界模型元年” 。他指出,过去两年AI行业的核心命题是“生成”——生成文字、图像、视频、音乐。而从2026年开始,AI的核心命题将转向“理解”与“交互”——让AI真正理解物理世界的运行规律,并能与真实环境进行闭环互动。世界模型正是实现这一跨越的关键技术底座。

昆仑万维董事长兼CEO方汉

方汉在演讲中系统阐述了三大产业预判:

第 一,世界模型将走出屏幕,进入物理世界。 我们洞察到,具身智能正从实验室走向真实环境,这一趋势要求机器人在行动前先进行环境推演——预判动作后果、评估环境变化、及时调整应对策略。这种能力的突破,将使竞争焦点从单一任务转向陌生环境下的通用模型能力;谁能训练出在复杂场景中依然“看得懂、做得对”的模型,谁就拿到物理智能时代的入场券,这也是中国智能制造和机器人产业真正亟需的底层能力。

第二,游戏行业将率先被世界模型改变。 开放世界游戏不再依赖数百人团队数年的手工搭建,Matrix-Game 3.5 让虚拟世界随玩家行动实时生长、持续演化。未来三到五年,世界模型将成为游戏行业的基础设施,彻底刷新内容生产方式,而国产模型已在这一赛道领跑全球。

第三,AI音乐、AI视频等工具将从技术试验变成大众创作工具,促进 AIGC 的深层发展。 Mureka 作为中国最强、全球前两名的音乐生成模型,率先去除“AI味”,让普通人也能把模糊灵感转化为有情绪、有温度的作品。这并非替代音乐人,而是大幅降低创作门槛,让更多人的表达得以释放,从而根本性改变音乐乃至整个 AIGC 产业的创作生态。

三个产业预判,背后是同一个方向:让AI从“会生成”走向"懂世界"、"能行动"。方汉表示,这不只是昆仑万维一家公司的回答,更是中国AI从研发走向产业应用的一个缩影。

AI模型全球升级,掀起全模态内容生成革命

本次论坛上,昆仑万维集中完成了核心模型的全球重磅升级。

2.1 Matrix-Game 3.5:Patch级记忆注入,重新定义交互世界模型

作为昆仑万维世界模型系列的最新迭代,Matrix-Game 3.5在本次论坛上带来了革命性的技术升级。

Skywork首席科学家成宇在论坛上正式发布了Matrix-Game 3.5世界模型。Matrix-Game 3.5聚焦可交互世界模型技术,实现了Patch级别的记忆注入与系统级性能优化,5B模型在720p分辨率下可实现单卡20FPS实时生成,具备1分钟记忆能力

Skywork首席科学家成宇

成宇指出,世界模型是具身智能的“无限数据引擎”。传统数据采集面临人工成本高昂、实机采集耗时耗力、效率极低的痛点,无法满足大模型规模化需求。Matrix-Game 3.5构建了支撑下一代世界模型的无限数据生产体系,突破传统瓶颈,打造三条自动化数据生产管线,输出Video+Pose+Action+Language的高质量训练数据,目前已积累超500万高质量视频切片、超1万有效训练小时数、覆盖1200余个游戏场景。

在技术架构上,Matrix-Game 3.5创新性地将历史帧切分为带有3D坐标的Patch Memory(通过Depth+Pose Lift到世界坐标系),推理时根据当前相机视锥检索可见Patch并重新投影到当前视角形成Mosaic,再作为Memory Token注入DiT,实现长期一致性的Patch级空间记忆。这一设计将Frame-level FOV Memory升级为Patch-level FOV Memory,带来四大核心优势:更准确的空间记忆检索与跨帧一致性、更稳定的相机运动生成、最 大程度保留基座模型动态生成能力的In-context Learning、以及用户可自由编辑记忆块的可控记忆能力。

此外,Matrix-Game 3.5在推理加速层面实现了DiT推理与VAE解码的全链路优化,通过“减少模型吞吐+DiT模型优化+VAE剪枝”三重手段,达成单卡20FPS 720p实时推理的业界领 先性能,让高质量世界模型真正具备实时交互能力。

Matrix-Game从1.0到3.5始终坚持开源路线。3.5版本宣布核心架构开源,吸引全球开发者共建生态。Matrix-Game 2.0是实时交互式世界模型技术范式中首 个开源的实现方案,Matrix-Game 3.0则首次系统性地将记忆问题纳入开源解决方案。

此前,DiT作者、纽约大学助理教授谢赛宁团队基于Matrix-Game 2.0的开源底座,发布了全球首 个多人视频世界模型Solaris,也从学术圈的实际使用上印证了这套开源方案的基础模型价值。NVIDIA和浙大联合发布的工作Light Interaction基于Matrix-Game 3.0模型进行研发。另外,NVIDIA的SANA-WM和Adobe的RELIC等国际头部大厂世界模型均将Matrix-Game相关模型作为对比基准。

Matrix-Game 3.5 开源地址

https://github.com/Riemann-Dynamics/Matrix-Game-3.5

2.2. Mureka v9.5与O3:最没有AI味的AI音乐模型,让音乐进入“版本化制作”时代

Mureka v9.5&O3 音乐大模型的发布,成为本次论坛最 具情感冲击力的时刻之一。

从SkyMusic 1.0内测到Mureka v9.5&O3,昆仑万维的音乐模型走过了一条从“作品成立”到“创作可控”再到“多模态创作”的演进路径。而v9.5版本首次喊出 “最没有AI味的AI音乐模型” 这一口号——它不再依赖声部堆砌和复杂编配制造“厉害”的第 一印象,而是在真实的音乐框架中,以更为克制的方式处理编配、人声、情绪与Prompt意图,让音乐表达更自然、更真诚。O3 建立在新版 V9.5 之上,并通过 test-time scaling 扩展 MusiCoT 的推理过程。它不是简单地“生成得更多”或“想得更久”,而是让模型在生成过程中持续审视当前表达:局部旋律是否仍服务全曲目标,编配是否遮蔽人声,情绪是否提前透支,结构是否正在偏离最初意图。额外推理空间被用于回看偏差与自我修正,使音乐 CoT 能够逐步收敛,而不是一次决定后一路向前。

歌曲的主观评分

从评测结果看,V9.5 沿着 MusiCoT 路线完成了更扎实的底座升级:旋律、人声、音质和编曲全面提升,指令精准度从 6.92 提升至 7.62。它不再把“更满、更复杂”当作唯 一标准,而是在真实音乐框架中更克制地处理编配、人声、情绪和 Prompt 意图,让歌曲更自然、更真诚。O3 则建立在 V9.5 之上,通过持续推演、回看偏差和修正后续决策,进一步强化旋律发展、编曲结构与指令理解,使歌曲结构更完整、情绪更连贯、段落关系更合理。简单来说,V9.5 负责把歌做得更自然,O3 负责让模型在交付前多看、多想、多修一遍。

提示词:以柔和钢琴、中文流行,氛围合成器和渐进式弦乐构建电影感情绪,男声贴近演唱,细腻、克制,从低声诉说逐渐走向情感释放。整体像雨夜里的未说出口的告别,忧伤但温柔,不煽情却充满力量

Featuring soft piano, Chinese pop influences, atmospheric synth layers, and gradual strings to create a cinematic emotional atmosphere. Intimate male vocals with delicate, restrained delivery, building from quiet storytelling to emotional release. Like an unspoken goodbye on a rainy night, melancholic yet tender, powerful without being dramatic.

今天,一首歌经常和视频一起被消费。短视频、游戏、影视预告、品牌片和虚拟人演出,都需要声音与画面共同表达。

Mureka 这次重磅升级,也把音乐与视频 MV 接进了同一条创作链路。用户可以从一张图、一段视频或 moodboard 开始,让系统理解画面的节奏、人物、空间和情绪,再生成与之匹配的音乐;当然,也可以从一首歌开始,让 Agent 理解歌词叙事、节拍编曲和情绪起伏,继续生成角色与 MV 的视觉方案。歌词决定叙事、节拍决定剪辑、旋律决定记忆点、画面决定传播场景。Agent 要做的,是让这些信息在同一个创作目标下持续传递,而不是把几个生成工具简单拼在一起。

提示词:迷幻西海岸 G-Funk 街头说唱。深沉滑动的合成器低音、Moog 哨音、Talkbox 氛围、温暖 Rhodes、哇音吉他与复古磁带质感,配合松弛靠后的鼓点和沙哑男声,营造低底盘夜间巡游般的迷幻街头氛围。

Psychedelic West Coast G-Funk street rap, featuring deep sliding synth bass, a melted Moog whistle lead, talkbox haze, warm Rhodes, muted wah guitar, warped cassette textures, and a lazy behind-the-beat groove. Raw raspy male vocals deliver relaxed, human street storytelling over a smoky lowrider night-cruise atmosphere, with no trap hi-hats, drill patterns, or EDM drops.

更为重要的是,Mureka已从单一的音乐生成工具演进为完整的“版本化制作”平台。其差异不仅来自模型效果,更来自“模型训练—推理时选优—版本化创作工具—平台分发”的系统组合。同一创意可快速生成多版本,支持在旋律、人声、结构等维度进行局部保留与替换;Studio将“操作DAW”转化为“指挥创作”,降低门槛、抬高上限。同时,Mureka推出Character功能——一段声音、一张照片即可生成专属歌手角色,并贯穿歌曲、MV全链路;AI配乐能自动分析视频画面的场景、动作与情绪,创作更贴合内容的音乐;Mureka Agent则通过自然语言一次对话调用整曲生成、单轨生成、Remix、延伸、MIDI导出、声音克隆等全部能力,全程无需切换界面。

正如昆仑万维所提出的愿景:AI音乐不再是简单的消费内容,而是升级为一种自我表达的语言。用户不仅是被动聆听者,更是主动表达者与参与者。Mureka正以模型能力、创作工具与平台分发的完整闭环,重新定义AI时代的音乐创作生态,让每个普通人的灵感都能有温度地落地,从“一个想法”到“歌词—人声—角色—歌曲—MV”的完整创作链路,全面释放AIGC的深层创作力。

院士与行业领 袖齐聚,共话世界模型未来

本次论坛还邀请了多位重量级嘉宾。中国科学院院士、南京大学教授、副校长周志华受发表主旨演讲,围绕世界模型的前沿方向展开了深度分享。此外,我们邀请了黎曼动力机器人创始人刘扬教授和Reactor Technologies, Inc. CEO兼联合创始人Alberto Taiuti 分别介绍了黎曼机器人模型 1.0 版和Reactor加速世界模型在全球落地的经验。

中国科学院院士、南京大学教授、副校长周志华

中国科学院院士、南京大学副校长周志华教授在题为《关于世界模型的讨论》的主旨演讲中,将世界模型划分为感知层、理解层与决策层,并着重指出决策层世界模型长期面临“多步推演复合误差平方级放大”与“样本复杂度过高”两大理论瓶颈。

他分享了团队的最新突破:通过分布匹配技术可将推演误差从平方级压至线性级,验证了长序列推演的可行性。同时,通过创新性地逆向运用贝尔曼方程,将所需样本量降至原来的根号T分之一,为在战斗机操控、智能工厂等代价高昂的现实任务中构建决策世界模型提供了理论基础。他还提出“学件”概念——由模型与AI自动生成的“规约”共同构成,允许多个异构模型在不公开数据的前提下进行复用与组装,为世界模型从单产线定制走向可成长、可演化的模型生态开辟了新路径。

黎曼动力机器人创始人刘扬教授

黎曼动力机器人近期推出的 Riemann-1.0,是其成立以来首 个公开发布的成果——面向 Physical AI 的新一代 Embodied World Action Model。该模型基于超过 23.2 万小时多源具身交互数据训练,统一融合第 一视角人类视频、UMI 示教与异构机器人轨迹,并提出全因果世界动作建模架构与三阶段渐进式具身预训练框架。Riemann-1.0 不再停留于仿真环境中的离线评估,而是在多个国际主流机器人 Benchmark 与真实机器人任务上同步实现仿真与真机双 SOTA,为机器人操作、实时自适应控制及高频人机协作等 Physical AI 场景提供了从“理解世界”到“干预世界”的生成式行动基础设施。

图片

真机评测:四大家居任务全面领 先

Reactor Technologies, Inc. CEO兼联合创始人Alberto Taiuti 则从产业落地角度指出,世界模型已从静态、高延迟、无状态的媒体生成范式,跃迁至有状态、实时交互、具备因果逻辑的新范式。他强调,世界模型不再只是生成视频或图像,而是能够持续推演环境变化并支持双向人机交互的“生成式软件”雏形。他以公司同名平台“Reactor”为例,展示了为世界模型原生设计的开发者基础设施如何在保持极低延迟与流式传输的同时,支持机器人、游戏、仿真等高频交互场景。

Reactor Technologies, Inc. CEO兼联合创始人Alberto Taiuti

在具身智能对谈环节,黎曼动力机器人创始人刘扬与破壳机器人创始人、清华大学交叉信息研究院助理教授许华哲围绕“具身世界模型的ChatGPT时刻”展开深度对话,探讨了世界模型与VLA的边界、机器人通用世界模型的训练瓶颈、具身智能的Scaling Law以及家庭机器人PMF等核心议题。

全模态内容革命:AI重塑视频、游戏、音乐与全球文娱

论坛压轴环节举行了“全模态内容革命——AI重塑视频、游戏、音乐与全球文娱”圆桌对话,由甲子光年创始人张一甲主持。昆仑万维董事长兼CEO方汉,中国电影家协会副主席黄晓明,演员王珞丹,爱奇艺高级副总裁杨海涛,青年导演崔睿共同参与。

从左至右分别为:甲子光年创始人张一甲,昆仑万维董事长兼CEO方汉,中国电影家协会副主席黄晓明,演员王珞丹,爱奇艺高级副总裁杨海涛,青年导演崔睿

圆桌围绕AI与文娱产业的深度融合展开讨论:从演员和导演的AI创作初体验到AI演员与真人创作者的价值博弈,从AI重构平台内容生态到全模态AI重塑文娱赛道终局。嘉宾们一致认为,AI是文娱行业最 好的工具与最 大的革新者,而人类创作者永远是内容的灵魂缔造者,人机协同将成为全球文娱行业的新发展范式。

王珞丹以亲身体验,道出AI创作的"痛并快乐着"——为求一个理想镜头熬夜"抽卡"至凌晨四点,反复调整提示词却迟迟得不到想要的画面,直到清晨才终于抽到满意的镜头。她坦言自己作为"小白"创作者,从分镜、数字资产到人物设定一步步摸索,在这个过程中请朋友帮忙才得以完成。她认为创作者首先是一个判断者和决策者,需要用审美去筛选和决定最终呈现的画面,而AI能带来超出想象的运镜和流动性。她相信观众在意的是故事能否打动人心,而非媒介形态;创作者始终是表达的核心

黄晓明提到自己曾看了一部朋友制作的AI电影,三个月前看时还能明显看出AI表演的痕迹,但最近再看时,即便被告知那是AI生成,他已经完全分辨不出来了,"细节到脸上的斑点毛孔,甚至微表情、毛孔都在演戏"——这种指数级的技术迭代让他真的惊到了。AI不仅改变了他的创作方式,也融入了他的日常体验——他今天用Mureka生成了两首歌,效果很不错:“我很喜欢杨宗纬的风格,就让Mureka照着《空白格》生了一首抒情的,歌词还挺触动人心的。”从创作到投资,他对AI保持高度开放态度,明确表示很想去投资一些AI相关的项目——无论是科技方向还是影视方向

崔睿指出,AI已在实际创作中显著提升了前期故事板的制作效率,让导演能以更低成本、更短时间完成视觉预演;后期阶段,AI还能有效补足因天气等客观因素无法实拍的镜头缺失。在他看来,AI在影视制作中最能发挥价值的场景,恰恰是那些人力成本最高、执行最繁琐的“技术难题”——比如需要成千上万群演的大场面,这正是AI最擅长解决的领域。提及昆仑万维的AI视频模型SkyReels,他认为一致性非常突出——能有效解决创作者最头疼的“抽卡”效率问题,在系列化制作中保持人物、物体的稳定统一,避免反复尝试的无效劳动;同时音画同步能力也值得肯定。整体来看,他认为AI视频工具值得创作者去尝试和使用。

杨海涛从平台数据出发,透露爱奇艺后台每日收到超3000部AI短剧与上千部AI漫画,AI内容已开始分流真人剧流量。他以爱奇艺"聊天计划"扶持的网络电影《勿念》为例,AI在镜头剪辑方面实现超50%的提效,从导演构思到成片可节约三周以上的时间,并预计暑期将上线更多AI参与的网络故事片。

方汉作为技术方表态,承诺将持续降低创作门槛与Token成本,实现"人人如龙"的文化平权。他坦言技术上的难点并非大场面、爆炸等传统拍摄中昂贵的镜头,反而是小众场景数据量不足导致效果不佳;同时解释AI生成人像"塑料感"的来源是扩散模型的去噪机制将所有面孔平均化,因此让模型更真实是所有从业者的共同目标。他预测后AI时代,演员需学导演、导演需学表演,角色边界将日益模糊

所有嘉宾共同指向一个共识:AI不会消解人的创造力,反而倒逼创作者更珍视自身的独特体验与情感表达,在技术赋能下回归内容的本真。

从“生成内容”到“理解物理世界”:昆仑万维的下一个十年

从2022年“All in AGI与AIGC”战略确立,到2026年“世界模型元年”的正式宣告,昆仑万维完成了从全模态内容生成到可交互世界模型的关键跃迁。在世界模型和AIGC方向上,昆仑万维交出了全球领 先的答卷。

2026年,昆仑万维正以世界模型为支点,撬动AGI时代的下一场多模态范式革命。

世界模型元年,未来已来。

【本文经授权发布,不代表投资界立场。本平台仅提供信息存储服务。】如有任何疑问题,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

相关上市企业

AI数据总览

帷幄杭州帷幄未来科技有限公司
融资时间2026-07-15 当前轮次C+++轮 融资金额4000万美元
AI
涉及机构: 招银国际(CMB International CMBI) 旗下专注于 AI 及前沿科技的基金日本三井住友银行 (Sumitomo Mitsui Banking Corporation SMBC) 旗下企业风险投资基金 SARF (SMBC Asia Rising Fund)三菱 UFG (MUFG) 旗下泰国大城银行 (Bank of Ayudhya) 企业创投 (CVC) 平台 Krungsri Finnovate弘章投资 (Charisma Partners)韩国现代汽车集团 (Hyundai Motor Group) 新加坡电信 (Singtel Innov8)
面壁智能北京面壁智能科技有限责任公司
融资时间2026-07-15 当前轮次战略融资轮 融资金额未披露
AI
涉及机构: 国家级基金央企汽车制造商等各类产业方知名财务投资人
知有无界知有无界(深圳)智能科技有限公司
融资时间2026-07-15 当前轮次天使+轮 融资金额数千万人民币
AI
涉及机构: 元禾璞华深圳新产投
幻码跃迁上海幻码跃迁量子科技有限公司
融资时间2026-07-14 当前轮次种子轮 融资金额数千万元
AI
涉及机构: 光源成长基金云启资本小苗朗程
爱诗科技北京爱诗科技有限公司
融资时间2026-07-14 当前轮次C轮 融资金额29.8 亿元人民币
AI
涉及机构: 阿里巴巴领投Lollapalooza Capital(王慧文家办)常春藤资本惠远资本钟鼎资本韩国未来资产OCBC 生态下 Lion X 基金蓝色光标CloudAlphaiGlobe Partners 等参与

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】