这两年,AI 视频生成,🔥了。
Sora 一出,全网惊叹;可灵、Seedance 轮番上阵,生成的视频光影逼真、运镜丝滑,很多人看完*反应:电影工业要完蛋了。实际上两年过去,横店演员不少都失业了。
说实话,这事办得不地道。如果是AI生成的,那至少标识一下。不少人不喜欢看动画片,比如我。
2D这么🐮,一个听上去顺理成章的联想开始了:
既然 AI 连以假乱真的视频都能生成,那让它顺手生成一个三维世界,2D到3D,应该也就是“差1D”的事吧?
过去几个月,我们围绕“世界模型”这条线做了调研、项目做了一些访谈。把国内外大厂的研发路径也翻了一下。今天这篇,我们就来分享一下常垒的小研究、小成果。
先说最反常识的那一句:
纯 2D 视频输出不等于 3D 空间;现有 2D 视频模型也不能仅靠继续扩大参数规模,直接变成具备显式几何、空间记忆和可编辑资产能力的三维世界模型。
视频再逼真
也只是“录像”,不是“房子”
先打个比方。
你对着一套房子拍了一段 360 度的看房视频,画面精美、光影真实。但请问:你能拿着这段视频去施工队那里,把房子原样盖出来吗?
不能。因为施工队要的是建筑图纸和建材清单,不是录像。所以,广联达同志出现了。
黑神话悟空的电影和游戏就是这个差别。开篇电影里面可能看起来和游戏差不多,但是电影只能“看”不能“逛”;但是游戏可以,猴子可以在外面逛,360度看周围的环境。李飞飞老师的最新产品,就是这个效果。很精美的视频,但其实不是纯视频,里面是可以逛的。
2D 视频模型和 3D 原生空间智能之间的本质差别:
2D 视频模型(Seedance、可灵、MiniMax、Sora)的数学本质,是潜空间里的像素概率去噪。 它交付的是一段 MP4 像素流(人话就是视频)——本身不是结构化、可编辑、可复用的三维资产。
从 2D 像素反推三维几何,在数学上属于“病态逆问题”(Ill-posed Inverse Problem):一张照片背后有无数种可能的三维场景,靠堆参数、堆算力,堆不出*的几何一致性。
在大范围回环、360 度环视或长时域交互中,如果没有显式的三维表示和空间记忆,画面里的物体就容易出现身份变化、结构漂移、遮挡区域重构和拓扑错误。(回到高中物理的几何,就明白,平面几何和立体,不是一个东西)
3D 原生空间要交付的,是“图纸和建材”:解耦的拓扑网格(Mesh)、UV/PBR 材质通道、碰撞边界。 这些东西能直接导入渲染管线和物理引擎,是可以二次使用,编辑,改造的,不是视觉视频表演。
创业公司更不能只跟创业公司比,不可低估大厂的实际行动。商业化的时候没人管是大厂还是创业公司。只有投资人关注在创业公司中比。因为大厂没有机会投资了。
大厂身体很诚实:
腾讯没有把混元视频“升级”成 3D,而是另起炉灶,独立做了 Hunyuan3D-2.0;
字节没有把 Seedance 改造成 3D,而是由独立团队另辟了 Seed3D 1.0/2.0;
阿里是模型工厂,种类最多,在3D上也没有闲着,搞出来Qwen-3D;
快手可灵和 MiniMax 目前公开信息只有 2D 像素路线,没看到在3D模型上面发力;
所以,“2D 视频模型不能仅靠扩大参数规模直接升级为 3D 原生空间系统;如果要进入这一方向,通常需要增加独立的三维表示、空间记忆、几何重建与交互能力”——一般是另起炉灶,一个新团队做新事。
这样其实也给创业公司提供了机会,如果2D+1D=3D,那大厂的2D视频模型的壁垒,就是创业公司无法逾越的山。
3D/空间生成模型与 2D 视频厂商横向对比:

(表格可点击放大查看)
世界模型
更适合看作“2+1”的三类产业角色
理清了 2D 和 3D 的边界,真正的世界模型版图才浮出水面。
经过这轮梳理,我们不能随便把什么企业都简单称为:世界模型公司。更适合产业分析的方式,是将它们归为“两类核心模型 + 一套训练工具链”的 2+1 分类。
不是说有模型的就是比没模型的高级;就算有模型的里面还是分“夯”还是“拉”。
这三类角色不是高低配关系,而是三种不同的能力、交付物、客户和生意:
*类:世界生成模型——建空间和物体。(World Generation Model)
WGM是我个人比较喜欢的称呼,中国人清晰易懂
李飞飞团队 World Labs 常用的术语体系:Spatial Intelligence / Spatial World Model:侧重三维空间、几何与物理先验的世界模型。
DeepMind Genie 系列: Interactive World Simulator:侧重动作条件输入、物理推演与可交互沙盒性质的表达。
看的是能否建立可持续、可编辑、具备稳定空间约束的显式三维空间,并在多视角、自由相机移动和场景编辑中保持较强的一致性。
需要强调的是,显式三维表示可以让空间一致性变得可约束、可优化、可验证,但不意味着实际系统天然没有漂移。实际上就是这个模型有没有幻觉。
全球标杆是李飞飞的 World Labs(Atlas/Marble),最近刚刚发了一段产品,*的精美。
中国阵营里:影眸 Hyper3D CAST、腾讯 Hunyuan3D-2.0、字节 Seed3D 2.0、阿里 Qwen-3D、都在这一类别卡位。(VAST应该在内部做一个Project Eden,还没正式官宣)
就好像大家都要登上珠穆朗玛峰,登山者都在喜马拉雅山下的不同坡开始往上爬。过程中,半山腰和山顶可能就要打起来。最终8848登顶就是:“骇客帝国”,一个完全由模型生成的世界,里面有完整的物理、材料、摩擦力、重力等等物理世界约束。
当年Neo其实是在世界模型里面“Vibe Coding”,Hacking了这个模型生成的系统。然后变成了游戏里的神。
骇客帝国这个电影,可以考虑回炉再看一百年;现在有语言生成模型和世界生成模型,就能看懂了。
不是导演太蒙太奇,而是电影太超前。

第二类:世界行动/具身策略模型——做行动(World-Action Model)
看的是能否结合视觉、语言、本体感觉和历史状态,预测动作后果并生成可执行的行动策略,在真实环境中根据反馈持续纠偏。行动模型可以部署在机器人端侧、边缘设备、云端或机器人厂商的控制系统中,“嵌入机器人脑中”是部署形态,不是定义本身。
行动模型看的是能否把视觉、触觉、本体感觉和历史状态转化为可执行的动作策略,并且在显式或隐式的预测机制中预演动作后果,失败后能够根据反馈自主纠偏。它不一定直接输出每一个高频关节力矩,低层力矩、阻抗和平衡控制可以由配套控制栈完成。
全球可关注:
Physical Intelligence(π0)、Figure(Helix) 等行动模型和具身系统;
中国阵营里:
阿里达摩院的 WorldVLA/Qwen-RobotManip、银河通用、*视界、它石智航、智元机器人、生数科技可作为重点研究对象。
(本文的判断标准是是否有公开证据支持动作后果预测、行动—模拟协同和真实反馈闭环,而不是只看企业是否使用“世界模型”这一名称。)
一句话记住这个 2+1 分类:
纯 2D 视频输出不等于 3D 空间;现有 2D 视频模型也不能仅靠继续扩大参数规模,直接变成具备显式几何、空间记忆和可编辑资产能力的三维世界模型。两类模型负责“建空间”和“做行动”,一套工具链负责“让模型可训练、可测试、可部署”。
+1类:非模型,仿真、合成数据、训练、评测与部署工具链——供模型使用(World Model Toolchain)
工具链的任务是构建可用于训练、测试和验证的仿真环境,生成合成数据,评估模型在长时域、分布外和安全边界场景中的表现,并帮助模型从虚拟环境迁移到真实环境。这里既包含物理引擎、数字孪生和仿真平台,也可能包含动作条件化的学习型世界模拟模型;前者不是模型本身,后者仍属于模型。
作为工具链和学习型模拟能力的代表,全球可以关注 NVIDIA 的 Cosmos、Omniverse 和 Isaac Sim;
中国市场则可关注松应科技的ORCA物理AI操作系统、飞捷科思的 Fysiverse/Fysics、*视界的 GigaWorld 等。
世界模型产业 2+1 全局矩阵:

(表格可点击放大查看)
+1 工具链
国产力量正在悄悄“换地基”
工具链可能是当下产业价值最实在、也最容易被忽视的一类基础设施。它不一定是模型企业,但决定了模型能否低成本训练、反复测试并可靠地从虚拟环境迁移到现实环境。
具身智能行业有个公开的苦衷:真机数据太贵、太少、太危险。让机器人在真实世界里摔一万次杯子去学会抓杯子,没有哪家公司摔得起。于是,高保真的物理仿真沙盘,成了整个行业的真实训练“替代品”。
这类工具链中有两个值得重点关注的国产:
一是松应科技的 ORCA。 创始人聂凯旋曾任华为云鲲鹏解决方案副总指挥,团队聚合了华为、英特尔等大厂的底层系统和并行计算专家。他们不走像素生成路线,自研了国内*实时多物理场耦合仿真系统 ORCA SIM——刚体碰撞、柔性体形变(线缆、布料、软体材料)、流体动力学统一求解,专治传统仿真的“穿模”和动力学失真,大幅压缩 Sim-to-Real 的鸿沟。
原生支持 OpenUSD,率先接入 MCP 协议(通用 Agent 可以直接调度仿真沙盘),并且异构适配摩尔线程、沐曦、天数智芯等国产芯片。
另外要提一句我们的被投项目飞捷科思:创始人张立华教授是英伟达 PhysX 物理引擎的主要奠基人,他们自研的可微分物理引擎 Fysics,和传统引擎的思路根本不同——传统引擎是“给定输入,算出下一个状态”;可微分引擎能反过来告诉 AI“你刚才的输入让你离目标更近了还是更远了”。这个能力打通了“仿真—训练—优化”的全链路,在全球范围内都屈指可数。
这类工具链的商业形态已经很清晰:仿真一体机、平台授权、合成数据按有效时长计费。客户是具身智能公司、自动驾驶主机厂和工业数字孪生客户——是真金白银在付费的 B 端生意。
两家侧重有些差别,单商业化的时候又会都来到一个公平的场景,谁为下游真正解决问题,谁能拿到真正的单子和回款。
仿真、世界模拟与训练基础设施对比:

第二类核心模型
如何识别真正的世界行动模型
行动模型是概念最容易泛化的地方。现在很多机器人项目都会使用“世界模型”“具身大脑”或“动作思维链”等表述,但名称本身不能替代技术证据。

为避免把传统 VLA、行为克隆、低层运控和完整的行动模型混为一谈,本文采用三项判断标准:
1. 因果动力学推演:模型要在潜在空间真正掌握物理状态转移规律,而不是对着画面拟合关节轨迹;
2. 行动-模拟思维沙盘:动作执行前能在"脑内"预演碰撞风险和操作后果,长程任务失败时能自主纠偏;
3. 真实反馈下的物理闭环:视觉、触觉、本体感觉等反馈能够持续影响动作策略和控制输出;高频力矩与阻抗控制可以由配套控制器完成,不必要求基础模型直接承担全部低层控制。
用这三条标准去看公开项目,重点不是给企业贴标签,而是判断公开证据是否足以支持其进入本文的行动模型类别。
可以重点研究的行动模型对象:
阿里达摩院的 WorldVLA 它尝试打通“世界模型管物理因果、动作模型管行为输出”之间的割裂:输出动作的同时,脑内预演这个动作会引发什么后果——抓取滑脱时。传统 VLA 会机械地卡死,WorldVLA 能自己调整动作直至抓取成功。配上 Qwen-RobotManip(80 维跨本体动作空间 + 流匹配动作头),为中国阵营提供了较具代表性的世界行动模型。
银河通用、*视界、它石智航、智元机器人、生数科技按公开信息也初步符合三项判断标准,路径各有侧重(扩散统一模型、触觉-世界模型耦合、动作思维链等)。
补充一句:
本文不把机器人整机、低层运控栈、系统集成和行动模型简单等同。整机企业可以是行动模型的部署方或验证方,控制栈可以是行动模型的配套执行层,而是否属于核心行动模型对象,仍应回到动作后果预测、行动—模拟协同和真实反馈闭环这三项标准。
划清这条线不是为了贴标签,而是因为估值逻辑完全不同:运控小脑值硬件的钱,纯 VLA 值数据的钱,而真正的 WAM,值的是通用具身智能入口的钱。
行动模型对象与边界说明:

(表格可点击放大查看)
2+1 不是孤立的
而是一个产业飞轮
最后把两类核心模型和一套工具链放在一起看。
3D 空间资产可以进入仿真工具链,工具链批量生产合成数据、做场景测试和因果预演,再服务于行动模型的训练与验证;行动模型驱动真机上岗作业,遇到的长尾异常案例(Corner Case)再反哺回仿真系统和空间模型,持续优化。
空间资产 → 仿真与数据工具链 → 行动模型 → 真实异常反哺——这是世界模型产业可以形成的 2+1 飞轮。
2+1 体系商业化交付与真实 ROI 核算:

(表格可点击放大查看)
站在投资视角,这个 2+1 结构,我就武断而残暴的总结:
· *类模型看:输出的审美
· +1类工具链看:没有人真买单
· 第二类模型看:动作灵不灵
每一类都会跑出大机会,但前提是,先看清它到底卖的是什么、服务谁,以及它在模型与工具链中的位置。
以上是我们近期研究的一点阶段性结论,抛砖引玉,欢迎一线创业者和同行交流指正。如有不同意见,那一定是你对。









