打开APP

给世界模型加上“门控机制”:拆解酷哇科技 RISE 架构

2026-09-02 16:19 网络

开篇:一个被行业忽视的"算力悖论"

试想这样一个场景:一台自动驾驶车辆正行驶在凌晨空旷的城市主干道上;而在城市的另一端,一台机器狗正试图穿过早高峰人流密集的城中村路口去完成取货。

面对截然不同的物理环境,它们的大脑在规划下一步动作时,应该消耗同样的算力去推演未来吗?

过去几年,世界动作模型(World Action Models, WAMs)在机器人和端到端自动驾驶领域大放异彩。它允许智能体在执行动作前,在潜在空间中"想象"未来的环境演变,通过评估动作的后果来辅助决策。

然而,现有模型在架构设计上普遍存在一个资源分配的结构性瓶颈:它们对所有场景都分配固定帧数的想象预算(Fixed Rollout Budget

这种"一刀切"的机制意味着,无论是空旷无人的城市主干道,还是行人交织的复杂十字路口,系统都在进行同等深度的推演。对于简单场景,过度推演不仅无法提升规划质量,反而会大幅增加不必要的推理延迟;而对于复杂交互场景,固定的推演深度往往又不足以解析多方的交互博弈。

为解决这一行业级技术痛点,酷哇科技(COOWA)技术团队正式发布全新自适应想象世界模型框架 RISERefining Imagination through SElective Rollout。作为系统级自适应调度的标杆,RISE 突破了传统模型“固定算力推演”的局限。目前,论文、代码与数据集均已开源:

论文题目:RISE: Adaptive Imagination for World Action Models

论文链接:https://arxiv.org/abs/2608.20430

项目主页:https://cowarobot-ai.github.io/RISE/

开源代码:https://github.com/COOWAI/RISE

CounterDrive 数据集:https://huggingface.co/datasets/COWARobot/CounterDrive


真正的智能不仅仅在于算力的堆砌,更在于对认知资源的精准调配。RISE 架构的提出,旨在为具身智能世界模型赋予一种更接近人类的“物理直觉”;这也为酷哇科技“一脑多态”战略下的城市级机器人集群常态化作业,提供了坚实的底层 AI 支撑。

一、架构重构:构建"自适应"推演门控机制

传统的 WAMs 架构(无论是同架构预测还是级联预测)大多依赖全局设定的推理时间表,无法在推演过程中动态评估当前的前缀信息是否已经足够支撑安全规划。

图1_四种想象策略对比

RISE 框架的核心创新,在于将“全局规划”转化为灵活的“序列化决策”。

它不预设最终的推演深度,而是在每一步推演之后,重新衡量继续推演带来的预期规划增益(Future Planning Gain)。这一理念通过轻量级调度器(Scheduler)中的两个核心组件得以实现:

1.潜在评估器(Latent Evaluator:在隐空间推演的每一步,评估器会对当前的想象序列进行状态评估。它能够动态预估当前序列已揭示的风险曲线(Risk Profile),并预测若继续推演下一帧,规划质量的潜在提升幅度(即未来规划增益曲线)。

2.推演门控(Rollout Gate:门控模块承担着算力调度的枢纽作用。它将评估器输出的“预期规划增益”与“继续推演的算力成本”进行实时量化权衡。仅当预期收益大于成本时,模型才会输出 ROLL 并生成下一帧未来特征;若收益不足以抵消算力消耗,门控则输出 STOP,将当前收集到的序列送入规划器(Planner)进行最终动作生成。

图2_RISE整体架构

通过这一底层逻辑的重构,RISE 实现了*仿生学意义的"见机行事"——推演的有效深度不再是依赖人工预设的超参数,而是从一次次 Roll/Stop 决策中自然涌现的结果。

二、算力按需分配:推演深度的场景化适配

在端侧设备上实现高频规划,对算力分配提出了严苛要求。完全不推演无法应对复杂交互,而盲目拉长预测时间则会造成极大的延迟浪费。

RISE 的论文通过海量场景的逐层消融实验,揭示了不同路况对推演深度的真实需求:

图3_推演深度性能热力图

实验数据表明,没有任何单一的固定推演深度是*的

无需推演的极简场景(Depth 0:有 1,248 个测试场景在零推演下表现*。在这类路况下,强行增加推演反而会导致性能(EPDMS)从 89.9 掉落至 88.4——算力分配更高,效果反而更差。

需要深度博弈的复杂场景(Depth 3 & 4:在涉及密集行人流和穿插车辆的复杂路口,有 4,036 + 2,180 个场景极度依赖 3 帧以上的深层未来预测。对深度需求最高的场景组,推演深度从 0 加到 4,EPDMS 从 88.5 提升至 91.1。


图4_不同深度代表场景

RISE 的动态调度机制,让单次推理平均仅发生 2.40 推演迭代,平均推演延迟压缩至 287 毫秒左右。作为对照:随机停止策略延迟虽低(264ms),但 EPDMS 只有 89.5;隐空间收敛判停策略延迟更高(309ms),EPDMS 也只有 89.7——而 RISE 以 287ms 的延迟实现了 90.8 的最高规划质量。在兼顾极速响应的同时实现了最高水平的规划质量。

三、数据破局:CounterDrive 反事实数据集重塑危险感知

要使潜在评估器具备准确预判“风险”的能力,模型需要建立对危险边界的深刻认知。然而,真实的驾驶日志大多记录的是人类安全通过的"单一结局",缺乏安全关键(Safety-critical)的事故长尾数据 。

图5.1_CounterDrive反事实样本

图5.2_Counterwork反事实样本(暂未开源)

为此,酷哇科技创新性地构建了 CounterDrive 反事实数据集。团队基于视觉大语言模型(VLM)构建场景与事件描述,运用 AIGC 技术在真实场景的起始帧基础上,大规模生成各类覆盖多种城市场景的危险场景结局(10 秒、1080p 视频)。每一条保留的生成数据都经过了专家的严格验证,并对事故起点、轨迹有效性与因果类别进行精准人工标注。

最终,CounterDrive 沉淀了来自 nuScenes 的 2,432 条训练 / 511 条测试片段,以及来自 NAVSIM 的 5,013 条训练 与 1,000 条测试片段,形成"真实-反事实"成对的高维监督信号,极大地丰富了模型的未来动态表征能力。

图6_CounterDrive安全评估

实验显示,未经 CounterDrive 训练的模型,在识别危险场景时缺乏有效辨识度(AUC 在 0.49–0.52 之间徘徊,事故识别准确率仅 0.51);而接入 CounterDrive 后,模型在 1~4 秒各个时间窗的风险识别 AUC 均提升至 0.93 以上,事故识别准确率达 0.96,为系统在临界状态下及时响应提供了直觉保障。

四、揭秘 RISE 的三阶渐进式训练法则

为保障自适应架构的有效收敛,酷哇研发团队设计了三阶段渐进式训练法则(Three-Stage Training Recipe):

1.*阶段:预测器与初始规划器训练。利用真实数据与被接纳的 CounterDrive 反事实片段,训练模型自回归生成*深度的潜变量,并用真实轨迹监督初始规划器。

2.第二阶段:潜在评估器与引导规划器训练。固定预测器,利用 CounterDrive 中精准的事故节点标注进行"局部风险校准"(Localized Risk Calibration),让模型学会在隐空间中识别风险;同时枚举所有推演深度下的真实规划得分,构造未来规划增益(Future Planning Gain)的监督靶标。

3.第三阶段:推演门控蒸馏。冻结其他模块,将所有维度的规划收益与对应的累积计算成本转化为靶标,作为成本感知的停止策略(Cost-aware Stopping Policy)蒸馏注入给 Rollout Gate。

五、评测基准与架构泛化验证

在量化评估中,RISE 展现了行业*的综合性能,并验证了其作为底层调度模块的泛化潜力:

图7_NAVSIM_v1性能表

图8_NAVSIM_v2性能表


NAVSIM v1 & v2 基准测试:RISE 在 v1 与 v2 测试中分别取得91.5 PDMS 和 90.8 EPDMS 的成绩,分别超越最强基线 0.8 和 0.9 个百分点。在 v1 上将此前*的自车进展(EP)与碰撞时间(TTC)分别提升 2.9 和 1.9 分;在 v2 的 9 项细分指标中,7 项*或并列*,在安全、合规与规划质量上全面领跑。

nuScenes 开环测试:平均轨迹 L2 误差降至 0.31m,平均碰撞率压低至行业*的 0.10,实现了拟人级的丝滑与安全规避。


图9_RISE(红)vs Drive-JEPA(黄)vs 人类轨迹(绿)在 h=4 到 h=0 不同深度下的对比,RISE 全程贴合人类轨迹与车道几何

赋能同业架构:研发团队将 RISE 调度器以“插件化”方式接入前代 DAWN 架构,全程未修改 Predictor 与 Planner 的底层逻辑。验证结果显示,DAWN 模型的 PDMS 得分从 89.1 提升至 90.3EP 与 TTC 分别提升 2.7 分与 2.3 分,并保持了碰撞安全表现 。进一步表明动态算力调度机制具备适配更广泛世界动作模型的通用潜力。


图10_Scheduler迁移DAWN

六、赋能全形态终端,重塑 Robocity 城市全景智能

技术的最终归宿在于服务真实的社会生产力需求。

目前,酷哇科技正稳步推进“一脑多态”的商业战略。这一蓝图要求一套高泛化能力的具身“大脑”,能够灵活且低成本地适配从城市服务机器人、自动驾驶车辆,到四足机器人及泛人形终端等多种物理形态。

RISE 框架的资源调度机制,进一步为这一工程化挑战提供了可行路径:

轮式底盘与智能小巴:在高度动态的城市环境中,机器人设备需要随时应对各类复杂多变的作业情况。搭载 RISE 的系统能够在常规路况下保持低延迟与低功耗,释放边缘算力;在应对违规非机动车或行人盲区穿行等复杂博弈时,又能精准调用算力拉长推演深度 。算力的精细化管理,将大幅降低量产车型的硬件预埋成本。

足式与泛人形终端:四足机器人在应对非结构化地形时,动作空间对关节力矩的计算延迟极其敏感。RISE 的动态机制允许机器狗在平整路面节省算力,而在面对台阶或散落物时,启动短时隐空间推演预判物理接触面反馈,以提前规避失稳风险。

结语

从端到端自动驾驶的探索,到通用具身智能的场景延伸,酷哇科技始终坚持技术探索与商业落地的双轮驱动策略。RISE 架构的发布,不仅是对机器推演机制的一次理论优化,更是酷哇在城市级机器人集群算力管理与主动安全体系建设上的坚实一步。

未来,酷哇将继续以顶层 AI 架构为技术引擎,推动不同形态的具身智能机器人真正融入城市脉络,迈向更安全、更高效的全天候城市规模化作业新纪元。

关于酷哇科技

酷哇科技(COOWA)成立于2015年,作为世界模型驱动的城市场景具身智能全栈商。公司深度聚焦智慧出行、市政环卫、智能制造、物业服务四大核心场景,构建了涵盖轮式机器人、四足机器狗及泛人形机器人的多元化产品矩阵。酷哇始终坚持以技术创新推动具身智能从 Demo 走向规模化落地,致力于打造真正具备生产力价值的机器人。

(免责声明:本文转载自其它媒体,转载目的在于传递更多信息,并不代表本站赞同其观点和对其真实性负责。请读者仅做参考,并请自行承担全部责任。)

相关资讯

【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】