智源悟界·RoboBrain Orca:当AI在“脑海”中模拟世界运行
2026年7月7日,北京智源人工智能研究院(BAAI)正式发布了多模态表征世界模型——悟界·RoboBrain Orca。这不仅仅是一次常规的模型迭代,而是一场关于AI认知范式的根本性变革。如果说过去十年大语言模型的核心逻辑是“预测下一个词元”,那么Orca提出的目标则更为宏大:预测下一个物理状态。
这个名字“Orca”取自虎鲸——自然界中最聪明的海洋哺乳动物之一,它们拥有复杂的社会结构、精准的协作捕猎能力和跨代传承的文化行为。智源团队用这个名字来隐喻他们的技术愿景:构建一个能够像生物体一样持续从世界中学习、并在内部模拟世界运行规律的AI系统。论文首页赫然写着一句话——“The World is in Your Mind”——世界存在于你的脑海之中。
从“预测下一个词”到“预测下一个状态”:为什么需要世界模型?
要理解Orca的意义,需要先厘清当前AI的技术格局。大语言模型(LLM)通过预测下一个字符实现对话和推理;视频生成模型(如Sora)通过预测下一帧画面来生成逼真影像;机器人具身模型则聚焦于预测下一步动作以完成操作任务。这三条路径各自在自己的领域取得了惊人成果,但也各自暴露了根本性局限。
智源研究院院长王仲远曾用一个生动的例子来说明问题:视频模型可以生成一只飞在天上的猪,这在数字世界是趣味内容,但在物理世界却是灾难。语言模型可以流畅描述“将杯子放在桌子边缘”,却无法真正理解杯子随后会因重力而坠落并摔碎的物理因果链。每一种单一模态的预测范式,都只能触及世界的一个侧面,却无法建立起对物理世界整体演化规律的理解。
世界模型(World Model)正是为了解决这一问题而生。智源研究院是国内最早提出并系统性开展世界模型研究的科研机构。2023年智源大会上,图灵奖得主杨立昆(Yann LeCun)首次阐述了新一代世界模型的概念;2024年智源大会明确提出世界模型是下一代大模型技术的核心方向。从“悟道”系列大语言模型到“悟界”系列物理世界基座模型,智源走出了一条从数字智能迈向物理智能的独特路径。
Orca的核心架构:统一世界潜在表征空间
Orca的技术核心在于构建了一个“统一的世界潜在表征空间”(Unified World Latent Space)。这个概念可以从两个层面来理解。
第一层是“统一”。当Orca接收到一段视频、一张图片、一条文字指令或一段事件描述后,它不会像传统模型那样将这些输入分配给不同的处理模块,而是将视觉信号、语言信号、任务意图等所有多模态信息统一整合到同一个潜在空间中。在这个空间里,物体的运动规律、场景的演变逻辑、动作与结果之间的因果关联、事件之间的时序关系,都被编码为同一种“世界状态”的数学表达。
第二层是“潜在”(Latent)。Orca并不直接在像素层面或文本层面进行预测,而是在一个压缩后的隐空间中建模世界状态的转移。这个隐空间就像AI的“脑海中的世界”——它不存储具体的画面或文字,而是存储关于世界如何运转的抽象知识。正是这种设计,使得同一个模型可以同时支持三种截然不同的输出:语言读出(回答“发生了什么”)、视觉读出(预测“接下来会怎样”)和动作读出(决定“我该怎么做”)。
从数学形式上看,Orca将世界学习定义为隐空间状态建模。给定多模态世界信号X,Orca将其映射为隐空间世界状态S = fθ(X),然后通过条件概率模型预测状态转移:S(t+Δ) ∼ pΘ(S(t+Δ) | S(t), z(t), c(t))。其中z(t)捕获隐式动力学,c(t)指定显式条件,Δ决定模型是预测未来状态还是回溯过去状态。这意味着Orca不仅能“向前看”推演世界未来的演化方向,还能“向后推”回溯事件的前因。
双路径训练:无意识学习与有意识学习
Orca最引人注目的设计之一,是其“无意识学习+有意识学习”的双路径训练体系。这一设计灵感直接来源于人类婴幼儿认知发展的过程。
无意识学习(Unconscious Learning)模拟的是婴儿在获得语言能力之前通过观察世界积累常识的过程。Orca使用12.5万小时的真实世界视频数据进行无监督训练,让模型自主感知物体如何掉落、如何移动、被遮挡的物体是否仍然存在、动作执行后场景如何变化。这些学习不需要任何人工标注,完全来自对连续视觉事件本身的密集观察。就像一个婴儿看着树叶飘落、积木倒塌、猫咪跳上桌子,逐渐建立起对物理世界运行规律的直觉认知。
有意识学习(Conscious Learning)则模拟语言、目标和意图出现后,人类如何将观察组织为因果结构。Orca使用1.6亿条事件标注数据、任务指令和视觉问答(VQA)对进行有监督训练,让模型学习具有明确语义意义的状态转换逻辑——“如果我推这个杯子,它会怎样”“为什么门会打开”“接下来会发生什么”。如果说无意识学习提供了密集的世界经验,那么有意识学习则将这些经验转化为可以推理和交流的因果模式。
两条路径共享同一个主干网络,互补建模世界的连续性与因果性。这种设计精妙地平衡了数据效率与知识深度:无意识学习从海量无标注视频中汲取广泛的物理直觉,有意识学习则从相对稀疏但信息密度极高的标注数据中提取精确的因果推理能力。
三大核心能力:想、看、动三位一体
基于统一世界潜在表征空间,Orca具备了三大核心能力:统一表征、因果推演和模态解码。这三项能力汇聚为一个直觉上极为强大的特性——“想、看、动”三位一体。
“想”对应语言思考能力。当Orca面对一个复杂场景时,它能通过语言读出接口生成对当前状态的描述、对因果关系的推理、以及对未来发展的判断。例如面对“把桌上的可乐递给客人”这条指令,Orca会先进行语言推理:“客人渴了,需要先确认哪瓶是可乐。”
“看”对应视觉预测能力。Orca能基于当前图像和指令,预测执行动作后世界状态的视觉变化。与Sora等视频生成模型不同的是,Orca的图像预测严格遵循物理规律——物体不会凭空消失或出现,位置变化符合空间逻辑,碰撞和遮挡关系保持一致。在PRICE-V0.1基准测试中,4B参数的Orca在图像预测任务上以59.8分超越了FLUX.2 klein的56.1分,而且标准差更小,意味着输出更稳定。
“动”对应动作决策能力。这是Orca作为具身大脑最直接的应用价值。模型能从统一世界潜在表征中直接解码出机器人动作序列——关节角度、末端执行器轨迹、双臂协调方案等。更令人印象深刻的是,Orca在预训练阶段完全不使用任何动作标签,仅在下游通过200条域内轨迹的微调,就能在未见过的物体和场景上泛化出可靠的操控策略。在真实双臂轮式机器人的OOD(分布外)泛化测试中,Orca的整体任务完成率达到32.4%,超越了Meta的V-JEPA 2.1(17.0%)和Physical Intelligence的π₀.₅(29.4%)。
数据规模与Scaling潜力
Orca的预训练依托于大规模高质量数据集:12.5万小时真实视频提供密集自然状态转移的学习信号,1.6亿条事件标注提供有意义的因果状态转移推理信号,1150万个VQA样例提供问题条件下的世界理解认知信号。
一个关键发现是,Orca的世界学习目标在模型和数据两个维度上都展现出持续的Scaling特性。随着预训练数据规模增长,世界学习损失持续下降;更大的主干网络能实现更低的损失。更重要的是,当主干网络冻结后进行下游读出训练时,更强的世界预训练直接带来更强的下游表现——这证明Scaling世界预训练确实产生了更有用的共享表征。论文指出,当前Orca仅使用了约十分之一的可用数据量,这意味着随着数据规模的进一步扩大,模型性能仍有巨大的提升空间。
在4B参数规模的评测中,Orca在MVBench、TemporalBench、3DSRBench和SWITCH四个视觉语言基准的综合得分达到51.8,超越了同规模的Qwen3.5(46.7)和Gemma 4(40.8),尤其在状态转移推理和动态运动理解两个维度上优势显著。
竞逐世界模型:全球赛道格局
Orca的发布将智源推入了全球世界模型竞赛的核心赛道。纵观当前的竞逐格局,几条不同的技术路线正在并行推进。
杨立昆团队的JEPA系列(包括最新的V-JEPA 2.1)代表了“以视觉表征为中心”的路线,通过预测视觉嵌入的压缩来学习世界模型。Google DeepMind的Genie系列走的是“以像素为中心”的路线,专注于从视频中学习可交互的环境模型。李飞飞创办的World Labs则探索“以三维结构为中心”的路线,其Marble模型致力于构建空间智能。OpenAI的Sora同样是像素级视频预测,但在物理一致性上仍然存在明显短板。
智源的Orca选择了一条独特的道路——“以状态转移为中心”。它既不是在像素空间中预测画面,也不是在文本空间中预测词汇,而是在一个统一的隐空间中预测世界状态的演化。这种设计使得Orca能够同时从视觉、语言、音频、触觉、力反馈甚至红外辐射等多种信号中学习,而不是被绑定在某一种特定的感知模态上。
2026年6月,中国AI实验室在30天内发布了13个新的具身AI基础模型,平均每48小时就有一个新模型问世。阿里的通义实验室推出了Qwen-RobotNav、Qwen-RobotWorld和Qwen-RobotManip三件套,NVIDIA的GR00T基础模型也在持续迭代。这场密集的发布浪潮传递出一个明确信号:具身智能的瓶颈已经不再是硬件或遥操作数据,而是世界建模和推理层面的能力。
对具身智能与通用AGI的深远影响
通肯智能(TOKEN 导航)在跟踪世界模型发展脉络时指出,Orca所代表的技术路线对具身智能和通用人工智能的推进具有多重深远影响。
首先是机器人“理解物理”的方式发生了根本改变。传统机器人需要人类预先定义物理规则或通过大量演示数据训练策略网络。Orca让机器人通过观察世界视频就能自主积累物理直觉——它知道杯子放在桌子边缘会掉落,知道推开门后门后的空间会显露,知道物体被遮挡后并不会消失。这种“理解”不是基于规则编码的,而是从数据中涌现的,因此具有更强的泛化能力。
其次是“少样本泛化”从理想走向现实。Orca仅需200条域内轨迹就能泛化到全新场景的能力,意味着工业机器人可以快速适应新产线,服务机器人可以迅速学会新任务,而不需要从头采集数千条演示数据。这对于降低具身智能的部署成本具有直接的商业价值。
第三是为通用AGI提供了新的技术路径。世界模型被认为是通往AGI的关键路径之一——如果一个AI系统能够在“脑海”中模拟世界是如何运行的,它就能像人类一样进行规划、预测和推理。王仲远的判断是,世界模型特别是世界基座模型有望在未来5到10年成为人工智能领域的重大技术颠覆和研究范式。
当前局限与未来展望
必须清醒地认识到,Orca仍处于世界模型发展的早期阶段。论文坦诚地指出了几个当前局限:首先,Orca目前仅支持视觉和语言两种模态,尚未整合音频、触觉、力反馈和本体感知等信号;其次,视觉监督仍然依赖现有的视觉编码器空间,而非原生学习的表征;第三,实验目前在0.8B和4B参数规模上进行,更大规模的验证有待展开。
王仲远在接受采访时也强调:“必须承认物理AI特别是世界基座模型的研究,全世界范围依然处在非常早期,甚至概念和技术路径都远没有收敛。”他将当前的世界模型比作2012年的大语言模型——方向已经明确,但距离真正的爆发还需要数年的技术积累和生态建设。
但正是这种“早期”的状态,赋予了Orca最大的想象空间。当Scaling Law开始发挥作用,当数据规模从十分之一扩展到全部,当0.8B和4B的模型成长为百亿甚至千亿参数的庞然大物,当更多模态的信号被纳入统一表征空间,Orca所开辟的“下一个状态预测”范式可能真正释放出理解物理世界的通用能力。
结语
通肯智能(TOKEN 导航)认为,悟界·RoboBrain Orca的发布标志着AI从“理解文本”迈向“理解世界”的关键一步。它不追求生成最逼真的视频,不追求写出最流畅的文章,而是要让AI在自己的“脑海”中构建一个关于世界如何运转的内在模型——然后从这个模型中读出语言、读出画面、读出行动。
从“悟道”到“悟界”,从预测词元到预测物理状态,智源研究院用Orca向我们展示了AI认知能力的下一个前沿。这场关于“世界如何被理解”的探索才刚刚开始,但Orca已经证明:当AI学会在脑海中模拟世界运行的时候,通往通用人工智能的道路或许真的不再遥不可及。
常见问题
Q1:Orca和Sora等视频生成模型有什么本质区别?
A:Sora等模型的核心目标是“像素生成”,即生成视觉上逼真的视频画面,但不保证物理一致性(物体可能凭空出现或消失)。Orca的核心目标是“状态预测”,即预测世界状态的因果演化。它生成的不是任意可能的画面,而是符合物理规律的下一状态。两者的训练目标、内部表征和应用场景有本质区别。
Q2:Orca的“无意识学习”和“有意识学习”分别对应什么?
A:无意识学习通过12.5万小时的连续视频数据,让模型以无监督方式学习物体运动、接触、遮挡等密集自然状态转移,类似于婴儿通过观察积累物理直觉。有意识学习则利用1.6亿条事件标注、任务指令和VQA数据,让模型学习具有明确语义意义和因果结构的状态转换,类似于人类通过语言和经验组织因果认知。
Q3:为什么说Orca对具身智能(机器人)特别重要?
A:传统机器人策略学习需要大量的人类演示数据,而Orca通过预训练获得了对物理世界的广泛理解,下游仅需200条域内轨迹即可泛化到全新场景。这意味着工业机器人可以快速适应新任务,服务机器人可以低成本部署到新环境,大幅降低了具身智能的实际落地门槛。
Q4:Orca目前支持哪些模态输入和输出?
A:当前版本的Orca支持视觉(视频、图像)和语言(文本指令、事件描述、VQA问答)两种输入模态,以及语言生成、图像预测和机器人动作序列三种输出模态。论文指出音频、触觉、力反馈和本体感知等信号的整合是未来的重要方向。
Q5:世界模型距离真正的大规模落地还有多远?
A:智源研究院院长王仲远坦承,世界模型仍处于非常早期的阶段,概念和技术路径远未收敛。他将当前阶段比作2012年的大语言模型。但他同时指出,技术探索必须先行于产品和系统,正如深度学习2006年提出概念、2017年Transformer问世、2022年底大语言模型才爆发。世界模型的爆发可能需要3到5年甚至更长时间,但Orca已经迈出了关键的第一步。
37020202001687