LingBot-VA 2.0 与 Orca 世界模型:中国具身智能的崛起
具身智能(Embodied AI)被认为是人工智能的”下一个圣杯”——让 AI 不仅能思考,还能在物理世界中行动。2025 年,蚂蚁集团的 LingBot-VA 2.0 和北京智源人工智能研究院(BAAI)的 Orca 世界模型几乎同时取得突破,标志着中国在这一前沿领域的强势崛起。
具身智能:AI 从数字走向物理的关键一步
具身智能的核心挑战在于:AI 必须理解物理世界的因果关系,预测行动的后果,并在不确定的环境中做出可靠决策。这远比在数字环境中下棋或生成文本复杂得多。
全球范围内,Google DeepMind 的 RT-2/RT-X、Physical Intelligence 的 π0 系列、以及特斯拉的 Optimus 项目都在争夺这一赛道。中国的两个新突破——LingBot-VA 2.0 和 Orca——代表了两种截然不同的技术路线,都取得了令人瞩目的成果。
蚂蚁集团 LingBot-VA 2.0:因果推理驱动的操控专家
核心技术架构
LingBot-VA 2.0 采用了因果扩散 Transformer(Causal Diffusion Transformer, Causal DiT)架构。与传统的行为克隆方法不同,LingBot-VA 2.0 不是简单地模仿人类示范,而是理解动作背后的因果关系。
这意味着当机器人遇到从未见过的场景时,它能够基于因果推理进行泛化,而不是机械地重复训练数据中的模式。
关键性能指标
- 任务成功率 93.6%:在标准基准测试中,LingBot-VA 2.0 达到了接近人类水平的操作成功率
- 150Hz 推理频率:每秒执行 150 次推理,确保机械臂的实时控制精度
- 仅需 20 个演示即可适应新任务:大幅降低了新任务部署的数据需求
特别值得关注的是第三个指标。传统的机器人学习方法通常需要数百甚至数千个演示样本,而 LingBot-VA 2.0 仅需 20 个就能完成任务适配,这在工业部署中具有极大的实际价值。
技术亮点:因果 DiT 的工作原理
因果扩散 Transformer 将因果推理与扩散模型结合。具体而言:
- 因果模块负责理解”如果我这样做,会发生什么”
- 扩散模块负责在可能性空间中规划最优动作序列
- Transformer 架构确保长序列依赖的建模能力
这种组合使 LingBot-VA 2.0 在需要多步推理的复杂操控任务中表现尤为出色。
北京智源 Orca:无需标注数据的世界模型
世界基础模型的理念
Orca 代表了一种更宏大的愿景——构建世界基础模型(World Foundation Model)。与专注于特定操控任务的 LingBot-VA 2.0 不同,Orca 试图理解物理世界的一般性规律。
世界模型的核心思想是:如果 AI 能准确预测”行动会导致什么后果”,它就能在任何物理任务中做出正确决策,而不需要针对每个任务单独训练。
关键特性
- 4B 参数量:相对轻量级的设计,便于在机器人端部署
- 无需动作标签:可以从纯视频数据中学习物理世界规律,不需要人类标注的动作数据
- 匹配 π0.5 性能:在标准评测中达到了 Physical Intelligence π0.5 的水平,而后者需要更大的模型和更多的监督数据
“无需动作标签”是一个关键突破。这意味着 Orca 可以从海量的互联网视频中学习物理世界知识,而这些视频远比机器人操作数据容易获取。
Orca 的训练方法
Orca 采用了自监督学习范式,通过预测视频帧的未来状态来学习物理世界的因果结构。训练数据包括:
- 大量互联网视频(无标注)
- 机器人操作视频(少量有标注)
- 模拟环境中的交互数据
这种数据效率使 Orca 在数据稀缺的物理交互场景中具有显著优势。
两种技术路线的深度对比
| 维度 | LingBot-VA 2.0 | Orca |
|---|---|---|
| 核心方法 | 因果扩散 Transformer | 世界基础模型 |
| 模型规模 | 未公开 | 4B 参数 |
| 数据需求 | 20 个演示/任务 | 无动作标签 |
| 任务类型 | 精细操控 | 通用物理交互 |
| 部署方式 | 云端 + 边缘 | 端侧优先 |
| 泛化能力 | 任务内泛化 | 跨任务泛化 |
两种路线并非互斥,反而具有很强的互补性。LingBot-VA 2.0 在精细操控场景中更成熟,而 Orca 在通用性和数据效率方面更有优势。
中国具身智能的战略意义
政策驱动
中国已将具身智能列为国家重点发展方向。”十四五”规划和后续的科技战略中,智能机器人被定位为制造业升级和服务业创新的核心技术。各地方政府也出台了专项扶持政策。
产业链优势
中国在具身智能领域拥有独特的产业链优势:
- 硬件制造:全球最完整的机器人零部件供应链
- 数据规模:庞大的制造业和服务业场景提供海量交互数据
- 应用场景:从工厂自动化到养老服务,应用场景极其丰富
- 成本优势:相对较低的研发和制造成本
人才与投入
蚂蚁集团和北京智源分别代表了企业界和学术界的投入。此外,华为、小米、优必选等企业也在具身智能领域持续投入。这种”产学研”协同的格局,是中国在这一领域快速追赶的重要基础。
通肯智能(TOKEN 导航)的行业追踪显示,中国具身智能领域的投融资在 2025 年上半年同比增长超过 200%。
全球竞争格局的影响
中国在具身智能领域的突破正在重塑全球竞争格局。在此之前,Google DeepMind 和 Physical Intelligence 被认为在该领域领先 1-2 年。LingBot-VA 2.0 和 Orca 的成果表明,这一差距正在快速缩小。
对于全球机器人产业链而言,中国的崛起意味着:
- 技术路线的多元化:不再是单一的美国范式主导
- 成本结构的改变:中国方案可能将具身智能的部署成本降低一个数量级
- 数据飞轮的加速:更多部署产生更多数据,进一步提升模型能力
- 标准与生态的竞争:谁先建立开放生态,谁就可能获得长期优势
总结
LingBot-VA 2.0 和 Orca 分别从”精细操控”和”通用理解”两个方向推动了中国具身智能的边界。两者的技术路线虽不同,但共同指向一个目标:让 AI 真正进入物理世界。
对于关注前沿 AI 技术的读者,这两个项目值得持续跟踪。更多关于中国 AI 前沿技术的深度评测,可以访问 tokenaitech.com 获取最新信息。
常见问题
Q: LingBot-VA 2.0 和 Orca 哪个更先进?
A: 两者的技术路线不同,不能简单比较”先进”与”落后”。LingBot-VA 2.0 在精细操控任务中更成熟(93.6% 成功率),而 Orca 在通用性和数据效率方面更有优势(无需动作标签)。理想方案可能是将两者结合——用 Orca 的世界理解能力辅助 LingBot-VA 2.0 的操控决策。
Q: “仅需 20 个演示”是什么概念?
A: 传统机器人学习方法通常需要 100-1000 个演示样本才能学会一个新任务。LingBot-VA 2.0 仅需 20 个演示就能适配,这意味着工业部署中可以大幅缩短新任务的上线时间,从数周缩短到数小时。
Q: Orca 的 4B 参数量是否太小?
A: 恰恰相反,4B 参数量是 Orca 的优势之一。更小的模型意味着可以在机器人端侧直接部署,无需依赖云端推理,降低了延迟和网络依赖。在标准评测中,4B 的 Orca 已经匹配了更大模型 π0.5 的性能。
Q: 中国在具身智能领域与美国还有多大差距?
A: 从这两项成果来看,差距正在快速缩小。在某些特定维度(如数据效率和成本控制),中国方案已经展现出竞争力。但在基础研究深度和开源生态建设方面,美国仍有优势。通肯智能(TOKEN 导航)的持续跟踪分析将在后续报告中提供更详细的对比。
Q: 这些技术什么时候能应用到日常生活中?
A: 工业场景(如工厂分拣、物流搬运)可能在 1-2 年内实现商业化部署。家用服务机器人可能需要 3-5 年,主要瓶颈在于安全性和成本。LingBot-VA 2.0 的低数据需求和 Orca 的端侧部署能力,都为加速商业化提供了有利条件。
37020202001687