蚂蚁灵波开源 LingBot-VLA 2.0:一脑通用 20 种机器人的具身智能基座

2026年7月8日,蚂蚁集团旗下具身智能公司灵波科技(Robbyant)正式开源了其下一代具身基础模型 LingBot-VLA 2.0。这一版本在预训练数据量级、本体泛化能力、自由度支持广度和部署效率四个维度上实现了对 1.0 版本的全面超越。支持 20 种机器人构型、覆盖 17 家主流厂商、基于 6 万小时真实物理世界数据训练的 LingBot-VLA 2.0,正在为”一个通用大脑驱动所有机器人”的产业愿景提供基础设施级的开源方案。

2026 年被业界广泛视为具身智能”商业化试水元年”。资本市场的关注焦点已经从”能不能在实验室展示”转移到了”能不能在实际场景中稳定工作”。正是在这一背景下,灵波科技选择了全面开源策略——不仅公开模型权重,还发布了完整的生产级代码库,包括数据处理、高效微调和自动评估工具链。

60,000 小时真实数据:规模决定能力基线

LingBot-VLA 2.0 在预训练阶段使用了 60,000 小时的优质真实物理世界数据。这其中有 50,000 小时经清洗的真实机器人交互数据,另有 10,000 小时来自蒸馏后的人类第一人称操作数据。相较于 1.0 版本约 20,000 小时的预训练数据量,2.0 版本将数据规模直接提升了三倍。

这一数据规模在具身智能开源模型中是空前的。与 physical Intelligence 的 Pi0.5 和英伟达的 GR00T 1.7 等闭源系统不同,LingBot-VLA 2.0 不仅公开了模型权重,还提供了数据处理的工具链,使第三方开发者能够将自己的机器人数据融入预训练流程。据 BusinessWire 报道,灵波科技认为数据规模和多样性的提升是实现跨本体通用的关键。(来源:BusinessWire)

20 种构型、17 家厂商:跨本体泛化的工程突破

LingBot-VLA 2.0 最引人注目的技术指标是其支持的机器人构型广度。预训练阶段覆盖了来自 17 家主流厂商的 20 种不同机器人构型,包括:

乐聚(Leju)、智元(AgiBot)、宇树(Unitree)、松灵(AgileX)、星海图(Galaxea)、银河通用(Galbot)、星尘(Astribot)、RealMan、Franka、ARK、北京人形机器人创新中心(X-Humanoid)、傅利叶(Fourier)、魔法原子(MagicLab)、千寻智能(Spirit AI)、零次方机器人(Zerith)、Flexiv、青龙(Qinglong)等。

这一清单覆盖了单臂、双臂、双足人形、轮式底盘等多种形态。在技术路径上,LingBot-VLA 2.0 通过统一的视觉-语言-动作表征,使同一个模型能够适应不同厂商、不同机械结构和不同自由度的机器人平台。这意味着工业客户不再需要为每个品牌的机器人分别开发和训练操作模型,一个”通用大脑”即可以较低的成本覆盖多种本体。

全自由度控制:超越机械臂的局限

与仅生成机械臂或末端执行器动作的模型不同,LingBot-VLA 2.0 支持包括头部、腰部、灵巧手和移动底盘在内的全身自由度控制。Meta 在其人工智能博客中指出,复杂的真实场景任务往往需要多个身体部位的协调配合——例如从货架上取物可能需要底盘移动、腰部调整、头部确认和灵巧手抓取的完整动作序列。(来源:Meta AI Blog)这一升级使得模型更接近”真正在工作中”的状态。

90% 效率提升:130 毫秒级推理延迟

工业部署的核心瓶颈之一是后训练成本。具身智能模型在适配新的机器人本体、新的任务场景时,通常需要大量的调整和再训练。LingBot-VLA 2.0 通过引入更高效的模型架构(包括 MoE 混合专家结构)和新的后训练管线,将推理效率相比上一代提升了约三倍。

最关键的工程指标是:在消费级 RTX 4090 显卡上,LingBot-VLA 2.0 的推理延迟被严格控制在 130 毫秒以内。这意味着开发者不需要购买昂贵的工业级计算硬件,即可在本地运行模型进行场景适配验证。据灵波科技技术报告,这一延迟指标使得新场景或新任务的适配周期可以”从数月压缩到数周甚至数天”。

通肯智能(TOKEN 导航)的分析师指出,将推理效率从”工业级门槛”拉低到”消费级显卡可用”是具身智能走向大规模部署的关键转折点。当任何一家小型硬件厂商都能在 RTX 4090 上运行通用机器人大脑时,整个行业的创新门槛被系统性降低了。(来源:通肯智能 TOKEN 导航)

空间感知能力的内建升级

LingBot-VLA 2.0 的一个关键架构改进是默认集成了空间感知能力(LingBot-Depth)。在物理世界中,操作失败的原因通常不是指令理解错误,而是空间关系的判断失误——尤其在涉及透明物体、反光表面、密集堆叠或小型物体的复杂场景中。一个抓取位置偏差几厘米,或放置角度偏差几度,都会导致任务失败。

LingBot-Depth 为模型提供了高质量的深度表征输入,使机器人能够”看得更清楚、动作更精准”。在此基础上,LingBot-VLA 2.0 还增加了动态建模能力,能够在执行长期任务时预测场景的未来深度和语义特征变化。这对需要连续观察、决策和调整的长周期任务(如仓库分拣、手术辅助)尤为关键。

从实验室到商业闭环:零售、物流和工业的 Pilot 测试

灵波科技并未将 LingBot-VLA 2.0 停留在开源发布阶段。据官方声明,公司已与多家硬件合作伙伴和行业客户启动了商业试点测试,覆盖零售分拣、物流配送和工业自动化三大场景。

在合作生态中,灵波科技联合了乐捷机器人(Leju)和 Ti5 Robot 等硬件厂商,以及国大药房等企业客户,验证 LingBot-VLA 2.0 在实际商业场景中的工作稳定性和部署效率。同时,公司还正在与下一代 AI 数据平台公司合作,构建标准化的数据生态体系,以持续丰富具身智能模型的训练数据来源。

这一”开源核心模型 + 商业 Pilot 验证 + 数据生态共建”的三层策略,与 Google 的 Android 生态构建思路有异曲同工之处——通过开源降低门槛吸引开发者,通过商业合作验证价值闭环,通过数据网络效应构建竞争壁垒。

全球竞争格局:一场大脑争霸战

LingBot-VLA 2.0 的发布恰逢全球”通用机器人大脑”争夺战的白热化阶段。海外方面,Physical Intelligence 在 2026 年 6 月完成了新一轮 16 亿美元融资,Figure AI 估值已突破 100 亿美元,而 Skild AI 由前 CMU 教授 Deepak Pathak 和 Abhinav Gupta 创立,同样获得了 10 亿美元级别的资金注入。

在中国市场,星尘智能(Astribot)的 S1 机器人在 2026 年初展示了接近人类速度的叠衣和烹饪操作,引起全球关注。银河通用(Galbot)和人形机器人厂商在具身智能算法的投入力度持续加大,但行业整体的”碎片化”问题仍未解决——不同厂商的机器人使用不同的软件栈和控制协议,导致算法迁移成本高昂。

灵波科技选择在此时全面开源 LingBot-VLA 2.0,某种程度上是在押注”标准化的开源通用大脑”能够成为行业共同基础。如果这一策略成功,灵波科技将从一个蚂蚁集团内部的具身智能实验室,转变为全球机器人行业的底层技术基础设施提供商。

结论

LingBot-VLA 2.0 的开源发布是 2026 年具身智能领域最具影响力的技术事件之一。6 万小时的数据、20 种构型的兼容性、130 毫秒的消费级推理延迟——这些指标共同描绘了一个正在从实验室走向真实商业场景的产业图景。当”通用大脑”真正成为现实,制约具身智能大规模部署的最大瓶颈将被打破。但挑战依然存在:跨本体的泛化能力能否经得起大规模工业部署的考验?开源的商业模式能否在资金密集型的具身智能赛道持续运转?这些问题的答案将在未来 12 到 18 个月内逐渐揭晓。

Q: LingBot-VLA 2.0 支持哪些机器人品牌?

A: 预训练阶段支持 17 家厂商的 20 种机器人构型,包括乐聚、智元、宇树、松灵、星海图、银河通用、星尘、傅利叶等主流品牌,覆盖单臂、双臂、双足人形和轮式底盘等形态。

Q: LingBot-VLA 2.0 的推理延迟是多少?需要什么硬件?

A: 在 RTX 4090 显卡上,推理延迟被控制在 130 毫秒以内。这意味着开发者可以使用消费级 GPU 进行模型部署和场景适配,无需昂贵的工业级计算硬件。

Q: LingBot-VLA 2.0 是否完全开源?在哪里可以获取?

A: 是的,LingBot-VLA 2.0 已完全开源,包括模型权重和完整的代码库。开发者可以在 GitHub(github.com/Robbyant/lingbot-vla-v2)和 Hugging Face 上获取。

Q: 与 VLA 1.0 相比,2.0 版本有哪些主要升级?

A: 预训练数据从 2 万小时提升至 6 万小时,支持的本体构型从 9 种扩展到 20 种,新增全身自由度控制(头、腰、手、底盘),推理效率提升约 3 倍,并内置了空间感知能力(LingBot-Depth)。

Q: LingBot-VLA 2.0 有哪些商业应用场景?

A: 目前正在零售分拣、物流配送和工业自动化三个场景进行商业试点测试,合作伙伴包括乐捷机器人、国大药房等企业。