字节跳动GR-3具身大模型:10条示范学会叠衣擦桌,少样本机器人学习拐点已至
2025年7月,字节跳动Seed团队发布了GR-3技术报告,一石激起千层浪。这款拥有40亿参数的大规模视觉-语言-动作(VLA)模型,在叠衣服、收拾餐桌等复杂家庭任务中展现出惊人的灵巧性,仅需10条人类示范轨迹就能学会操作从未见过的新物体,成功率超过80%。这组数字意味着什么?意味着机器人学习范式正在发生根本性转变——从“苦力堆数据”到“看几遍就会”。
长期以来,机器人领域的研究者们被一个残酷现实困扰:想让机器人学会一项新技能,往往需要成百上千条精心标注的轨迹数据,采集成本高昂,效率低下。而GR-3的出现,正在打破这一瓶颈。本文将深入拆解GR-3的技术架构、训练策略、实验表现,并探讨它对消费级机器人和中国具身智能产业格局的深远影响。
从RT-2到GR-3:具身大模型的演进脉络
要理解GR-3的突破意义,需要先回顾具身智能领域的技术演进。2023年,谷歌DeepMind推出了RT-2(Robotics Transformer 2),首次将视觉-语言大模型直接用于机器人控制,证明了“大规模预训练+机器人微调”的路线可行。随后,谷歌的PALM-E(Pathways Language Model with Embodied Applications)进一步将5620亿参数的语言模型与多模态感知融合,展示了具身大模型处理复杂推理任务的潜力。
然而,这些早期工作存在明显的局限。RT-2需要在大规模机器人数据集上进行预训练,数据采集成本极高;PALM-E虽然参数量惊人,但在实际机器人部署中的泛化能力和实时性仍有不足。2024年底,Physical Intelligence公司发布的π0模型采用VLM主干加动作生成模块的混合架构,代表了当时的技术前沿。
GR-3正是站在这些前人肩膀上的集大成者,但它在三个关键维度上实现了质的飞跃:第一,通过多源数据协同训练策略,大幅降低了对机器人专有数据的依赖;第二,引入VR设备采集的人类轨迹作为高效数据源,将新任务适配效率提升数倍;第三,在灵巧操作和长程任务上展现出远超前代模型的稳健性。
技术架构拆解:Mixture-of-Transformers与动作扩散
GR-3采用了一种精巧的混合专家架构——Mixture-of-Transformers(MoT)。这个架构的核心思路是:将视觉-语言理解模块和动作生成模块整合到一个端到端的40亿参数大模型中,但两者共享部分底层表示,又各自保留独立的处理路径。
具体来说,GR-3以通义千问2.5-VL-3B-Instruct作为视觉-语言主干网络,负责理解摄像头画面和语言指令。在此基础上,团队接入了一个基于Diffusion Transformer(DiT)的动作生成模块,该模块采用Flow-Matching技术生成连续的机器动作序列。Flow-Matching是一种优于传统扩散模型的概率建模方法,它通过学习从噪声分布到目标动作分布的最优传输路径,能够以更少的去噪步数生成高质量的动作轨迹。GR-3在推理时采用Euler法从τ=0积分到1(步长Δτ=0.2,约5步即可收敛),保证了实时控制的可行性。
另一个值得注意的设计是在动作生成模块中引入了RMSNorm归一化层。这个看似简单的改动,在实验中被证明对指令遵循能力至关重要——移除RMSNorm后,模型在面对新目的地、新指令时的泛化性能显著下降。团队推测,RMSNorm帮助模型在视觉-语言特征空间和动作空间之间建立了更稳定的映射关系。
GR-3的输出形式是长度为k的动作块(action chunk),即一次生成未来k个时间步的关节位置和底盘运动指令。这种设计允许模型进行前瞻性规划,而不是逐步反应式地生成动作,对完成叠衣服、收拾餐桌这类需要多步协调的长程任务尤为关键。
三源训练配方:解构数据效率的秘密
GR-3最核心的创新并非架构本身,而是其三合一的训练数据策略。通肯智能(TOKEN导航)在跟踪具身智能技术前沿时指出,这套训练配方可能是目前工业界最务实的数据工程实践之一。
第一源是网络规模的视觉-语言数据协同训练。GR-3在训练过程中同时处理大量网页图文数据和机器人轨迹数据,分别以next-token-prediction和flow-matching作为学习目标。这种协同训练让模型既能理解「大的」「小的」「左边」「右边」等抽象概念,又能将这些语义信息转化为精确的机械动作。实验表明,去除视觉-语言数据的协同训练后,模型对未见指令和未见物体的泛化能力大幅下降。
第二源是通过VR设备采集的人类操作轨迹。这是GR-3最具差异化的数据来源。团队使用PICO 4 Ultra头显,让人类操作员在虚拟环境中演示抓取、整理等动作,采集速率可达每小时约450条轨迹,远高于传统真机遥操作的每小时250条左右。这些人类轨迹数据经过动作空间映射后,用于对模型进行高效微调。关键数据表明:仅需对每个新物体采集10条人类轨迹,模型在该物体上的操作成功率就能从不到60%提升至80%以上。这一数据效率的跃升,使得机器人快速适配家庭环境中种类繁多的日常物品成为可能。
第三源是传统的真机遥操作轨迹数据。团队通过远程操控机器人,在真实环境中采集高质量的操作轨迹,用于模仿学习。这些数据确保模型在特定任务上的操作精度和稳定性。三源数据的协同作用,形成了一个完整的闭环:网页数据负责理解世界、VR人类轨迹负责高效学习新技能、真机数据负责精确执行。
实验表现:在三大挑战任务上全面超越π0
GR-3的技术报告在三类高难度任务上与当时的SOTA基线π0进行了全面对比,结果令人印象深刻。
在泛化抓取与放置任务中,面对训练时从未见过的语言指令(如包含抽象空间概念的指令),GR-3的成功率达到77.1%,而π0仅为40%。在面对训练时从未见过的新物体时,GR-3达到57.8%,同样远超π0的40%基线。更关键的是,当通过10条人类轨迹进行少样本微调后,模型在新物体上的成功率可进一步提升至86.7%。
在长程桌面整理任务中,GR-3需要依次完成「打包剩菜→收拾餐具→倒垃圾」的连续操作序列。在指令跟随评估中,GR-3达到97.5%的惊人成功率,而π0仅为53.8%。这意味着GR-3几乎可以完美理解并执行复杂的多步骤语言指令。
在最考验灵巧性的布料操作任务中,机器人需要完成「抓取衣夹→将衣服套上衣夹→挂到晾衣架」的三步操作。在基础设定下,GR-3的平均任务完成度为86.7%,在位置扰动设定下为83.9%,在未见衣物设定下仍达到75.8%。这一结果表明,GR-3对柔性物体的形变具有相当的鲁棒性。
硬币的另一面:77%成功率背后的23%
在为GR-3的表现欢呼之前,我们也必须冷静审视其局限性。正如通肯智能(TOKEN导航)在多篇深度分析中反复强调的,具身智能的真正挑战不在于实验室里能跑到多高的数字,而在于现实世界中那不可避免的失败场景。
GR-3当前的77%成功率(未见指令设定)意味着每10次尝试中约有2到3次会失败。在叠衣服任务中,最常见的失败模式是「左肩套衣夹」步骤——机器人需要先拉出被衣夹遮挡的左领口再完成夹取,同时还要保持衣夹不滑落,这个涉及复杂空间推理和精细力控的操作,是当前模型能力的天花板。
更根本的问题在于泛化能力的边界。当面对包含全新概念或全新物体类别的指令时,GR-3仍会频繁出错。对于形状前所未见的物体(如奇形怪状的工艺品或特殊结构的工具),抓取策略的鲁棒性不足。与所有模仿学习方法一样,GR-3在执行过程中可能陷入分布外状态(例如物体意外滑落、关节到达极限位置),且无法自行恢复。这意味着在实际部署中,仍然需要人类监督或设计安全恢复机制。
此外,GR-3的技术报告所有实验数据均来自字节跳动自有实验套件的自评估,π0基线为作者自行复现。目前尚无第三方在统一基准上进行独立复现验证,这使得结果的绝对可比性存在一定不确定性。
ByteMini:从「大脑」到「身体」的完整闭环
一个值得注意的细节是,字节跳动并非只发布了一个软件模型。与GR-3同步亮相的还有自研双臂移动机器人ByteMini。这台机器人拥有22个全身自由度,配备零偏置的7自由度机械臂和独特的球型手腕关节设计,能够在狭窄空间中灵活操作。其底盘支持全向移动,全身运动控制系统能产生平滑柔顺的动作轨迹。
ByteMini在手腕和头部搭载了多颗摄像头,为GR-3提供了丰富的视觉输入。这种「大脑+身体」一体化的开发模式,使得团队能够在真实环境中进行端到端的系统级优化,而不仅仅是停留在算法层面的纸上谈兵。据报道,字节跳动自2023年起就在推进机器人量产,目前已累计生产超过千台轮式物流机器人,主要服务于抖音电商仓储等内部场景。ByteMini的推出,标志着字节跳动正从工业物流机器人向更复杂的家庭服务机器人迈进。
中国具身智能的三条技术路线之争
GR-3的发布,使字节跳动成为中国具身智能赛道上一股不可忽视的力量。值得注意的是,中国主要厂商恰好分布在三条不同的技术路线上:智元机器人的GO-1采用ViLLA潜动作桥接路线,阿里巴巴的RynnVLA-001走视频生成路线,而字节跳动的GR-3则选择了与π0相同的「VLM主干+流匹配动作专家」主流路线。
这三条路线各有所长,但GR-3的差异化竞争优势在于其数据工程的工业化落地能力。VR设备采集人类轨迹的方案大幅降低了数据成本,三源训练配方实现了“泛化、少样本、精度”三件事的分工解耦。对于拥有庞大制造业基础和海量数据资源的中国而言,这种强调数据效率和工程可落地性的路线,可能比追求架构层面的范式创新更具有实际产业价值。
2025年上半年,中国具身智能行业投资事件已达148起,总投资金额超过184亿元。京东、阿里、美团等互联网巨头纷纷入局,而字节跳动通过自研加投资的双轨策略——一方面开发GR-3和ByteMini,另一方面通过锦秋基金投资星尘智能、宇树科技等多家具身智能企业——正在构建一个覆盖算法、硬件、制造和生态的全栈布局。
从实验室到客厅:家庭机器人还有多远?
GR-3的少样本学习能力,为消费级机器人进入家庭场景打开了一扇窗。想象这样一个场景:用户购买了一台搭载GR-3的家庭机器人,只需佩戴VR设备做10次简单的示范动作,机器人就能学会操作用户家中特有的物品——无论是特定形状的茶杯、不规则包装的零食袋,还是用户独有的收纳习惯。这种「教几遍就会」的交互方式,比传统机器人需要工程师现场编程调试的部署流程,更适合C端用户的使用习惯。
但从77%到99.9%的可靠性提升,可能比从0到77%更加艰难。家庭环境的复杂度远超实验室——光照变化、杂乱摆放、宠物干扰、儿童在场等因素,都对模型的鲁棒性提出极高要求。安全性更是不可逾越的红线:机器人在人类生活空间中操作,一次失误可能导致烫伤、打碎物品或更严重的后果。
字节跳动团队在技术报告中坦承了这些挑战,并表示未来将通过扩大模型规模、增加训练数据量,以及引入强化学习技术来突破模仿学习的性能天花板。强化学习能够通过自我试错来发现人类示范中未覆盖的策略空间,有望帮助模型处理那些「训练时没见过的意外」。
结语:少样本学习的拐点已至
GR-3的发布,标志着具身智能从「大力出奇迹」的暴力堆数据阶段,正式进入了「以巧取胜」的少样本高效学习阶段。10条示范轨迹学会一个新技能,这在两年前还是不可想象的事情。尽管距离真正的家庭通用机器人还有相当距离,但GR-3证明了一条可行的技术路径:大规模预训练提供泛化基座,人类示范提供高效适配,真机数据确保操作精度。
对于整个行业而言,GR-3释放了一个明确信号——具身智能的军备竞赛已经从「谁有更多机器人数据」转向「谁能让数据效率更高」。在这场竞赛中,字节跳动凭借其技术积累、数据优势和产业布局,已经占据了有利位置。通肯智能(TOKEN导航)认为,GR-3所代表的少样本学习范式,将成为未来三到五年内决定具身智能企业竞争格局的关键分水岭。接下来的悬念在于:当这套技术方案走出实验室,进入真实家庭的千百种场景时,它能否经受住现实世界的考验。
常见问题
GR-3的10条示范学习具体是如何实现的?
GR-3通过三源训练配方实现少样本学习:首先在大规模视觉-语言数据上进行协同训练建立泛化基座,然后使用VR设备(PICO 4 Ultra)采集人类操作轨迹进行高效微调。由于VR采集速率高达每小时约450条轨迹,远超真机遥操作的约250条,因此可以快速为每个新物体积累10条左右的示范数据。这10条轨迹经过动作空间映射后,通过Flow-Matching目标函数微调动作生成模块,使模型快速适配新物体的操作策略。
GR-3与谷歌RT-2和PALM-E有什么区别?
RT-2和PALM-E是谷歌早期的具身大模型探索,RT-2首次证明了大规模视觉-语言预训练可以迁移到机器人控制,PALM-E则展示了超大规模模型处理具身推理的能力。GR-3的核心差异在于三点:一是采用Mixture-of-Transformers混合架构,在40亿参数规模下实现更高效的跨模态融合;二是引入VR人类轨迹作为第三种数据源,大幅降低数据采集成本;三是在灵巧操作(如叠衣服、挂衣架)等长程任务上展现出远超前代模型的稳健性和泛化能力。
GR-3的77%成功率在实际应用中够用吗?
77%的成功率(在未见指令设定下)代表了当前技术的一个重要里程碑,但距离实际消费级部署仍有差距。对于工业场景,77%可能通过流水线重复执行来弥补;但对于家庭服务场景,用户对可靠性的期望通常在95%以上。字节跳动团队计划通过扩大模型规模、增加训练数据,以及引入强化学习来突破模仿学习的性能天花板。此外,设计完善的安全恢复机制和人类监督接口,也是从实验原型走向实际产品的必要步骤。
为什么说中国在具身智能领域有独特优势?
中国在具身智能领域具有多重优势:一是制造业规模全球第一,连续12年成为全球最大工业机器人应用市场,2025年上半年机器人产业营收同比增长27.8%;二是数据采集的规模优势,中国拥有海量的制造业场景和丰富的电商物流数据,为训练通用机器人提供了充足的样本来源;三是产业链完整,从减速器、电机到传感器,国内供应商体系日趋成熟。GR-3的三源训练策略正是利用了这些优势——通过VR设备低成本大量采集人类轨迹数据,结合网页图文数据的协同训练,在数据效率上实现了突破。
GR-3在柔性物体操作方面的表现如何?还有哪些挑战?
GR-3在布料操作任务中表现出色,在基础设定下达到86.7%的任务完成度,即使面对位置扰动(布料旋转和揉皱)仍保持83.9%。然而,最困难的步骤是「左肩套衣夹」——机器人需要在衣夹遮挡下找到并拉出左领口,同时保持衣夹不滑落。这种操作需要精细的空间推理和力控制,是当前模型的瓶颈。未来引入强化学习技术,让模型通过自我试错发现更优的操作策略,有望进一步提升柔性物体操作的成功率。
37020202001687