19号WRC第一天,就去各种探展。

当天下午,银河通用举办了一场叫“具身智能大模型的进化之路”的论坛。

现场来的嘉宾很重磅,有银河通用创始人王鹤、王晓刚(大晓机器人)、王仲远(北京智源人工智能研究院院长)、朱军老师(生数科技)、卢宗青老师(智在无界)、弋力老师(清华叉院)等。

看他们的背景就知道,具身基座模型方向的大佬都来了。

这也是这个论坛吸引我的点,因为具身的下半场竞争主线一定是大脑。

原文链接:WRC上听了三小时!越发感觉具身的ChatGPT时刻正在逼近。

图片

上次waic26,姚卯青和徐丹飞他们给的共识是具身智能大模型的ChatGPT时刻正在逼近。

忙完waic之后,好久没来参加论坛了,这次完整地听了3个小时。

本次论坛形成的共识和waic类似,并强调了以物理世界数据飞轮和世界动作模型为代表的技术手段正在开辟出全新的增长曲线。

期间,还发布了一个《具身智能大模型白皮书》和《具身智能产业指数》。

01 共识被一台机器人具象化了

共识,大家都可能很熟悉。

但论坛现场,银河最新的双足人形机器人 Galbot ET-1把它具象化了。
在这里插入图片描述

它给人的第一印象是动作很顺:听到语言指令后,ET-1会根据环境变化生成身体动作,交流时伴随眼神、头部和躯干的细微反馈,少了机器人常见的机械停顿。

这种丝滑背后,对应的是本次同期发布的AstraBrain-Agent。

后面是王鹤老师对银河通用技术路线的完整介绍了。

他先谈到一个判断:当人形机器人在复杂任务中表现出接近人类的能力时,具身智能可能迎来自己的AlphaGo时刻。

而这个事情上,银河选择的测试不是围棋,而是网球(也就是上面视频开头部分)。

图片

相比规则明确、状态相对稳定的围棋,网球发生在不断变化的物理世界。

机器人要实时判断球的速度、旋转和落点,同时调整身体姿态、规划击球动作,并维持全身平衡。

这也是网球比较有意思的地方。它考验的已经不只是某个动作能不能做出来,而是视觉感知、环境预测、决策规划和全身控制能否在极短时间内形成闭环。

王鹤表示,AstraBrain-Agent也是全球首个具备学习能力的智能体(边看、边学,边做)。

图片

视频开头的打网球就是ET-1正在学习的任务之一。

AstraBrain-Agent在工作时需要同时调用大脑和小脑:大脑判断球从哪里来、应该打向哪里,小脑则将决策转化为实时、连续的全身动作。

击球过程中任何一处延迟,都会直接反映在结果上。

现场还有一个信息,8月22号7点半,银河将会是机器人运动会开幕式首个表演(网球人机大战)。

02 当前机器人的能力到哪里了?

现场,王鹤老师把银河的完整技术路线分享了出来。

1)AstraBrain-WAM 0.5:负责理解环境、预测变化并规划动作;

2)AstraBrain-WBC 0.5负责全身实时运动控制;

3)AstraBrain-Dex面向灵巧操作;

4)AstraData承担数据采集和处理;

5)新发布的AstraBrain-Agent则试图让机器人在真实交互中边观察、边学习、边执行。

想要判断能力的丝滑度,除了高动态的打网球任务,银河还展示了转笔和盘核桃。

图片

目前转笔已经可以做到将笔抛向空中、接住后继续转动,这个是很细致的灵巧任务,很多成年人都没法很好完成。

盘核桃则依赖多指协调、连续接触和细粒度力控,用力大了核桃会碎,用力小或者不对,核桃可能掉了。

这些能力的背后是AstraBrain-Dex(灵巧手世界模型),通过强化学习和Sim2Real具体完成部署的。

王鹤也表示,这类任务只能通过强化学习和sim2real,之前figure拧瓶盖是遥操,但很多动作遥操做不了,天花板高度可能就被限制了。

03 什么样的模型会是大脑的终局?

这是论坛最值得讨论的问题之一。

VLA是目前具身智能的主流路线。它把视觉、语言和动作放进统一模型,让机器人可以根据图像与语言指令直接输出动作。

但王鹤认为,VLA仍然受到动作数据的限制。模型输出的是Action,训练数据也需要包含与机器人本体对应的动作标签。任务和本体一旦变化,数据很难直接复用。

世界模型解决的是另一个问题。它让模型通过观察环境变化,预测接下来可能发生什么。但只会预测未来,并不意味着模型知道应该采取什么动作来完成任务。

所以银河选择了WAM,也就是世界动作模型。WAM把理解、预测和行动放进同一套模型:既学习物理世界如何变化,也学习为了完成任务应该采取什么动作。

而之前,Jim Fan给红杉讲的机器人大脑的终局,也是WAM。

这一点,王鹤表示:“银河是全球第一个提出WAM概念的,arxiv上可以看到首篇论文,我还是通讯作者。现在我们用AstraBrain-WAM 0.5验证跨任务、跨场景和跨本体能力”。

图片

朱军则从通用世界模型的角度,给出了另一套表达:

通用世界模型=理解×预测×行动。

他认为,技能的形成可以理解为持续预测、行动和修正的过程,并将通用世界模型的演进分成生成、交互、行动、自主和组织五个阶段。

虽然两种表述使用的概念不同,方向却很近。

04 数据飞轮对模型能力

增长的贡献是怎么样的?

架构决定模型怎样学习,数据决定模型能够学到多少。

生数科技的朱军老师在现场展示了一座数据金字塔。

图片

越接近真实任务的数据,往往价值越高,但规模化能力越弱;越容易大规模生成的数据,又可能与真机部署存在更大距离。

所以,数据飞轮的价值不能只用“采了多少小时”衡量。

真正重要的是,仿真、真机和人类视频能否被组织进同一条训练链路,并推动机器人完成更多真实任务。

银河通用,在这个问题上,给出的答案则是“虚实融合”。

在数据端,AstraData(银河自己的基础设施)负责承接仿真数据、真实机器人数据和Ego数据。

模型端,WAM-TTT尝试从无标注人类视频中学习任务经验,再通过后训练完成具体场景适配。

王鹤说,通过真机强化,银河在全球率先攻克了10分钟超长程做早餐任务的公司。

AstraBrain-WAM 0.5和AstraBrain-WBC 0.5,也分别在大脑与全身运控方向验证了Scaling Law。相比于dyna-2,王鹤说他们在今年2月份就验证了数据与模型的scaling law。

之外,现场银河还展示了最新的第一视角数据采集方案Astra Set。

05 具身大模型的GPT时刻什么时候会来到?

这个问题,上次waic上我们分享过徐丹飞他们给的预测。

但这次,王鹤现场给出了一个相对具体的判断标准:

在不依赖额外工程开发的情况下,机器人能够对人类级任务实现零样本泛化,并达到70%至80%的成功率;剩余部分再通过客户侧的轻量适配继续提升。

这个标准里,关键不只是成功率。

ChatGPT带来的变化,是普通用户面对一个新问题时,不需要重新采集数据、训练模型和开发系统。放到机器人上,也应该意味着:换一个任务、物体或环境,机器人仍然能够调用已有经验解决问题。

漂亮Demo是起点,真实场景中的持续运行才是答案。真正的ChatGPT时刻,需要同时满足泛化能力、任务成功率、部署成本和长期稳定性。

至于未来具身可能的市场规模,王鹤给了一个描述:手机数量 x 汽车价格 x 大模型模式计费倍率。

06 其他嘉宾在工程和产业上的分享

海外的嘉宾Wolfram Brugard(概率机器人的奠基者)等分享的技术路线和国内还存在一定的差异,他们更关注工业。

图片

王田苗教授(北航机器人研究所名誉所长),带来的主题分享也比较有意思:“具身智能下半场,如何穿越分化周期”。

他指出,具身发展刚开始,最大瓶颈不仅仅是AI,而是核心零部件跟不上大脑与数据的迭代进化。现在行业很多公司都进入了POC阶段,但具身大模型解决不了所有case,只能处理容错率高一点的场景。

图片

07 没有battle,圆桌上的一问一答

在多位嘉宾分享过之后,最后一个环节是圆桌。

张直政博士是主持人,其他几个嘉宾也都是熟人了,可以看下图的介绍。

图片

圆桌没有出现预想中的路线battle,主要收敛到三个问题上:世界模型应该学习什么、预测怎样帮助机器人行动,以及模型从实验室走向真实场景,还缺哪些关键环节。

1)世界模型究竟应该学习什么样的表征,又怎样从数据中获得因果能力?

卢宗青老师认为,当前大模型对视觉世界的理解仍然不够扎实。视觉表征做不好,模型的通用性也很难建立;至于因果关系,现阶段仍需要依靠更大规模的数据逐渐逼近。王仲远也提到,世界模型要预测物理世界,前提是从海量数据中学习稳定的环境表征。

但数据并非简单地越多越好。

王晓刚老师的观点是:世界模型仅有生成能力,还不足以在物理世界中行动。电影、生成视频以及部分互联网内容,并不严格遵循真实世界的物理规律。机器人需要学习真实生活中的视频,还需要引入相机位姿等信息,才能进一步理解空间与运动之间的关系。

弋力老师则把交互和多模态放到了更重要的位置。

机器人面对的世界不仅有图像,还有动作、触觉和状态变化。如果目标是让机器人真正参与物理交互,模型表征就需要包含这些信息,并在不同模态之间协同学习。换句话说,世界模型需要学习的不是“画面长什么样”,而是物体怎样变化、动作会造成什么结果。

2)预测为什么能够帮助策略学习?

王晓刚老师认为,VLA比较擅长处理目标和环境相对稳定的操作任务。一旦周围环境持续变化,或者任务中存在博弈,模型就很难及时调整。世界模型的价值,在于能够提前展开多个可能的未来:机器人可以先“想象”不同动作可能造成的结果,再对候选策略进行评价和选择。

弋力则进一步给出了三种可能路径:

1)图像生成等优势模态可以带动动作预测;

2)模型也可以在执行动作前先对未来状态进行预判;

3)从长期来看,世界模型还能帮助机器人在环境变化中不断修正行为。

卢宗青老师后面补充,触觉也可以成为重要的监督信号。通过联合建模动作与状态,机器人能够更准确地理解一次接触之后会发生什么。

3)从实验室到真实场景,我们需要面对什么挑战?研究方向需要对准什么切入点?

现场嘉宾提到,B端和C端面对的是两套不同的评价逻辑。

工业场景会把效率、精度和成功率算到小数点后几位,有时甚至需要在智能化方案和传统工程方案之间做取舍;C端环境更加开放,机器人能否持续学习和进化会更重要。

弋力老师认为,持续学习不只是“继续收集数据”。机器人应该从什么数据中学习、在什么时候学习、用什么方式学习,都需要被重新设计。机器人执行失败后,系统还要判断问题来自感知、规划、控制还是环境变化,并区分任务中不变的规律和不断变化的因素。

王仲远老师的判断是,具身智能也会经历从专用小模型走向通用大模型的过程。当前专用模型已经能把部分技能做得很好,真正缺少的是跨任务和跨场景的泛化能力。

卢宗青老师则给出了一个很工程的观察:行业对数据的重要性已经形成了基本共识,但对训练范式还没有统一答案。不过,这并不意味着产业落地必须等待“终局模型”出现。眼下更直接的障碍,是行业还缺少一套足够成熟的工具链,把模型稳定地部署到不同机器人和真实场景中。

这可能也是圆桌最终留下的共识:表征、预测能力、持续学习和部署工具链,已经成为任何一条技术路线都绕不开的问题。

08 写在最后

三个小时听下来,一个变化已经很明显。

具身智能正在进入大脑竞争更为集中的阶段。

行业不再满足于让机器人完成一个预先训练好的任务,而是开始追问:同一个模型能否控制不同机器人,已有经验能否迁移到新场景,部署产生的数据能否继续推动模型增长。

具身智能的ChatGPT时刻,大概率不会由某一段突然走红的视频宣布。

它更可能出现在这样一个节点:机器人进入新场景后,不需要重新启动一套完整的工程项目;模型能够利用已有经验理解任务,通过少量适配完成部署,再把执行结果送回数据飞轮。

重磅!

全网首个!具身智能开源知识库来啦(技术/产业/投融资/上下游)

推荐阅读

真机强化入门的一套完整教程!pi*0.6复现方案

我们用低成本的机械臂完成pi0/pi0.5/GR00T/世界模型等VLA任务~

具身智能的WAM与世界模型一份完整指南~

一览具身智能的行业全局,从产品经理的角度出发!

VLA+RL方向首个系统教程来啦!Online RL/Offline RL/test time RL等~

好用,高性价比!面向具身科研领域打造的轻量级机械臂

VLA/VLA+触觉/VLA+RL/具身世界模型等!具身大脑+小脑算法与实战全栈路线来啦~

从零训练你的足式机器人!让你的足式机器人真正动起来~

1v1 科研论文辅导来啦!

重磅!具身智能之心论文辅导来啦(近20+方向,顶会/顶刊/SCI/EI/中文核心/申博等)

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐