从真实交互数据稀缺、跨本体表征不足到部署可靠性难题,具身智能行业正从“能演示”转向“能干活”的关键验证期。
7月19日,2026世界人工智能大会(WAIC)核心分论坛“智启具身论坛2026——迎接物理AI智能涌现”在上海世博中心举行。论坛由智元、觅蜂科技联合主办,汇集清华大学、佐治亚理工学院、Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics及腾讯Robotics X等机构代表,讨论焦点集中于物理AI的数据来源、模型路线、仿真训练与商业化部署。
(图片来源:觅蜂科技)
智元合伙人、高级副总裁、具身业务部总裁,觅蜂科技董事长兼CEO姚卯青在论坛上提出,物理AI要从“模型演示”跨向规模化作业,必须突破数据、表征和闭环三堵“物理墙”。他预计,若将机器人“ChatGPT时刻”定义为机器人能够“开箱即用”、理解开放式自然语言指令并完成日常任务,行业或需积累“1亿小时级别”的具身数据。对于机器人“ChatGPT时刻”的时间表,多位嘉宾给出2年至5年的判断。
从“能演示”到“能干活”:物理AI仍有三堵“墙”
在主旨演讲中,姚卯青将智能概括为两条主线:一是对世界的抽象与压缩,即“表征”;二是智能体在环境中完成“感知、理解、决策、行动、反馈”的持续“闭环”。
(图片来源:觅蜂科技)
他表示,语言、代码和数学等数字AI能力,可以依托互联网数据持续扩展;但物理AI必须进入真实世界,在与环境、物体和人持续交互的过程中积累经验、修正策略。
“数字AI可以被互联网数据喂养出来,但物理AI必须在真实世界里摸爬滚打。”姚卯青说。
他将行业当前的瓶颈归纳为三堵“物理墙”:
数据墙:真实交互数据稀缺、采集成本高,难以像网页文本一样实现低成本、规模化获取;
表征墙:跨任务、跨环境、跨机器人的统一物理表征尚未形成;
闭环墙:真实世界试错成本高、反馈速度慢,一次失败可能造成零部件甚至整机损失。
姚卯青表示,当前具身数据无论按Token还是时长计算,与头部大语言模型的训练数据相比都可能相差1万倍以上。他预计,若将机器人“ChatGPT时刻”定义为机器人能够理解开放式指令、在物理世界中“开箱即用”并完成常见任务,行业或需要达到1亿小时级别的数据积累,推动常见任务的基础成功率达到70%至80%。
“模型决定起点,数据定义终局。当数据飞轮真正转动起来,智能涌现只是时间问题。”姚卯青说。
真机、第一视角与仿真协同,行业寻找“数据配方”
如何获得足够规模且足够高质量的具身数据,成为当天讨论最集中的议题。
Physical Intelligence研究科学家任至意认为,具身学习不能仅仅追求数据量扩张,模型还应理解任务、环境、策略和数据质量等上下文信息。他介绍,PI在训练π0.7模型时,引入了历史视频编码、细粒度语言与图像引导,以及数据质量评分、错误标签等元数据,以增强模型对不同任务条件的判断能力。
(图片来源:觅蜂科技)
任至意表示,通过扩展Context,模型能够在不针对单一任务微调的情况下,使用同一个模型检查点处理多类任务;在跨本体迁移方面,也可以将低成本机械臂学到的部分技能迁移至UR5等工业机械臂,减少针对特定本体重复采集数据的需求。
对于VLA(视觉—语言—动作模型)与世界模型的争论,任至意认为两者并不冲突。“模型既要理解Context,也要具备对未来状态的预测能力。”他说,未来两类能力将呈现逐步收敛的趋势。
佐治亚理工学院助理教授徐丹飞则提出,人类第一视角数据可能成为具身智能扩展训练数据的重要来源。传统遥操作数据采集难以大规模复制,也可能遗漏揉面、捏取薄片、用手肘开门等精细操作中的关键信息。
“人类其实就是机器人的一种形态。”徐丹飞表示,其团队自2023年起探索第一视角人类行为数据训练,目前已积累约2万小时数据。随着数据规模增长,团队在部分复杂操作任务中观察到了具身学习的Scaling规律。
不过,他也强调,人类数据不能直接替代真机数据。由于人和机器人在视角、关节自由度、动作空间及接触动力学上存在差异,模型仍需要结合多样化真机数据,解决从人类经验到不同机器人本体的迁移问题。
Genesis AI联合创始人王尊玄认为,具身智能本质上是系统工程,不能只押注于单一模型架构。数据采集、硬件设计、中间件、控制栈、仿真、模型训练、评测及部署回流,都应被纳入统一的端到端体系。
(图片来源:觅蜂科技)
他表示,团队将人类手套数据、第一视角数据、真机数据与仿真数据结合使用:第一视角数据具备规模和多样性优势,真机数据更接近实际部署动力学,带有触觉信息的手套数据则可补充真实物理接触信息。
可靠性成为商业化分水岭:从“会做”走向“稳定做”
相较于模型能否完成更多Demo,商业化场景更关注机器人能否在高频、长时、重复作业中保持稳定。多位嘉宾认为,成功率、鲁棒性和失败恢复能力正成为具身智能商业价值的核心衡量标准。
Dyna Robotics联合创始人兼首席科学家马也骋表示,当前不少通用模型能够覆盖多个任务,但单一任务成功率仍然有限。“如果成功率不高,其实没有很大的商业价值。”
他介绍,Dyna Robotics目前已积累超过20万小时预训练数据,并采用“数据金字塔”策略:底层为互联网及人类第一视角数据,中层为多任务真机数据,顶层则是最具价值的真实部署数据,尤其关注机器人在任务中出错、恢复并最终完成任务的过程。
马也骋认为,真实部署中产生的失败和恢复数据,是提高可靠性的关键。通过奖励模型识别异常状态、再定向采集恢复数据,机器人可以逐步提升从错误轨迹回到正确轨迹的能力。
他举例称,团队曾在餐巾折叠任务中实现机器人连续24小时无人干预作业,完成超过800个餐巾折叠;在切芹菜、高精度叠杯、薄创可贴分拣等任务中,使用一至两个小时的后训练数据,即可让机器人完成重复性操作。
智元也在论坛上披露了其在3C产线的部署案例。姚卯青表示,在江西南昌龙旗合作工厂的一条3C产线上,智元机器人完成连续6天、每日超过10小时的全工段直播作业,累计完成近6.5万件操作,整体成功率达到99.99%。
需要指出的是,上述指标均为企业披露的特定场景测试和部署数据,能够反映机器人在高频、标准化工业流程中的稳定性进展,但尚不能直接等同于机器人在开放环境中的通用能力。
VLA还是世界模型?行业尚未收敛至单一路线
围绕VLA、世界模型、世界动作模型(WAM)以及分层Agent架构的技术路线,论坛未形成单一结论,但“融合发展”成为多数嘉宾的共识。
马也骋表示,在强调低数据量、高成功率与鲁棒性的特定场景中,WAM相较VLA可能具备更高效率;但复杂长程任务仍不能仅依赖单一模型,还需要低频推理模型与高频控制模型协同工作。
腾讯首席科学家、腾讯Robotics X实验室主任张正友则认为,具身智能仍处在早期阶段,尚未出现类似Transformer之于大语言模型的统一技术框架。
“怎么可能只有3B、4B的单一小模型就能解决所有问题?”张正友表示,具身智能体至少需要认知、感知—行动和肢体反应等多层闭环协同。
硬件路线同样存在不同选择。Sunday Robotics联合创始人兼CEO赵子豪表示,机器人本体设计本质上是成本与能力之间的平衡,其团队选择三指夹爪,是为了以相对较低成本满足大部分实际应用需求。
姚卯青则认为,面向一线用户,可靠性、成本、成功率和一致性都是无法绕开的现实约束,全栈研发有助于企业在硬件、芯片、模型、控制和部署之间实现系统级优化。
机器人“ChatGPT时刻”何时到来?行业给出2年至5年预判
在论坛压轴圆桌环节,多位嘉宾就机器人“ChatGPT时刻”的到来时间给出判断,整体预期集中在未来2年至5年:
姚卯青:2年,主要取决于数据层面的进展
任至意:4至5年("加入PI之前我觉得得10年")
徐丹飞:5年
马也骋:4年
张正友:3至5年,"要踏踏实实地去做,这期间非常有希望"
赵子豪:3年以内
圆桌对话现场(左起:任广辉、姚卯青、任至意) 来源:觅蜂科技
张正友强调,时间预测不应寄望于单一模型或单一数据源的突然突破,而取决于数据采集、真实部署、失败恢复、仿真评测和硬件系统的持续推进。
“这3到5年还是有希望的,但要踏踏实实地做。”他说。
《智启具身论坛2026——迎接物理AI智能涌现》全文实录如下:
事件:《智启具身论坛2026——迎接物理AI智能涌现》
时间:2026年7月19日
地点:上海世博中心
主办方:智元、觅蜂科技
【主持人】
尊敬的各位领导,各位行业同仁,献上直播间的观众朋友们,大家上午好。欢迎来到2026世界人工智能大会WAIC,由智元、觅蜂科技联合举办的智启具身2026,迎接物理AI智能涌现的现场。我是本场论坛的主持人吕新印。当下大语言模型已经完成信息端智能的跨越式发展,而能够触摸感知改造真实世界的物理AI正在成为人工智能产业下一阶段最核心新的赛道。今天我们奇迹于此,将围绕数据飞轮、机构模型、机器人学习、规模化落地、行业核心瓶颈等议题,邀请全球顶尖学术研究者与产业领军者同台分享,共同探寻物理AI突破增长边界,实现通用智能涌现的可行路径。接下来就让我们正式开启今天的论坛。首先有请上海市浦东新区副区长李慧致辞,掌声有请。【李慧|上海市浦东新区副区长】
尊敬的茂清院长,各位嘉宾,大家早上好。这是一个生机盎然的盛夏,时而艳阳高照,时而暴雨倾盆。但这就像人工智能的现状,我们要有热行动,也要有冷思考。今天非常高兴在这样的一个现场里和大家共同聆听我们对具身智能物理世界的思考。【李慧|上海市浦东新区副区长】
首先要代表浦东新区人民政府,向远道而来出席本次论坛的海内外嘉宾表示诚挚欢迎。当前人工智能正加速从数字世界走向物理世界,物理AI智能涌现,正在深刻重塑千行百业。今年具身智能正式纳入十五五未来产业重点战略布局,人形机器人产业迈入了规模化放量的关键阶段。本次论坛以迎接物理AI智能涌现为主题,汇聚全球顶尖的产业领袖和学术精英,可以说恰逢其时,意义深远。【李慧|上海市浦东新区副区长】
浦东是全国人工智能产业发展的核心承载地,也是具身智能产业的创新主战场。我们始终把具身智能作为抢占全球科技竞争先机、推动制造业转型升级的战略核心赛道,举全区之力,搭平台、出政策、拓场景、聚生态,走出一条政策引领、平台支撑、场景驱动的产业发展路径。在今天的浦东具身智能赛道上,我们已经集聚了以智元为核心的130多家产业链上下游企业。同时,为持续做强赛道优势,浦东构建起全链条、高含金量的专项扶持政策,全方位为企业创新发展保驾护航。在核心技术攻关层面,我们加大研发政策支持,同时,为了吸引全球人才到普通发展,我们实施了清创人才政策15条,其中2个100万政策就为了解决青年人才安居和乐业的问题,提供100万平方米低租金青年公益,平均月租金不超过2000块。提供100万平方米低租金创业空间,租金不高于一块钱每平方。每天对优秀创业项目给予每年100万、良序三年的运营支持,做到扶上马送3乘,加速企业发展壮大。【李慧|上海市浦东新区副区长】
简单讲讲浦东,接下来就要讲讲今天大会的主办方智元和觅蜂科技。智元是浦东土生土长的本土企业,2023年成立至今,短短三年多的时间,智元一直以惊人的加速度在进化、在奔跑。我们看到,成立之初,当年智元就产出了6台圆形样机,到了2024年搭建了量产体系,2025年完成了500 5000台的量产,突破2026年初跨越万台门槛。到刚刚过去的六月底,致援第15000台通用聚身机器人已正式下线,不断的刷新着全球人形机器人量产的新记录。公司的营收从2023年的30万元已经跃升到2025年末的10亿元,成为中国从创立到营收突破10亿元大关速度最快的人工智能和机器人公司。三年,我们亲身见证了智元完成从实验室到万台级量产的跨越,这不仅是企业自身的奇迹,更是普通创新生态生生不息的生动写照。智元的快速生长,更带动了产业链的协同发展。其中今年初从智元孵化出来的觅蜂科技,就是普通创新生态中涌现出的一个鲜活案例。【李慧|上海市浦东新区副区长】
作为一站式物理AI数据服务平台,觅蜂科技成立仅四个月就完成了数亿元天使加轮的战略融资,获得了红杉中国、百度旗下基金、国防创投等顶级资本和国资的青睐。并且,觅蜂高举数据大旗,联合工信部赛迪研究院、国家数据标委会等共同发起蜂巢数据共创的行动,加快推动行业统一标准落地。可以说,一家智元破土而出,更多的小智源、新智源正在浦东这片创新沃土上拔节生长。这正是普通产业生态生生不息的缩影。我独行快,众行远。今天的会论坛汇聚了全球顶尖智慧,这正是我们渴望看到的开放合作景象。浦东将继续依托世界人工智能大会平台,持续搭建高水平交流桥梁。我们欢迎全球的创新人才、企业家和投资者来到浦东,我们将以更开放的胸襟和更务实的举措,与大家携手迎接物理AI时代的浪潮,共同书写具身智能产业的新篇章。【李慧|上海市浦东新区副区长】
最后帮某青院长打一个小小的广告。然后如果大家希望今天或者明天有机会到展馆去亲自参观的话,如果你还没有买到门票的话,大家可以问问茂清院长,作为一个数据汇聚的平台,是不是有一定的特殊通道?我相信他有可能给大家一个期待中的答案。我帮你广告做好了,便于你汇聚更多的兄弟姐妹,上下游企业,我们共同来支持具身智能产业的发展。把平台做得更扎实,把朋友汇聚到身边,更多把我们的伙伴更多的邀请到浦东来,我们一起支持未来产业的发展。谢谢大家,也欢迎大家。【主持人】
感谢上海浦东新区副区长李慧的致辞。物理AI的智能涌现需要数据作为燃料,但数据从哪儿来?又要如何形成自动化的闭环?这不仅是技术问题,更是产业生态的问题。接下来有请智元合伙人,高级副总裁,聚业务部总裁,觅蜂科技董事长兼CEO姚卯青先生带来本场论坛的开篇演讲。模型与数据飞轮冲破物理墙,驱动物理AI的智能有限。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
尊敬的李慧区长,各位专家嘉宾,各位线上和线下观看我们论坛的朋友们,大家上午好啊。今天我们的论坛还是开始的比较早的。然后这两天世界人工智能大会,尤其是世博中心附近是人潮涌动,交通也管制的非常厉害,所以也非常再次感谢大家能够提前来到我们的现场,莅临我们的线上。然后我首先代表本次的活动的主办方智元以及觅蜂科技,对大家现场莅临和现场的观看表示衷心的感谢。今天我们也非常荣幸邀请到了来自全球产业界和学术界的专家和精英们,来和我们一起共聚一堂,一起探讨,一起迎接物理AI的智能涌现时刻。今天我先开个场,我知道很多来我们智喜剧生2026论坛的朋友们都是一个大型追星现场。后面我们的嘉宾一定会给大家带来非常高质量高含金量的分享。我先开一个场跟大家介绍一下,智元觅蜂在迎接物理AI智能涌现这样的一个时刻,我们做了怎样的一些技术底座的积累,模型与数据的飞轮又是如何去相互转动。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
Ok所以首先在讨论物理AI智能之前,我们来先回顾一下什么是智能的本质。智能我们认为它沿着两条核心的主线,一个叫做表征,一个是闭环表征。它可以说是对世界的一种抽象和压缩。人类所有的认知、判断、理性全是以表现为基础的。语言、数学、代码等等,都是人类文明进华数万年来,对于这个世界高度的一种抽象的表征。本质上它是知识的一种成功闭环,它是智能体与环境去进行持续的交互。从计算的角度来看,它包含了输入、算法、输出、评价、迭代的这样一个循环。从生物学的角度来看,它就是一种从感知到理解、决策、行动、环境反馈的一个完整的闭环。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
真正的高级智能我们认为是来自于表征世界,推理决策,作用于世界,在反馈进化的这样一套完整的循环数字AI的世界其实已经在这条路线上取得了巨大的成功。我们也看到每过一段时间其实都有有新的模型在不断的发布更大的参数量,更高的榜单的分数。本质上是在不断突破这个数字世界智能的边界。但是物理AI的挑战在于,我们必须在真实世界里面去同时打通表征与闭环这两条路线。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
数字智能的核心,它其实是知识的表征与数字环境类的闭环。它的能力主要体现在语言、数学、代码这些单纯的数字领域。物理智能完全不同,它的核心不仅仅是知识的表征,它更是经验的表征和真实世界中的一个闭环。他的能力边界要从刚刚提到的这些数字领域去继续拓展到空间感知、物理交互、精细操作,还有失败的一些恢复。这不仅仅是一种能力的简单的延续,更大是一种范式上的跃迁,从知识的规模化到真实世界交互经验的一个规模化。数字AI可以被互联网的数据去喂养出来,但是物理AI必须在真实世界里去摸爬滚打,积累经验,修正策略,进而进化他的能力。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
在迎来物理智能涌现之前,我认为我们还必须突破三道墙的一个阻碍。第一道墙是数据墙。因为真实的交互数据非常稀缺,获取成本非常高。不能像爬取网页一样简单的去爬取这个世界的一些真实交互的经验。第二个倒是表征,我们目前还是缺少大量的跨任务、跨环境、跨本体的统一物理表征。每一个机器人,每一项任务还是在各自领域里面各自为战,无法进行充分的共享。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
第三道墙是闭环墙,真正试错的代价还是在真实世界里面去试错的代价还是非常高昂的。因为他反馈相对比较缓慢,而且规模化很难。在物理世界里一次失败可能会是某个零部件的失效,也更可能是一台完整机器人的一个损失。所以说这三道墙是目前在物理AI从萌芽走向能大规模干活的最大的一个障碍。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
今天我们就和大家分享一下如何去冲破这三道墙背后的一些思考。Ok所以我们的目标是围绕这样三个挑战,去构建一个可泛化、可优化、可进化的通用聚生智能系统。可泛化它指的是通过大量的异构的从真实世界获取的训练数据,去学习到背后通用的物理经验。为提供跨任务、跨场景、跨本体的这样的一种能力的基础。可优化表示我们的机器人在真实世界里面去参与真实世界的反馈后训练,在任务闭环中持续去校准它的策略,提升成功率,去进一步提升稳定性还有可靠性。可进化是更进一步,再通过部署回流的数据,才在其中参与持续学习。不断的吸收新的任务、新的场景、新的本体的经验,来拓展这种通用能力的边界。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
在这个系统中,其实它的底层也是一个多机器人多机器人编队的这样一个集群的部署。上层是知识体系,这里面既包括我们在数字世界可以获取的这种叫knowledge知识,同时也包括了他在物理世界中他获取的这些交互的经验experience。再往上是算法层,它也会经历通用的预训练后训练,以及在部署环节,在部署之后进行的持续学习这样三个阶段的训练框架。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
在顶层其实是一个非常重要的可以验证可并行的闭环环境。这个闭环验证的环境既可以是真实世界,也可以是世界模型的神经网络世界,也可以是物理仿真的这样一个三位一体的系统。这里是我们智元在过去两年多的时间里面,在聚生智能技术体系上的一个全景的展示。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
在预训练层面,我们从go one再到后续的go one pro以及UNIVOA、libra BOAACOTVOA, 以及最新的rob cloud。每一次其实我们都是在突破VOA模型的一个能力边界。从villa的影视动作空间到动作思维链,从异步的双系统再到A阵驱动的全生命周期闭环。在后训练层面我们构建了一套从对抗式数据采集到类dagger的这个我们叫Jenny century动态闭环采集human的多候选动作评估,SOP可扩展在线后训练scarce异步闭环,再到如今我们正在推出的行业首个百台以上机器人分布式甄姬在线强化学习系统。在世界模型方面,我们从anniversary到anniversary AC再到EWM bench和genuine vision,从ACH从act to go到GECM2.0,我们其实都一直在推进世界模型作为策略模型以及世界模拟器方面的各项工作。最近在CVPR的word arena挑战赛中,GECM2.0也是非斩获了全球第一的这样一个非常不错的成绩。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
那么预训练、后训练、世界模型这三条技术路线,他也不是孤立的,他们是在我们的飞轮中相互驱动的那。首先我们来谈一谈预训练。预训练当中其实我们是有两条技术路线一直在并行的眼睛过程中。第一条是以VOA架构为路线的,从go one的villa架构再到go to,我们首次引入了动作思维链。今年我们还会继续推出go three的模型,预计在今年年底。另一条路线是以世界动作模型,也就是今年比较火爆的这个web路线为主。最早我们推出的是Jenny vision actor g actor的这样一个支持记忆的世界模型,再到后续的act to go,首次实现了go to action的这个世界模型。从未来预测真正走向了对机器人的一个闭环控制。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
这两条技术路线的终局是融合了VOA模型的规划和认知能力,以及world model的一个推理能力。我们叫做world action model。它同时会具备这样的一个语义理解能力和物理推演能力。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
Go to是我们今年最新的一个VRA路线的基座模型。它有两个核心的创新。第一个是动作swimming架构,它可以让机器人动作空间中先去进行潜在的一个推理规划。这是这一步是进行机器人的一个相对粗力度的动作规划,也是一个更低频的规划。同步在在粗力度的动作规划之上,再去结合高频的一个精细任务的操作,精细的一个执行。所以在整个过程中会经历EAR显示了粗力度轨迹规划,再到RAR的影视动作鲜艳,再结合AGP的融合输出精准动作,实现所谓的先想后做。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
第二个是这样的一套不同力度的规划,它是通过异步的双系统在我们的端侧进行实时的推理和执行。这样保证所有的计算都可以在边缘侧完整的去进行单击的推演。高度模型也在各项主流的以仿真物为主的benchmark上取得了非常不错的成绩。包括liberal plus beer revenge,还有gni sim 3.0上都达到了不错的效果。那么同同时go to背后的一些模型组件和相关技术,也入选了今年的CVPR和ACL的等等国际顶尖的学术会议。同时go to也是作为了今年我们在echo上举办的edge board word 2026挑战赛的一个标准的机械模型。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
再回到WAM世界动作模型这条线,我们最新的一个发表的工作actor to go,他解决的是传统策略,只是简单的从目标直接出动作这样一个reactive或者肌肉记忆的过程,它缺少一个显示可解释的规划。那么在这项工作中我们做到了先想后做,先去生成整个中间的视觉规划。同时围绕这样的一个视觉规划再去输出我们的确定性的动作。核心特点就是说近细远粗,这样可以既兼顾精细的控制,又可以去兼顾长城的目标。同时它也是自主净化,无需显示的奖励和人工标注。利用真实的交互可以去持续的迭代,去持续的去适应。在一些代表性的实验性任务上,从长城的模仿人类演示的书写,再到一些精密的插拔任务上都实现了从零到80%以上的一个效果提升。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
所以结合过去我们在BOA和one路线上的一些工作,我们总结下来BOA是非常擅长于理解和任务grounding。因为以及进行粗力度的这种规划的总结,就是说他做到的是告诉我们这是什么环境是什么,我要做什么。Web路线它擅长的是对于物理、对于动力学,对于未来状态的一个精准的推演。他告诉我们的是如果我这么做了,那世界会变成怎么样。这两条路线分别从理解和推演走向融合终局,就是我们刚才提到的world action model。它的工作方式可以理解为先理解任务,然后再去推演未来,进一步评估选择,最后落实到实施行动。这不再是简单的感知到动作的肌肉映射,而是具备物理世界推演能力的一个终极智能体。前面我们讲到的更多的是在世界模型方面,我们把它作为一种policy,作为一种动作策略的一个应用。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
除了policy之外,其实我们也在世界模型作为一个仿真系的路线,持续有一些工作的推进。最早的工作是叫anniversary AC,AC的意思就是action condition,在学术这是一种条件生成。就是我给定了机器人的动作,我们再来预测整个环境状态是如何变化。它这样的一个过程就是一个典型的模拟器的过程,给定动作渲染世界。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
后续我们还推出了围绕这样一个世界模拟器的benchmark,再到我们后续进一步的框架经历visionary sim 1.0的开源世界模型,再到最近的一个GDCM2.0,这项工作也是刚刚提到。在这个CVPR的比赛中获得了第一名。我们的世界模拟器其实在从单一的功能逐渐走向更加完备的一个闭环环境。每一步都在补齐物理AI仿真和闭环迭代的一些关键能力。展开来说,在GECM2.0里面,也就是我们最新的工作里面,我们真正实现了一个闭环世界模拟器。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
现有的一些世界模拟器,它可能存在着一些局限。首先它的对未来可能只存在环境的一个预测,缺少对于基线本体的一个状态规划。第二点就是说他一般来讲只提供对环境的推演,但缺少对于任务交互的一些进展,reward奖励机制的一个实时的反馈。再其次就是很多视野模型,因为它基于的是生视频的生成路线背后的算力消耗和推理时延还是相对较大,所以生成速度无法满足,支持大规模的在线评测与后训练。所以GECM围绕GECM的2.0版本,围绕这些痛点都进行了逐一的一个补齐。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
其中的stay expert它可以从video laden里面再去解码出机械臂和末端执行器的一些实时的状态。Word judge可以基于给定的预先的任务指令和实时推推演出的这个视频robot,来自动去评估任务的一个完成情况。那么在效率方面,GCM2.0也通过一些工程上的创新,可以做到非常快的一个去噪的生成效果。25帧的roll out可以在2.3秒内进行完成。在H100的这样一个集群上面。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
这里就是一个关于GCM2.0的一个小的demo。可以看到在接受到了初始的画面和任务的指令之后,GCM可以去非常快速的去渲染出既包括机器人的动作规划以及这样的机器人策略在作用于环境之后,整个环境的一个演化。如今GCM2.0已经正式的权重和代码完全开源。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
时间关系的话我可能就调过。预训练前面讲的都是一些预训练的工作。预训练决定了模型的一个起点,决定了模型的一个通用认知和表达能力。后训练是进一步决定了具身的模型在实际应用场景里面落地的一个性能。所以我们构建了从SOP开始的一套可扩展的在线闭环的后训练系统。通过机器人集群在物理世界在线on policy的实时的流式的上报经验和人类的一些干预信息与云端去闭环,形成模型的更新和环境的联动。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
最新的工作我们叫jeAnnie evolver 1.0。它是一个支持百台以上机器人,通过复杂组网与边端云端机器集群共同组网实现的一套协同式的在线机器人强化学习系统。通过弱人类在环实现policy的自主提升。这也是我们在业界首次实现了从10台到百台规模的一个跃升。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
我们在上海周边,在嘉兴我们有一个大的实验场地,里面就有目前超过100台机器人,一望无际的一个机器人编队。在日常实时的训练一些在线的强化学习策略。我们也是通过这样一种方式,去用群体智能的一种出发点,去解决精细长城等是真实的一些交互作业的难题。它最背后是一套云边端全异步的这种闭环的系统,可以支持百态以上规模的接入,秒级开始训练,然后百亿级参数权重可以在两秒内下发到所有100台机器人。并且训练周期依托我们这样一个分布式集群,可以从原来的天级别压缩到分钟级别,并且提升模型的一个泛化性和鲁棒性。在这里也是给大家看一个小小的宣传片。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
Jenny mobile 1.0的系统背后的核心就是让机器人在真实系统去持续进化。机器人与环境的不断交互积累经验数据,人类只在关键的时间节点去介入policy,来实现自动的一个提升。所有背后的机器人和边端,还有云端的算力,都会通过统一的大管平台与调度系统,自动的实现计算和推理节点的自动上下线,并且保证系统的一个本地运行。这不是在实验室里进行单机的一些演示,而是在真实环境,真实任务上去提供百台级别的集群,进行实时的物理验证。这我们认为是新时就是新时代下物理AI后训练的scheme。对,后续大家也可以去关注一下,我们会有摆台非常好的一些效果去进行持续的一个发布。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
前面我们讲完了模型的部分,后面我们再来聊一聊数据,因为这是可能今天物理AI要去走向大规模智能涌现一道非常重要的瓶颈。今天物理AI的数据仅如果我们等效为token也好,时长也好,其实大概只有语言模型的数1‱。因为真机交互的数据采集成本非常高,而且它非常难以规模化,并且同时我们也看到目前在聚生的这个数据市场上,是缺少统一的行业标准的,各家的一些质量形态都是参差不齐,同时在供给和需求之间也存在着大量的一个错配,各种数据孤岛的效应是比较严重的。所以我们希望能够去重新重构聚生智能数据获取的这样一个体系。从数据采集端、标注端和闭环评测端来为行业提供新的解决思路。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
在数据方面,我们首先回顾一下我们在真机的数据上的一些工作。首先是AJ board word的第一版2024版的一个成绩。作为行业内第一个百万条百万级别机器人轨迹的一个数据集,目前AJ board word已经成为全球具身智能学术圈和产业界的一个重要的生产资料。在handbags上目前已经累计下载超过了120万次,月度的下载量也超过了14万次。在github上有接近3000新的一个成绩。同时在国内的model scope等平台上也已经累计下载超过了40万次。它一经发布之后,也是被全球很多领先的团队广泛引用和使用。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
然后HR board word同时在国家数据局去年的高质量数据及典型案例上也获得了表彰,同时也是国内首个获得人形机器人数据及CR认证证书的这样一个数据集。并且在去年的世界人工智能大会上获得了四小之星的一个奖励。那么进入到2026年,我们在AJI board word上又做了很多创新的工作。首先它是基于第二代更加高自由度的智元的金陵G2本体去进行数据的采集。同时它相比于第一代,它百分之百来自于各行各业的一些真实场景,涵盖了商业、工业、服务业等等的全领域。并且这个数据集还是会在今年一整年的时间内,通过五期去分布的去发布,涵盖五大核心的研究主题。已经发布的两期包括模仿学习和多样交互,在后续我们还会解锁出更多的一个主题。数据本身它会涵盖精细的操作,长城任务、空间移动、双臂斜动,还有多机人机协作等真实的一些任务场景。目的就是去完整的承载真实场景下的一些动态干扰,复杂交互的关键信息,可以直接支撑具身智能训练的算法的一些训练。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
刚才我们也提到了,真实世界通过真机去获取数据,它可以获得非常高质量的数据。但同样它也面临着成本高昂,难以规模化这样的一个挑战。所以我们也在积极的拓展无本体数据的采集体系。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
面对这个无本体采集,今年我们也推出了eagle系列的产品。首先推出的是有两款产品,一个是MIGLE,它是业界领先的一款5米类的标杆产品,支持全场景高精度物理交互采集,可以达到空间毫米级的空间精度,全通道所有相机都是1080P画质,60FPS高帧率。它而且是全无线的这样一个产品形态,并且支持电池的快换,也就是可以让大家真正in the wild走进各个场景,全天候的进行数据采集。另一个产品是我们的头戴式设备mig,他也是行业内首创的一个全感官数据采集体系,多个摄像头可以超覆盖超过300度的一个水平FOV的,并且做到各设备之间毫米毫秒级的时间同步。因为这个对于我们多传感器将来训练模型也是非常重要的。同样像mingle gripper一样,Michael view也是支持无线便捷,而且是自带自研的VIO算法。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
除了Michael系列的产品之外,我们还推出了g two air这一款新物种。它是一款轻量化的作业和数据采集的平台,特点是灵动、快速、小巧,用同样拥有七个自由度的机械臂,它的单臂额定住宅是3公斤左右,B站达到了70厘米,最大移动速度可以达到1.55米每秒的一个速度,并且可以灵活的通过60厘米小的一个活动空间。同时一个非常重要特点就是g two air它和我们前面提到的无本地采集设备MIGO是完全原生同构的。它背后的传感器,还有传感器的布局外参等等都是远程通过。这样就可以最大程度上去复用我们在真机上采集到的数据和无本体环境采集到的数据,并且让这些数据可以更加高效的无缝的运用于模型训练,最终落地于本体。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
数据采集只是第一步,我们认为数据背后更高价值、更高壁垒的其实是数据的标注和治理的。围绕这样一个难点,我们也是推出了legal engine这样一个一站式的数据治理平台。可以让我们的后台一键的完成从切片、清洗、标注、格式转换等等的一系列工作,并且是全自动化的一个管线。它主要就包含了四个引擎。第一个是数据的预处理,它里面涵盖了时间对齐、数据筛选,还有空间感知能力。包括6D的、头部的、手部的6D的轨迹重建,人体的关键点重建,三维环境的一个重建。还有就是数据标注,既包括高层级的这种任务描述的关联,也包括细粒度的层级化的任务分解和原子技能的标注。最后也很重要的一点是,我们会对所有的数据产出进行一个闭环的评估。并且把它从定位到机器人本体上去进行闭环的真机和仿真的模型效果的一个评估。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
首先的一个亮点就是说我们的mega engine底层是有一套全自研的VIO的算法引擎。它结合了视觉惯性还有红外追踪等等技术。通过融合多模态多传感器融合的方式,可以从视频中提取毫米级的一个空间轨迹精度同步。它也可以对人手的21个关键点进行精确的提取。支持我们通过eagle view这样middle view这样的头戴式摄像头和人类罗手的操作过程,提取出毫米级的一个空间精度,还原出人类操作过程中的所有的细节。那么所有所有的这些多传感器、多数据源之间还可以实现毫秒级的一个时间对齐。因为我们知道在模型训练的过程中,其实所有的这些输入输出信息是要在时间上对齐,做成一个组织这样的一个动作。这也是我们在miguel engine里面去做的一个非常重要的步骤。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
同步我们还对端侧硬件,就是我们在采集端的设备进行了AES2五六级的一个数据落盘的加密。这样可以保证我们的所有的数据在采集的当下就可以实时的进行落盘和加密,防止数据的一个外泄。这里就是展示了我们目前在高精度轨迹重建上的一些效果。可以看到左边是一个我们真实场景采集到的一个多视角的操作的画面,右边的中间和右边其实是我们实时提取出的这个人体的关键点模型。无论是可以看到手部的这些精细的操作,还是全身的大范围的运动,都可以还原出高精度的一个捕捉。这为后续数据的本体重定位和技能的迁移提供了非常精准的一个数据的基础。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
Michael engine的另一大核心其实是对场景的一个细腻度的标注。他可以去对实时的在真实环境里采集回来的非常长时序的数据,进行非常自动化且高精度的一个动态的切片。并且进行帧级别的一个技能标注。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
它大体的一个处理过程其实包含了四个步骤。第一个是多模态数据的一个接入,再到大语言模型,这种多模态大模型进行语义的自动渲染,再到技能级的原子动作的一个精细化拆解,以及对应的持续的精准的对齐。最终其实它可以去构建出人类原子动作技能图谱。包含了十大动作类以及在下一层的120多类的原子动作,涵盖了所有的通用的操作场景。在精度方面,它的语义达标的准确度可以达到98%以上。同时在各个原子动作之间的切片的时间精度也可以做到0.5秒。真级别的这样一个对齐。所以这可以帮助我们在收到一段非常复杂长城的操作视频之后,精准对其进行切切分,并且成为可复用的一些原子技能的单元。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
前面提到的都是一些数据的处理。数据其实要能够为模型所用,它并且还它必须要具备非常好的一个能够自证的,我们叫评价的一个能力。所以闭环的评测体系是我们迭代的一个起点。在miguel engine上我们提出了既基于模型开环评测,也基于真机闭环效果评测这样一个双轨的benchmark机制。所以从模型到征集落地,可以去对他的每一份数据进行一个详细的评估。而且这套体系的最核心的一点是具备对结果的一个可溯源性,并且可分析的一个能力。依托多维度的一个数据标签,数据分布可视化以及数据关联图谱,不仅仅对数据进行一个简单的打分,更多是让数据质量进行一个透明化,同时还可以去输出最优的数据采集的一些配比方案的建议。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
最后让我们用一张图来总结一下我们在数据上的一些想法和策略。左侧是一个数据金字塔,这个在行业里其实大家也有非常多的一些讨论。第一层是非常海量的互联网数据,日常的一些常识类的数据。它既有人类的一些操作,可能也有一些机器人和其他的一些视频。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
中间层就是我们刚刚重点提到的egocentric和UMI类的无本体采集数据。它包括了体感的一些细节,运动轨迹、力反馈、持续上的一些对齐的数据。可以去被初步用于预训练。因为它已经具备了从环境感知再到最终的运动控制的完整的链条。最上层的是甄姬的数据,因为它是最高价值也最难获取的,包括了高精度的轨迹,也包括了高精度的这种操作,还有部署态回流的一些数据。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
左侧是右侧的话是我们在进入到可进化的阶段。刚刚我们提到可泛化、可优化、可进化,对吧?所以右边的是可进化阶段,就是我们的机器人真正部署到实际的一些应用场景之后,它存在的一个飞轮。具体来讲是从模型的执行,再到有效高质量数据的一个回流,再到背后服务仓系统的一个数据挖掘,再到模型更新和OTA下发的这样一套不断迭代的系统。每一轮提每一轮的这个迭代其实都可以在早期提供接近5%到10%的一个成功率和性能上的提升。所以我们是融合了真机数据、无本体数据,针对不同的落地场景进行端到端的一些数据分布和数据采集的一些方案的定制。最大程度数据最大化的去优化数据的一个投入产出比。前面讲了模型数据等等的一些组件。最后这个飞轮的效果其实是需要在真实的一些落地案例上去得到体现的。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
这里给大家分享和展示的就是我们前段时间在3C行业进行的一个全天候全工段产业技术的一个线上直播。他是我们在江西南昌的一个合作伙伴龙旗的一个现场工作。传统的这种3C的产线,它其实面临着很多柔性化的痛点。因为现在的产品迭代非常快,每当迭代了一个新的SKU或新的工艺之后,其实一些固定的自动化线是很难去灵活的进行适配的。所以面临的这针对的这样的一些痛点的话,我们也去把我们的刚刚提到的一些预训练、后训练以及仿真和数据的闭环评测的机制,运用到了我们这个场景的开发过程中。在上个月我们进行了为期六天,长达每天超过10小时的一个直播。在整个过程中这一批机器人全工段的去工作完成了超过6接近65000件的一个操作,全程实现了99.99%的一个成功率。并且在三月份上线至今,这批机器人已经能够长时间的稳定的在工厂里面接受24小时七天的魔鬼训练。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
在这样的一个具体的落地的背后,其实支撑它的就是我们前面提到的这些关键的技术能力。包括真机强化学习、仿真训练、多模态感知、精力力控,以及我们云边端学云边端协同的这样一套在线进化机制。好,最后我就用一句话来总结我们今天的分享我们今天讨论的主题是迎来物理AI的智能涌现时刻。模型是决定了这个智能涌现的起点,数据应该说是定义了它的一个终局。只有飞轮真正的转动起来,我们的智能涌现才会出现。但我们坚信这个智能涌现他只是时间的问题。他一定会在我们突破了数据表征墙、闭环墙之后,去形成这样一套可优化、可泛化、可进化的物理世界AI的进化系统。我们相信物理AI智能涌现,它不是会不会来的问题,它是一定会到来的。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
今天也非常感谢大家,再次感谢大家参与到我们的现场。时间也留给后续的嘉宾,相信大家也已经非常期待能够听到各位嘉宾给大家带来更多精彩的分享。好,谢谢大家。【主持人】
感谢杨茂清先生的精彩分享。数据飞轮转起来,模型才有得到突破式进化的可能。那么当数据驱动的预训练模型在面对跨场景、跨本体的泛化任务时,能力边界在哪儿?又该如何实现从被动观察到主动实行的跨越?下面有请清华大学计算机系副研究员苏航教授。他曾入选国家万人计划青年拔尖人才,从事卤泵机器学习和具身智能等方向的研究。掌声有请苏航教授苏。【苏航|清华大学计算机系副研究员】
非常感谢。我刚才听了宝清的这个报告的话也非常激动。我和铆钉的话认识现在三年多的,将近三年的时间了。然后当时的话其实具身智能的话还是一个刚刚开始起步的这样的一个阶段。当然在过去一两年当中,其实冇称他们。我也看到这个智元在产业界,然后我自己的话在学界,大家共同来努力推动整个这个领域的话往前来往前走。【苏航|清华大学计算机系副研究员】
我们也看到整个来讲这个物理AI的话确实是在布局当中取得了非常迅速的这样的一个进步。应该这样来说,大模型的话某种意义上来讲,它极大的拓展了我们的人类的这样的一个脑力。传统这个机器人的话,在很大程度上它其实拓展了我们人类的体力。具身智能的话其实是二者之间的这样一个交汇。我们看到以提升智能的话为代表,它综合的来拓展了我们人类的这样一个脑力和我们人类的这样一个体力,推动整个这个人物理的人工智能向前发展。我今天的话也汇报一下我们团队对在过去的应该说一年多的时间吧,然后做的一些相关的这样一些工作。【苏航|清华大学计算机系副研究员】
首先来讲,毫无疑问这个人工智能的话正在朝从这个物数字世界向物理空间进行深度的这样一个扩展。我们知道的话,其实走向这个物理世界的这样一个AI的话,也是走向通用智能的这样一个非常重要的这样一个技术的一个途径。应该是说如果是说没有身体的话,那么我们这个是MIT的一个教授,他展现的这样的一个talk。也就是说没有身体的话,那我们人类的这样一个智能的话,它只能是一个缸中之脑来做这样的一个想象。那真正的一个智能的话,其实本质上来讲是给了我们身体的话,给了我们大脑和外部环境之间交汇的这样的一个接口。所以说的话,我们是可以通过我们的这样的一个,身体和外部的物理环境进行交互。理解物理世界当中真正的这样一个内涵,进而来去构建我们的这样的一个智能的一个系统。【苏航|清华大学计算机系副研究员】
那实际上来讲,在具身智能并不是一个新的这样一个概念。在1956年人工智能诞生的时候,其实那个时候大家就已经提出来,人工智能的话是分成了离身智能和具身智能。为什么来说是最近这两年取得了非常重要的一个变化?也就是它的一个核心的变量,其实是在于机座模型的这样一个发展。也就是说整体来讲,由于我们有了大模型,极大的提升了模型的这样一个泛化能力。所以说的话其实才真正的是我们的聚身走入了我们整个各个领域的这样的一个核心。【苏航|清华大学计算机系副研究员】
鞠身智能的大模型,我自己感觉它其实并不是说简单的我们叫这种所谓的语言模型,或者是我们叫多模态大模型的一个最简单的这样的一个延伸。我们之前其实当然我们看到不管是VRA也好,还是世界模型也好,很大程度上的话它其实是得益于我们之前大模型相关领域的这样一些发展。但是我个人的观点一直认为,具身智能它即使需要也值得拥有一个自己这个领域的这样一个大模型。为什么这样来说呢?比如说像我们这里展现出来的像法罗斯,像我们的炒菜,像我们的拉链这样一些我们人类非常简单的这样一个任务。大家可以在大脑中设想一下,我们是很难用这个语言和用途下把它描绘出来的。所以说的话自身在长期来看,它是需要一个原生的这样的一个大模型来去支撑它的一个发展。【苏航|清华大学计算机系副研究员】
聚身大模型它的一个核心的能力应该包含哪些呢?我们感觉是巨深的话,它的核心的话其实应该整体来讲,首先来讲它应该具有非常强的这样的一个泛化能力。同时的话它也应该具有对包括这个泛化的话,既包括对物品级的泛化,也包括对场景乃至本体级别的这样一个泛化。同时的话它应该有非常强的这样一个主观性。最后的话他也应该有非常好的这样一个数据transfer的这样一个能力。【苏航|清华大学计算机系副研究员】
就像刚才昴青也谈到了,整个具身数据在过去两年当中取得了非常快速的一个发展。说实话在我们大概三年前开始做剧生的时候,我搜集了全网的数据,加起来也不过就是1000小时左右。那个时候的数据应该是非常匮乏的。但是我们今天非常惊喜的看到,包括像以觅蜂为代表这样一些企业在共同来去推动的这样的一个大的一个背景下。我们整个来讲这个集成数据的行业,今年我们可能会如果算是ecosystem这样一些数据的话,可能会把它推到千万小时这样一个量级。所以说这其实也是对我们整个来讲,大家见证的这个领域的从一个量变的这样一个非常重要的一个过程。我们整个这个领域的一些数据的话,其实也从遥操作作数据到无本体的数据,一直到我们的包括像我们现在的这种internet数据,以及到我们human centric这样一些数据,这样一个见证式的一个发展。【苏航|清华大学计算机系副研究员】
Ok我们团队的话应该是在去年的话比较早的话就是来去注意到了UMI这样一个工作。因为UMI的话我们刚才看到,当然和智源像觅蜂这种公司级的产品,其实应该肯定是有这方面的这样的一些概括。但是说的话,我们应该是全世界比较早来去注意到这样的一款产品。然后的话,把它推动在这个业内的这样一个进步。【苏航|清华大学计算机系副研究员】
这是团队我们自己来去做的这样的一个,这个其实非常早,应该是在一年多以前,就将近一年前,现在就已经做出来了。然后大概在去年的时候,我们就完成了进入到真实家庭场景里边,这样一个数万小时的这样半小时级别的这样一个数据采集的这样一个工作。我自己感觉还是UMI这个设计的话,其实还是非常好的。我也注意到了今天像这个,我记得是咱们那个sunday的这个城市的话,其实也过来了。其实这个设计的话其实是一个非常我自己感觉是非常天才的这样的一个设计。它其实是把我们整个的这样的一个素材的过程和我们的本进行解耦。同时的话可以进入到真实场景,开展这样的一个数据的一个采集。但是这里边的话,它也同时存在的这样一些不可避免的这样一些技术上的一些难点。【苏航|清华大学计算机系副研究员】
但是UMI的话把我们的解耦开来之后,首先来讲由于我们人类大家可以想一下,其实是我们有一个比较宏观的一个视角在做这样一些操作。那机器人的视角的话,其实和整个来讲,他的人的这个视角的话会有很大的这样一个差别。同时的话,其实包括我们UMI的话,它的这种本体的gap的话其实也是比较大的。它们之间的这样一个action space的话,也会有比较大的这样一个区别。也就是机器人的腿型空间,我们人的这样一些可行空间也存在的这样一个tab。【苏航|清华大学计算机系副研究员】
所以说并不是说把这些数据简单采回来的话,其实就可以来去使用了。也就是如何来更好的来利用这些数据,其实也是一个在领域内的一个比较难trivial的这样一个问题。为了解决这样的一个问题的话,其实我们也是提出了这样的一个运行链的这样一个方法。这个相关的一些论文的话,也是发表在了这个SML上。【苏航|清华大学计算机系副研究员】
其实核心的意思的话,也是说如何能够把这个机器人的这样一个空间,把它训练出来一个action space的这样一个表征。这个其实是比较核心的。也就是说我们能够在影空间当中表达我们的这样的一个UMI的数据采集的一个范式。但是具体来讲的话,其实我们采用了RVQ这样的一个机制。也就是用这种弹插的一些方法来去做把这个模型的进行这种矢量化的这样一个表达。把它的数据的话映射到一个隐私空间,来保证它的一个可迁移性。通过我们这样一个采集方式的话,应该来说还是获得了比较好的这样一些效果。【苏航|清华大学计算机系副研究员】
也就是说在通过这种UMI的话,我们即使是在我们就要实现了所谓的四个deal shot,包括在这种未见到的机器人本体上。所以未见到机器人本体就是指的是他的机器人的B的话,那其实是一些未知的这样一些B然后包括在一些未见的一些环境上,未见的物品上,以及这种未知的这样一些instruction上都都很好的实现了这种零样本的这样一个泛化。同时的话其实我们也在一些比较重要的一些task,取得的一些比较高的这样一个成功率。应该来说,这个其实是全世界第一个来去做UMI数据采集的这样的一个预训练的这样一个方法。【苏航|清华大学计算机系副研究员】
这个模型的话,我们也是面向整个业内的话,其实进行的一个开源。后也是希望能够推动整个技术领域的话其实往前发展。有了UMI数据之外的话,其实我们去年的话其实见到了一个非常重要的一个变化。就是如何来利用视频这样的一个方式来去提升模型的一个泛化能力。视频的话,它其实是我们相对来讲是一个成本采集的话,是一个成本最低的这样一种方式。如果说我们能够更好的利用视频数据,实际上我们就可以有更广泛的这样一些数据的来源,对提升模型的放大性具有非常重要的这样一些意义。【苏航|清华大学计算机系副研究员】
实际上来讲,去年的话确实我们也是见到了整个这个领域的话,大家高度重视这样的一个视频的数据。但是我们团队的话也是比较早的来去发现这个问题的这样的一个团队大概是从也是差不多从去年年初的时候,我们就开始这个视频生成模型做一个核心,来去构建我们整整个的这样的一个预训练的一个基座。视频生成模型由于它顶扣的了大量的这种视频当中的这样的一些物理的这样一些鲜艳。所以说可以给我们整个后续的话提供一个比较好的这样一个。【苏航|清华大学计算机系副研究员】
以视频我们发现它的整体的这样一个模型的话,VRA的话它即使是我们发现不管是BRE模型也好,然后word world model也好,包括像这种我们把它叫做是video generation model也好,以及IDM的话就是这种inverse dynamic model也好。其实本质上来讲,他们都是可以在一个概率空间来讲进行建模的那我们其实思考一个问题,是不是能够用一个统一的模型,把不同的这样一个概率空间来进行统一的一个建模。这样的话,就可以充分的利用大家的一些数据,然后实现这种mutual enhancement。这样通过这种方式的话,其实我们可以把我们的预测感知和这种行动在一个模型框架下来做这样的一些事情。OK针对这样的一个思路的话,其实我们也是提出了一个统一的这样一个模型架构。【苏航|清华大学计算机系副研究员】
这个工作的话也是今年发表在了人工智能领域的领域会议CPR上。我们其实在整个的一个模型空间的话,构建一个统一的这样一个action的这样一个表征。我们发现对VR也好,对word action也好,IDM和VGM的话,他们其实本质上来讲都是在做这种概率上的一个建模。从这个渠道角度来讲,是从不同角度来进行去噪。所以说我们通过这种显示的这样的一个联建模的话,可以实现它的一个统一的这样一个表征。在这样一个框架下的话,其实时来去构建这样的一个新的这种world action model这样一个范式。通过这种方法的话,我们取得了很好的这样一个效果。也就是说我自己感觉这个其实也是应该这个工作的话是我们去年年初做的一个工作。【苏航|清华大学计算机系副研究员】
我们发现通过这样一个方式的话,我们在数据的3分之1的效率上有一个非常大幅度的这样一个提升。尤其是大家可以看到这个第二张图。随着它的横坐标其实是我们的任务的这样一个数量,纵坐标的话其实是模型的这样一个泛化能力。我们发现的话对于传统的VR模型,大家其实做VRA的话其实就知道。它其实非常容易的话,其实是出现模型的退化。也就是说当你给的一个新的场景和一个新的任务之后,这个模型的能力会出现退化。但是的话其实对于world action model来讲的话,由于它其实有一些大量的数据的做一个泛化的一个基座。随着我们这个任务的这样一个增多的话,在后天的过程当中,他并没有不会导致我们整个模型的这样一个退化。【苏航|清华大学计算机系副研究员】
OK最后我想谈到的一个方面就是说,其实刚才宝清也提到了这样的一个问题。也就是说如何来去我们经营。有了预训练之后,下一步的话我们如何来去思考这样一个问题。【苏航|清华大学计算机系副研究员】
我们感觉unposted的数据或者是真实场景的数据,应该是聚身机器人计划的下一个非常重要的这样一个锚点。为什么呢?因为很多大量的这种我们叫真实场景的数据,是我们在御殿当中没办法去获得的。就像我们知道大家所谓的这种边界上的这样一些数据。就像我举个例子,经常给学生举的一个例子。就是说当我们这个一瓶水放在我们的桌子边的时候,实际上我希望把这瓶水向里推一下,然后再把它拿起来。这样的话其实也就是大量的这种边缘侧的这样一些数据。【苏航|清华大学计算机系副研究员】
在传统的这样一个预期的过程当中是非常难以采集到的。我们如何来利用这部分的数据的话,其实对应该来说是我们整个聚身下一个这种领导这样一个破解。为什么这样来说呢?因为我自己感觉应该是说这种我们有这种边界的数据,它其实不断的推动我们的模型边界向前走来,可以极大的拓展模型的战略。【苏航|清华大学计算机系副研究员】
这是一个简单的这样的一个示意这是一个简单的一个示意。也就是说通过我们的这样一些recover,我把这部分数据叫做数据。也就是这部分数据的话是处在模型的边缘的,但是处在决策边界上。但是我是可以通过我们的这样一个人和机器这样一个协同的话,把这些数据拉回到一个他的一个successful的这样一个空间。这样的话可以再进一步拓展我们模型成功的这样一个范式。【苏航|清华大学计算机系副研究员】
那那针对这个思路的话,其实我们也是提出了这样一个新的这样一个方法,我把它叫做是tutor。也就是说当我们发现这个模型偏离了它的主要的这样一个轨道之后,我们是不是能够通过包括人在环路的一些human innovative的这样一个接管的一些方式。可以把这部分数据的话,类似于像通过摇操作,通过这种人在环路一个接管。把这部分偏离到正常决策轨迹之外的这样一些数据的话,拉回到我们正常的这样一个决策空间来去做这件事情。在实现上来讲的话,其实我们是可以把这种接管的数据的话,其实是用这个flow match的方法来进行相关的这样一个监督。通过这个方法的话,其实我们是可以很大的去拓展我们的成功,大幅度的提高我们单个模型的这样一个产出率。【苏航|清华大学计算机系副研究员】
我们展稍微展示一下这个demo,这个例子是我们在实验室当中做的。因为我为什么做这个碟换块的这样一个任务,也就是说这个也是我们和在和自变量做的一个联合实验室,大家一起来去开展的这样一些工作。在的这个素材展现上我们可以看到就是这个叠方块,它是一个非常直观的这样一个例子。因为我方块儿叠的数量越高,代表的是它的他的一个成功率的话就比较高。通过我们的这样一个接管的一个方式的话,其实可以来去把这个方块的话可以碟的,应该来说是比原来传统的它机器人的自己是叠的话要高很多。所以说在展示的比较高的这样的一个成功的这样。【王尊玄|Genesis AI联合创始人】
一个概率OK.【苏航|清华大学计算机系副研究员】
通过我们的方法的话,其实也是大幅度的领先于其他对比的这样的一个方法。说明了人类的接管在当前的这个机型当中是非常重要的一个环节。为什么这样来说呢?因为我们做工程人都知道,很多时候的话,我们往往是需要靠着90%的时间和精力去解决最后那10%的任务。但如果是我们有一个比较成功的一个接管的话,其实是可以大幅度的降低它的一个负载。同时这部分人类的接管往往是意味着机器人在决策边界上这样一些数据,也能够大幅度的提高机器人的它整体来讲它的一个学习效率。【苏航|清华大学计算机系副研究员】
OK我最后的话其实是想做一个这种简单的这样一个讨论。也就是说当前的这个矩形数据的话,其实是分成了不同的这样一些类型。其实我把它归纳为就是其实行业内的话其实有非常多的这样的一些这种不同的数据类型。【苏航|清华大学计算机系副研究员】
但是很多人一直在问我一个问题,究竟是啊比如说是遥操作作的数据有用,还是一口的数据有用?是仿真的数据有用,还是UMI的数据有用?我自己感觉这个其实都是不完善的。其实每种数据的话其实是有它自己的这样一个价值所在的。【苏航|清华大学计算机系副研究员】
真正的其实巨深的function的话,它其实和大语言模型其实是完全不一样的。很可能我们不能用统一的数据类型和统一的办事一句话来去解决所有的这样一个问题。大家是需要综合的利用不同的这样的一些数据来去解决相关的一些问题。但是我个人感觉就像回到巨深本身的这样一个概念。巨深它的核心是要去通过和环境交互来去实现模型本身能力的这样一个演进。所以说的话,我自己感觉最重要的其实是能够如何能够在真实场景当中实现我们的数据闭环,实现我们的数据飞轮和价值飞轮。这个其实是提升我们运行链的一个最根本的这样一个能力。【苏航|清华大学计算机系副研究员】
OK最后的话其实我做一个总结。也就是说我自己感觉矩阵数据的话,其实我们正在经历的具身数据这样一个schedule的这样一个范式。我们如何来去构建一个foundation model,其实是决定着我们整个聚身行业能不能走向远的更远道路的这样一个最重要的一个原因。【苏航|清华大学计算机系副研究员】
应该来说是具身数据的话分成几个经历了几个发展的一个阶段。第一个阶段的话,其实如果我们是要BRM这样的数据的话,其实本质上来讲,它大量的是第三视角的这样一些数据。就像我们人类在通过第三视角在观察别人去做事情,通过这方面得到一些经验,来去构建我们的具身模型。今年的话我们看到像包括像eco centric这样一些数据的话,某种意义上来讲,它是把一些被动的数据变成了一些主动的这样一些数据。我们可以通过第一视角的交互来获取一部分的这样一些数据,来构建我们的这样一个基础模型。【苏航|清华大学计算机系副研究员】
当然未来的话,或者是现在正在经历正在发生的,我们也看到包括像网讯最后讲的这个摆台机型的这样一个部署。包括像我现在在和一些企业在合作,像这边要在合作我们正在做的这样的一些工作的话,其实都在经历这样的一些这种工作。也就是说如何能够在真实场景当中构建出来这样一个数据闭环。通过这样一些close loop的这样一些方式,大家来去开拓展这个机器人更加稳定的机动模型的一些构建方法。这样来提升这个模型的一个泛化性,可能是未来自身整个的这样一个发展方向。但anyway我们看到这个具身7座在过去体验当中有了一个非常快速的这样一个进步。【苏航|清华大学计算机系副研究员】
我们也我经常跟我团队的同事的话说一句话,我自己感觉我做智能几年可能最大的一个误判就是没想到具身智能发展这么快。这可能是整个人工智能发展的一个特点。就在人类的科技史上,我们也从来没有见到这样的一个领域有如此指数级的这样一个飞跃。我们也非常希望和在座的同仁一道,大家共同来推动整个具身智能领域的一个发展。好,非常感谢。【主持人】
感谢苏航教授的精彩分享,从学术视角为我们树立了具身基础模型,从感知到动作执行的完整技术链路,让我们对反馈学习在机器人决策中的落地逻辑有了更深的理解。接下来这位演讲者是来自硅谷备受瞩目的机器人AI初创公司physical intelligence的研究科学家任至意先生。他负责VLA模型预训练,曾与普林斯顿大学获得基金人博士学位,并先后在google diplomat nvidia以及斯坦福大学等从事研究工作,主攻机器人学习与通用策略的开发。掌声有请。【任至意|Physical Intelligence(PI)研究科学家】
two. 好,大家上午好啊,我是任至意Ellen。然后今天特别荣幸能够跟大家来分享一下physical intelligence,就是大家让听说到的派,在过去的一年多在具身智能上的一些发展,然后我们对之后的一些想法。【任至意|Physical Intelligence(PI)研究科学家】
派的整体的思路是说,我们想做一个journalist rubber policy,就是说我们有一个通用模型去控制任何一个机器人,去完成任何一个这样的physical task。在这里我们也是展示了一些这样的例子,包括我们自己的一些本体,UR five arcs,同时也包括了我们跟一些对外合作伙伴,他们用我们的模型去完成比如说家家庭或者是仓库里一些的一些任务。我们的终极目标就是想打造一个这样的通用居身大脑,然后去控制世界上所有的机器人,去完成这些task。【任至意|Physical Intelligence(PI)研究科学家】
Ok然后在这个过程中,我觉得太最核心的一点是啊,我们想要去把数据首先给积累起来。然后就像我刚才提到的,我们会早期先把大量的本体给搭建起来,然后去scale up这个整体上的数据。同时我们也会去具体的去部署一些机器人。比如说在家庭里,不好意思,这个format有些问题,然后我们会让这些素材源去自由发挥,去采集非常多样化的数据。我们同时把这样的机器人部署到了非常多的环境里面,包括一些我们自己这种环境,也有一些我们在外面多样的家庭环境去去deploy我们这样的机器人。然后同时我们又得到了不同quality,数据质量有一个不同的指标。然后我们也希望这些蔬菜园去用不同的strategy去做这些任务,所以总体来说我们对数据这一块要求非常高。然后我们的综希望把diversity去scale up,不仅只是数据量的问题。【任至意|Physical Intelligence(PI)研究科学家】
同时我们在数据采集完之后,会去做大量的标注。这里有两个例子第一个是我们去比如说去家庭里面去做一些厨房里的一些任务,然后的话我们在采完数据之后,会首先对每个sub task把它给拆解出来,然后去标注比较细节的语义分析。同时我们会对整条这个trajectory打分,比如说这个quality是一分还是两分、三分、四分、五分。然后我们也会对每一段的小的subtask做一个具体的好坏的一个标准。我们会去判断每一段机器人有没有去犯这个mistake,如果犯了mistake,我们就会把这个标注出来。然后有了这些数据之后,我们就想去打造一个robot foundation model,然后这样的robot foundation model去去把这些数据全部给ingest进去,然后我们这里有比较,比如说history observation,比如说我们对机器人有一些prompt,告诉他这个task是什么,然后我们会去训练它去生成。【任至意|Physical Intelligence(PI)研究科学家】
比如说下一步应该做什么事情,未来可能会发生什么事情,然后再会最后去生成一个对物理世界的交互,就是我们所说的actions。然后这里我展现的是我们最早的一个demo,就是泰林,就是2024年11月份,就是公司创立之后六个月的时间。我们通过大量的数据采集,展示了在很多长城任务上可以用数据来驱动,然后来建立这个模型去完成这些task。然后当时这也是给我感觉是整个行业第一个能有一个聚生模型去完成不同种类非常长城任务的这样一个模型。【任至意|Physical Intelligence(PI)研究科学家】
然后在去年的四月份,就是25年的四月份,我们发布了下一代模型派05派05这里的我们的一个侧重点就变成了我们要把机器人去deploy在不同的环境里面。我们也是去硅谷那边很多这种LBNB的环境里面去采集数据。然后在一些新的环境里面去deploy我们的robot去测试它的泛化能力。然后我们发现通过我们这样大量的数据积累,模型可以去完成一些人给的一些指令,就算他从来没有见过这样一个环境。【任至意|Physical Intelligence(PI)研究科学家】
Ok然后我在这里稍微总结一下,我觉得到派05这个阶段,我们公司在这个模型能力上的一个状况,我觉得这里可能我想把模型能力画两个轴,我觉得纵轴是一个performance,就是可能说我们在一个具体task上面可以把这个成功率做的多高,或者做的多快。然后横轴是breadth of capabilities,然后这个就代表了这个模型能做什么样的任务,或者说他这个泛化性有多强。然后我觉得派林可能对于我们来说是一个最初的开始,他可能在两个轴都还是比较低的这个位置。然后在派05的阶段,我们把这个模型的泛化能力,不同的task的能力提高了很多。然后到那个时候我们就在想,我们在这个泛化能力上有一些突破之后,我们怎么样才能去让我们的模型在performance上有一些新的突破的,就是让怎么让我们的模型的成功率有着更高的提高。【任至意|Physical Intelligence(PI)研究科学家】
然后那个之后我们就很把很多的重心放在了采集,以及更加的不同质量的数据。因为我们觉得只有让模型去理解不同模型不同数据的质量,才可以去做figure out下一步怎么去完成正确的这个behavior,然后把我们的成功率给提高。所以这里是啊我们之前有一个做咖啡的这样一个展示。然后我们采集了很多非常高质量的遥操作作数据,但同时我们也会去着重的让模型去犯一些错误,比如说这里有不同的就是比如说把这个牛奶给洒了出来,或者说去弄咖啡豆的时候把这个咖啡豆扫了出来。所以我们不只是在采我们说的高质量的遥操作作数据,其实也在收集一些机器人犯错的数据。【任至意|Physical Intelligence(PI)研究科学家】
同时我们会让机器人自己在这个真实世界里去跑起来,去采集这样autonomous robots。然后同时我们会在机器人比如说卡住的时候,让人类去介入,去踩这样的degraded intervention data,然后把这样的数据回流到我们的模型训练里面。然后这里我们就打造了一个后训练的数据飞轮,就是我们会去deploy这样的policy。在这个真实世界里面,有一些时候会让人去干预,帮助这个模型完成最后的任务。同时去scale up我们遥操作作的不管是高质量的还是会犯错这个数据,然后形成这样一个飞轮,让模型去不断迭代。然后最后的结果是我们最后训练出来一个这样的python six这样一个模型,然后就是我们去年2026年10月份的结果,然后这里是我们做咖啡的一个demo,最后我们可以让这个模型在我们自己公司里面搭了一个这样一个做咖啡的一个展台。然后我们让这个机器人从早上五点半一直做咖啡,做到了11点半。然后这中间没有任何的cat shop failure,这个机器人都是自主在完成这个任务。【任至意|Physical Intelligence(PI)研究科学家】
然后我们去年在new york 2026年europe sorry 2025年new york去做了一个live demo。这个是一倍速的这个视频展示了我们在我们从来我们把这个机器人放在了new york的一个租的一个场地里面。然后我们在现场没有采集任何数据,就直接deploy了我们这样一个模型。然后发现模型也是一样,在这样的环境里面不会去犯任何的错误。【任至意|Physical Intelligence(PI)研究科学家】
然后另外一个例子是我们把这样一个模型真的去做了一个落地,我们跟SF当地的一家做巧克力的一个vendor叫deadline chocolate factory。然后他们做巧克力卖巧克力中间有一个任务是要把它这个纸盒给叠起来。然后我们很早就开始就跟他们合作,然后通过这个数据飞轮积累经验,我们最后让这个模型可以自主的完成,比如说整个下午纸盒折叠的这个任务。Ok我刚才讲到了,我们通过这个数据飞轮,通过采集不管是高质量的遥操作作数据,还是更低质量的diverse的mysql的数据,可以让模型去不断的迭代,把这个成功率、reliability都拉的非常高。【任至意|Physical Intelligence(PI)研究科学家】
然后我们从此也,同时间我们也发现我们的业界的一些同行也在这方面做了很多突破。包括journalist,有一个非常也是成功率非常高的这样一个模型。然后包括google,也在这个泛化能力上做了一些新的突破。然后这个时候我们就去会思考我们下一步应该做什么,然后我们把我们的目标更多的放在了这个两个轴的右上角,就是我们怎么同时把这个performance又把泛化能力做的最好。【任至意|Physical Intelligence(PI)研究科学家】
然后我们这里的一个思路是我们发现我们采集了很多这样不同种类不同policy的数据,然后我们还是在不断思考,我们怎么样可以把这些数据的信息给提取出来。然后这里的想法是我们现在有一个很大的dataset,然后我们通过这个dataset会去学一个这样从X到Y的一个mapping。然后你可以理解为我们这个X是啊就是说我们把什么样的信息给输入给模型,然后Y是actions,就是我觉得对我来说,不管这个模型是BOA还好,还是web还好,最后我们学的都是这样一个mapping,对吧?就是说我们有一个很大的数据集,我们要去把这个模型的input输进去,然后去得到最后这个action。当然这个中间我们可以去做很多的这种推理。我们的数据集其实是非常diverse的,我们有啊不同的task mix multi task,不同的环境multi environment,miss quality,multi strategies,所以我们这个数据其实非常diverse。【任至意|Physical Intelligence(PI)研究科学家】
然后我觉得从一个我们从解决这个基机器人学习这个本身的问题来说,我们要学习这样一个大的数据集,我们就要去给模型足够多的context。我们去告诉模型这个task是什么,这个环境长什么样子,这个quality是什么样子的。然后这个机器人采用了这个策略是什么样子的。我们需要把这些信息都要扔给模型,这样模型才可以知道对应的这个action应该是什么。【任至意|Physical Intelligence(PI)研究科学家】
然后我们看了一下就是过去一年多大家发的一些robot foundation model,包括我们自己的派05模型。然后其实我们发现我们在模型的这个input里面,就是给模型的context,其实里面对于数据的信息还是很有限的,比如说我们这个里面,其实大家很多发现去加了一些历史的信息,反而会把模型带坏。所以大家通常对没有去加一些history observations。我们有一些比较粗度的language的guidance,我们会去告诉模型下一步做什么。但其实这个不是很不是很具体,然后我们也没有把数据的不同的质量给分开出来,我们也没有很好的去告诉模型这个质量是好是坏。【任至意|Physical Intelligence(PI)研究科学家】
我们如果看一下其他foundation model,我们可以看一下机器人以外的一些这些大模型,他们是解决这些问怎么解决这些问题的,首先我们发现像大约模型会用非常高的context语言。模型可以通过context去理解过去发生了什么,然后下一步应该生成什么样text他们会用system prompt,就是他们会给这个模型有一个大概的behavior上的一个指令,就是说你应该表现好,然后不要去犯一些错误。同时比如说在这个图像生成或者视频生成里面的一个非常通用的策略是把我们的print写的越具体越好啊。这样的话就可以让模型更容易的去生成这个人想要的一些数,就是这个图片或者视频,人specify的更多,那这个细节就会展示的更好。所以我们觉得在这些模型里面,不管是语言模型还是视频模型,图像模型,他们都会用这些非常信息量非常足的context去告诉模型这些数据是什么。然后这样的话可以在最后跑的时候去steer这个模型,然后达到我们想要的这个效果。【任至意|Physical Intelligence(PI)研究科学家】
所以我们在我们最新的模型里面也是采用了这样同样的思路。第一个是我们会去用一个非常高效的video encoder去encode过去的历史的信息。然后我们引入了danced a multi model guidance。这个里面就包括了更加细节的语言的指令,然后也有图像的指令。我们会让模型去生成,比如说这个soft task,现在这个任务做完之后,未来会发生什么?然后用这个图像去指导这个模型下一步应该做什么。【任至意|Physical Intelligence(PI)研究科学家】
同时我们引入了这个episode metal data,就是我们刚才也一开始有提到的就是说这个质量数据质量的打分。然后这个mistake的这个label,我们会把这些label都放在这个context里面,然后模型可以理解这个数据对应的质量。我们这样的结果就是我们左边是我们之前派05的模型,然后右边是我们最新的这个派07模型。你就会看到我们在里面加了更多的这个information,可以让这个context更加完整,然后让模型去figure out下一步的action到底是什么。然后我们最后的结果是啊就是我们最新四月份release的这个模型派07。然后我的总结是它是一个stable model with emerging capabilities。【任至意|Physical Intelligence(PI)研究科学家】
我们通过这些对context的expansion,在训练的时候让模型更好的去理解了这个数据。然后在test time的时候去用这个的prompt去指引这个模型去做具体的任务。然后我们这里能达到的是我们可以用一个模型在没有任何数据微调情况下,就这些任务我们都没有做具体的task specific fine tuning,而是用同一个check point去跑这些所有的任务。然后有一些具体的结果是啊像派06里面,pi python six里面,我们用了不同的数据飞轮,训练完单个任务的这个policy达到了非常高的成功率。在四个不同的任务上面,然后我们派07可以用一个模型就可以match甚至outperform这些企就是之前的这个single task specific policy。【任至意|Physical Intelligence(PI)研究科学家】
然后同时我们也看到了一些非常有意思的,我们也说emergent crossing embodiment transfer。像左边是我们的一个素材源,在采集在方舟无线这个机械臂上的叠衣服的数据,然后再派我们所有叠衣服的数据,都是在这样一个比较low cost static的biome上面做的。但我们发现派07我们可以把这样的一个技能transfer到这个UR five,就是我们工业上用的更多的B上面。我们在这个UFI上面没有采任何的叠衣服的数据。但我们发现这样同样一个模型,可以把在其他整体上学到的技能直接transfer过来。【任至意|Physical Intelligence(PI)研究科学家】
然后我们发现派林奇还有另外一个很神奇的能力,我们叫coaching the robot to do entirely new tasks。因为我们训练出了一个非常stable的模型,我们可以告诉模型去做任何task。那这样的话,其实比如说我们有一个新的任务,如果我们要去采一些数据的话,我们这里的想法是我们可以让人去告诉这个机器人每一步应该具体做什么事情。就是真的是啊我们可以把这个语言非常的具体,人可以告诉我,我们要把用右手把空气炸锅给打开来,然后左手把一个sweet potato给拿起来。我们可以用非常细节的language instruction去告诉模型做什么。然后机器人其实是自己在根据这个指令去完成这个任务。【任至意|Physical Intelligence(PI)研究科学家】
之后我们可以把这个人的指令,这个数据给收集起来,然后去训一个我们的high level policy,就是这样一个hadoop policy。可以去根据现在环境里发生的这个情况,去告诉我们的机器人到底要做什么事情。然后我们就可以通过这样数据采集的方式,去让模型完成一个他从来没有见过的任务。其实在人人在这个里面没有做任何的遥操作作的这个指令。【任至意|Physical Intelligence(PI)研究科学家】
Ok然后对这是我们最近这个派07的这样一个模型的一个能力的展示。然后我觉得我们这里有一些比较比较大的一些license,我觉得首先第一点,我们有一个非常diverse的数据集。这里面不管是任务,还是环境,还是quality,还是策略,如果我们有这样一个非常diverse的数据集,而且我觉得这是一个未来的一个趋势,那我们就需要有足够diverse的context input into the model,去告诉我们模型这个数据到底发生了什么。我们要让模型有足够多的信息去理解这个数据,这样他才不会去学一些错误的一个population。然后同时因为我们用了这样非常diverse的input,不同不同modality的这个context。我们可以在最后跑的时候,用这样不断非常prompt非常diverse的prompt去告诉模型去做什么事情。然后这样可以让模型的能力得到非常好的提高,同时也让我们有一些新的可以采数据这样一个方式。【任至意|Physical Intelligence(PI)研究科学家】
OK结尾我还想再提一下的是,可能我刚才讲的基本上是派在模型研究上的一些突破。然后同时我们也在做我们自己一些可能跟落地更相关的一些探索。我们在今年上半年发了一个blog post叫physical intelligence layer。【任至意|Physical Intelligence(PI)研究科学家】
然后这里面我们就展示了我们跟美国两家去做一些具体的机器人部署的公司。一个是with,一个是ultra,然后wave是更加侧重于这个家用机器人,然后ultra是比较侧重于仓库里面去打包这样的任务。然后我们在过去几个月里面跟他们有了很深度的合作。把我们最新的基座模型跟他们的数据去做具体的具数据飞轮的迭代。然后我们会发现在每一个新的基座模型下面,他们的任务的成功率一直在提高。机器人犯错率在不断的下降。所以我们也想通过这样的方式去跟很多公司合作,去得到最宽泛,最diverse不同本体的数据,不同task数据。然后来打造我们最强大的基座模型。好,这是整个派的团队,非常感谢今天大家的时间,谢谢。【主持人】
感谢任至意先生的精彩分享,为我们讲解了场景经验沉淀与模型泛化能力之间的强关联,也为通用机器人的训练路径提供了全新的思路。人类与生俱来的操作经验是机器人最天然的学习范本。如何高效复用人类示范数据,实现技术规模化落地,使行业热议的关键方向。下面我们的演讲者是斯坦福大学博士,现任佐治亚理工学院交互计算机学院助理教授徐丹飞教授。他的研究方向聚焦于机器人的机器学习方法,尤其是机器人操作规划和模仿学习。他于2025年荣获美国国家科学基金会职业奖。该奖项旨在表彰最具有杰出研究潜力的青年学者,掌声有请。【徐丹飞|佐治亚理工学院助理教授】
大家好,我想第一张图不再说一遍OK这是我第一次在国内登台演讲,所以有一些专业术语其实我并不知道怎么讲,大家还多包含。所以我今整个演讲我会尽量用中文全程讲,但是中间也会可能有一些夹杂的英文,所以大家请多包含。大家可能已经在很多地方看到了,就是有会有新闻之类的。比方说在LA times之前在年初就报道了,他们看到了一些人头上架了一些摄像头,然后在做一些日常的工作。比方说把这个衣服从洗衣机里面拿出来,然后CNN还对此做了一个特别报道,就是他们派了一个记者去体验这些数据采集的工作,甚至这些在美国的一些公司,比方说dora dash,就是送餐公司,他们也开展了一些你可以把摄像头放在头上,然后,把数据卖给公司这么一个业务。甚至你还可以免费的请人来家里打扫卫生,然后以这个数据来换取这个劳动。【徐丹飞|佐治亚理工学院助理教授】
所以这件事情其实我非常的激动,因为什么呢?因为我们的实验室从2023年开始,一直在做于对于人类第一世界世界讲研究的一些工作。然后我想跟大家探讨一下,为什么呢?大家觉得他这个问题的本质是为什么大家会觉得这件事情这么这件事情是机器人学习的未来。第一个可能比较明显的就是说遥操作作其实不是特别的容易规模化,如果要是大家见过在真实场景遥操作作的人的话,那其实这件事情非常难。然后这是一个非常累的事情,因为你需要通过一个操控感来遥控机器人。第二件事情其实可能更加的,比方说更加的不是那么的明显。就是说我们在做遥操作作的时候,其实遥操作作的过程掩盖了一些我们真正的物理智能。【徐丹飞|佐治亚理工学院助理教授】
就是我们现在问大家说物理智能是说我们要把让机器人学会跟世界交互的努力。但是我们跟世界上的能力其实在一种程度上来讲,会被遥操作作的这个界面所弱化。所以比方说有一些东西,比方说揉面,一些从一个桌上拿起来一张薄薄的卡片,你可能需要把它从这个桌上滑滑到桌角,然后拿起来和比方说用肘,用是你的手肘来开冰箱,这些东西其实都是很难以演示,或者说在在这个遥操作作中间演示的。所以这些东西都会被掩盖掉。所以我们的实验室从二三年开始就有一个猜想,就是说人类其实就是机器人的一种形态。因为我们有输入和输出,只如果要是我们觉得能够从通过机器人的数据来很多很多机器人的数据来学习物理智能的话,为什么我们不能通过人类的数据来学习这种物理智能呢?【徐丹飞|佐治亚理工学院助理教授】
现在而且而且另外一个大趋势就是现在人机器人变了一个事儿,就是人性机器人越来越多。所以其实人和机器人的界限会不断的在被笑容,所以人的数据可能会对机型更加有用。所以我们更加激进的一个理论就是说人类的数据其实就是机器人数据。只要我们有足够好的设备,能够把机器人类的数就是视角和他这么多动作都提取出来。比方说这是我们跟mada合作的一个一个演进。然后它可以很精确的把人类的手部的操作信息和人第一人称视角都提取出来。【徐丹飞|佐治亚理工学院助理教授】
这样的话我们前面其实是可以把它当做直接当做数据,当做进行数据来用的。所以这个就是我们第一个我觉得是一个里程碑式的工作。大概二三年24年底的时候,我们发布了一个叫ego moment这么一个这种工作。然后我们我当年也在这个quarrel,就是机器人这么一个大会上做了一个宣传。【徐丹飞|佐治亚理工学院助理教授】
就是我们第一次讲到了我们可以把人和机器人的这个界限抹除这件事情。原理上来讲其实没有那么复杂。就是我们会把一些视觉上的和关节上的这些这些这些这些差距的消除。这样的话我们可以把它同时放到一个模型里面去去训练。这个就是一个transformer,也没有什么特别特别特别新的地方。但只是说我们把所有的东西从上到下,从硬件到软件,full suck都做到了零。人和机器人之间的对齐,这样的话我们其实发现了就是加入人为数据,对于人机器人数据训练非常有帮助。【徐丹飞|佐治亚理工学院助理教授】
然后有一件事情我们发现是为什么呢?是因为我们在同1个小时的情况下,遥操作作会被真实。你用人手做在做一个动作,会效果有些时候会卖十倍。这样的话而且你需要一个机器人在在中间你想到进行这样数据采集。所以我们觉得其实人类的数据应该可以被用作让让这些技术模型机型的技术类型变得更好。我们主持人在这个基础上做一些做一些yellowish,然后说这个东西,但是scientific,它是一个科学的这么一个验证方法。【徐丹飞|佐治亚理工学院助理教授】
然后这件事情其实并没有刚开始其实并没有大家并没有知道注意到这件事情有有多么复合性的进展。直到我们和matter其实做了一个这个公司,大家可能知道facebook这家公司做了一个合作,做了一个宣传片,就是宣传我们这个东西的进展。然后可能后来大家也看到了一些对我们这些的这些进展,但是我的研究一直在进行,所以我可以在这个演讲里面会再跟大家稍微讨论一下我们整个过研究的演进过程。【徐丹飞|佐治亚理工学院助理教授】
就是最开始的时候,我们这两个底层背景的work,一个是maybe play,就是在google 2023年的时候,一个ego mimic,就是在acre 2025年所发布的这样一个work。这两个研究之后我们又进一步研究了怎么样让人类和机器人的数据在在一个空间学习到空间中对齐,然后我们也进而把它放到了这个呃移动机器上,就是它整个的机器人可以动起来,而不是只是上半身能动,下半身也可以动。然后我们最近加入了一些世界模型的一些一些研究,我把这个叫做foundation,就是一个基础的研究。对于整个联合集群怎样做做一对取的这些研究。后来我们在2020年的时候跟一些公司合作,比方说跟physical intelligence,有刚刚阿龙他讨论公司和英伟达也做了一些合作。把这些把把这有一些我们一些一直想想想做,但是没有资源足够资源层的东西在公司里做,做的更大规模化,所以我叫他scaling。然后同时我们在研究,在公司实验室里面也在做一些进一步的比较细节上的对齐。就是比方说怎么样做零销售和人手的对齐,和或者说整个全身操作和人和全身操作的这个企业,最后我还有一些方向上的想法,比方说怎么样做更好的科学研究,怎么样做更好对于人类的数据采集和建模,还有最后的人和机器人怎样做交互,可能有一些展望。【徐丹飞|佐治亚理工学院助理教授】
所以这回的整个演讲,可能我们会聚焦在规模化和对于未来展开的时候,大家跟跟大家进行一些探讨。在规模化上我们其实想法非常简单,就是我们有有一些想法,但是我们并不知道在如果你把数据推掉推上去以后会发生什么。所以我们其实就问了两个简单的问题。第一个就是如果要是你有相对于学术界,比方说我们最开始一个妹妹只有2个小时数据,如果你把数据堆到110万倍会发生什么?第二个就是说如果要是我们把基础模型训练的非常好啊,那么人类是从人类到机器人的这个泛化是不是会变得更简单?是这两个问题。【徐丹飞|佐治亚理工学院助理教授】
第一个问题我们回答的方式也是非常简单直接。就是说我们如何能把人和机器人的的这些鸿沟,就是在在各种各样的层面上摸出。比方说在硬件层面上,这是我们最开始在做一个mimic时候的一个机械。这是我们其实我们是自己亲手搭的,大概在2022年23的时候开始搭的这个,因为我当时其实没有那么多人性机器人。然后后来在伊维达我们当然有很多更多的资源,所以我们联合了sharp,然后这个本体也是信号图的一个一个本体。然后我们做了一个如果要是我们把上半身变得跟人差不多,那么会不会人类数据会更学习人类数据会更简单。【徐丹飞|佐治亚理工学院助理教授】
第二件事情就是我们有了更多的数据。当然刚开始跟大家说的就是现在很多的数据采集数采厂商开始规模化的素材。所以我们也可能也拿到了这些数据,所以我们可以堆到比方说在2020年,今年年初,我们得到了2万小时数据。然后我们会想知道这个确定到2万小时时序到底发生什么。【徐丹飞|佐治亚理工学院助理教授】
这件事情其实没有那么简单,因为我们需要以一种方法来把人类数据或者是机器数据进行对齐。所以我们借鉴了一些在大源模型上面的一些思路,就是我们会做预训练,就是拿人类数数数学,这个人类是人类的数据做预训练。然后我们会加入一些我们叫中期训练,就是在人和机器人大概在同一些任务上做的一些智慧操作。能把它数据收集起来,然后把把这个放在模型里面做中期训练。最后我们会做一些后训练,就是在一些一些比较复杂的事,就是我们要验证的这些任务上面做一些候选列表。我们发现在预训练上面,我们得到了一个非常清晰的scheme log。就是在X轴是一个去log曲线和Y轴是个线性出现这个vineyard,这个其实在很多语言模型上都已经被验证过了。但是这是可能是第一次在可能同时有有一些work,同时也验证过这些个sql。【徐丹飞|佐治亚理工学院助理教授】
在2个小时数据这种情况下,然后在在这个数据在模型里面的这个数据的建模的情况下,并不是说我们机器人的成功率也变得更高了。就是说这个X轴就是我们的训练量数据量,然后也就是我们机器人在某一些任务上的成功率。所以你可以再看到数据越多效果越好啊。嗯然后这样我们做了一些之前我们觉得不太可能完成的一些经济操作。比方说组装一个玩具小车,这是我们可能最一很长一段时间以来,我们觉得做完这个以后可能可能有有一些会不会进行需要有些突破才能完成一些任务。但是我们发现这个其实还挺简单的,做完了就这个好。【徐丹飞|佐治亚理工学院助理教授】
然后另外一件事情就是说人类和机器人的数据中间还是有一些不可磨灭的红包。比方说我和我的手和机器和手自由度其实是不太一样的。所以现在问题就是说如果要是我们的问题就是如果人在他本身的数据里面,他释放了一个任务,能不能直接在机器上作为直接展示出来,就是我之前数据里面是没有任何数据的,这件事情我们进行了一个比较科学验证,就是在机器人上都采集了大概很多的数据。这样的一些,在一些比方说杂七八杂八的一些这些任务上面。然后我们在在一个新的任务上,我们从来没有见过任务上采集了一条机器人数据和100条人类数据。【徐丹飞|佐治亚理工学院助理教授】
然后我们把东西放到数据这个模型里面,我们发现这个机器人通过了110条准备数据跟一条机器人数据,可以学到一个任务的一个比较比较比较比较robust的一个解决。比方说我们这中西医院那个书里面只有卷衣服。然后在后续再加入了人类的耋衣服的这个数据的时候,机器人也会叠了衣服。所以我们后来发现就是在这件事情如果没有去pre training,就是没有预训练的情况下,这件事情是做不了的。所以我预训练和中期训练都是必要,而且可能不是充分,只是必要让让这件事情产生直接的直接的ok因为时间原因,所以我会把这些视频都掠过,然后着重讲一下再再讲一下我们对一些人类和机器人之间的思考。【徐丹飞|佐治亚理工学院助理教授】
我们现在其实做的一些任务,只是把人类和数据,人类和机器人当做一个care,就是一个一比一的关一个一对一的关系。就是一个人和一个高速度的机器人怎么样做转换。所以我们需要中中期训练这些数据,就是人和机器人的就是我们对齐的对齐后的数据。但是这件事情其实不是特别的容易泛化,因为我们需要采集很多的这样的对齐过的数据。后来我们在想,如果要是我们之前那个猜想是正确的,人只是所有机器人中间就其中一个特例。【徐丹飞|佐治亚理工学院助理教授】
那么我们其实是可以通过学习不同各种各样的机器人怎样进行操作,来让这个模型更好从人把他人人人上的人数人数据里面的一些一一些技能转化到机器人是技能。所以我们跟face control的人士进行合作,然后取得这个关键性的结果,就是说你在你的机器。基础模型里面加入更多不同的机器人的本体的数据,会让这个模型更好能从人类的学数据里面学习。X轴是我们这个激素模型里面的一些机器人的多样性,然后外周是它的泛化的成功率,所以这是一个比较关键的数据。然后我们在低维的projection里面也发现了它有更好的对齐。所以我们也做了一些在一些一些比较复杂的它上任务上做一验证。【徐丹飞|佐治亚理工学院助理教授】
这个视频我已经放,因为是不是时间原因,所以这件事情让我们进行了一些思考。就是说其实大家可能也听听过,这个金字塔里头就是我的一个同事和朋友,就是朱玉可教授。他提出的一个底层是要更加容易就更加容易采集的数据,比方说人类数据。然后顶层是一些比较贵的数据,比方说要操作数据。但是其实如果你想如果要是你细想一下我们这个结果,其实说的其实另外一个结论就是说机型数据如果你有足够多机型多样性的数据的话,其实更好从人类数据里面去,就是这个金字塔有可能是反过来的。【徐丹飞|佐治亚理工学院助理教授】
当然我也不是说这个东西哪是属错,付飞,但是可能在规模化的这个学习上面,其实有一些东西对没有一个特别的定论。所以大家可能这个只是一个进行过程中的一些工作。后来后面我可能会进行怎么样进行科研究,这件事情可能我会略过一遍。我还只有三分钟时间了,我们可能可以主要是讲一下后两个,这件事情我大概讲一下,就是因为我其实一直非常想让整个科学界联合起来研究一个问题,就是我们现在做的这个人道书书书,就是这,原告书。【徐丹飞|佐治亚理工学院助理教授】
数据人造机器人这个数据转化的问题。但是很大的一个问题就是说借学术界是没有这样的资源。所以我们联合了一些是联合了一些学校,然后建了这么一个数据。一个怎么说一个数据库,就是人类数据的数据库叫一个verse。然后我们跟一些工作公司一起合作,把这个数据库变成了一个开源,而且大家谁都可以用的一些数据库。然后这是我们做的一些一个宣传盘,就是跟斯坦福ETH还有EDCCMU一起做的一个数据库。然后后来现在学术界也越多的人在采用这个数据库,所以如果大家有兴趣的话可以了解一下。就现在这是这是现在所有在一个里面的一些公司和学校。然后我就我也知道国内有非常多数据厂商来做人类数据采集,所以我也欢迎来探讨一下这个数据开展的问题。【徐丹飞|佐治亚理工学院助理教授】
Ok接下来最后的两分钟我跟大家讲一下,就是我可能比较1一些比较思考,是目前正在思考,但是没有一些结论的一些问题。就是说怎么样对于人类来做一个建模。其实大家就是做机器人到做到现在,过去几年大家其实关注的都是怎么样让机器人做更好的一些经济操作,或者说一些更长重的操作。但是本质来讲,我们现在大部分的结论还是得益于人遥操作作,然后转化到机器人技能这上面。所以本质来讲是我们自己人类的一些先验知识来转化到了机械的一些机能。所以本质上这个问题是怎样对人类来讲,但是现在对于人类建模这个问题其实非常难。【徐丹飞|佐治亚理工学院助理教授】
因为人类你如果你想自己在比方说在做饭,或者这样情况下一下,就是你你知道的东西其实是比你显示出来的东西更多的。比方说你现在正在的一些,比方说一个厨房的场景,然后你接下来准备点火这件事情,并不是因为只是你看到了这个,而是说你之前有一些你会做饭,或者你在一个比方说厨艺学校读过书这样子的这这这种情况,所以你才会决定来做这件事情。所以有一些比方说触觉或者是利益上面的这些这些这些模态,其实我们需要需要更多的硬件上面的基础设施。然后在一些对于长城任务的这些建模上,我们可能也需要做更多各种各样的工作。【徐丹飞|佐治亚理工学院助理教授】
因为其实现在我们的模型发展,之所以我们现在做线的模型,是因为我们现在大部分的数据都是遥操作作模型。但是如果要是我们开始把一些更多的人类的数据放进来以后,这怎么样建对人类建模,通过人人人的数据来对人的建模,其实是一件非常发达的事情。然后最后我想跟大家讲一下,我对后来讲如果要是你看这个计算机发展的历程,其实有一件事情就是人类社会对于一个有智能的机器,是为什么它会接受这个机在机器在这个自己的社会里边,是因为它变得更能跟人交互了。【徐丹飞|佐治亚理工学院助理教授】
比方说最开始的时候,linkery就是一个最早就是1960年1967年的时候,这些计算机其实就是在一个大的机房里面,然后会有专人来操作。然后直到apple或者是这些工厂商推出的个人计算机,个人计算机才走逐渐走入社会。然后在l one就是大大源模型也走过这个趋势。就是在GP three的时候,其实大家都不知道这个东西存在。但是我们做了这个instruction fighting里面instruction tune的时候,他更容易跟人聊天了。所以大家才逐渐觉得这个东西非常有利用,这个东西可以以一种自然的方式来跟他交流。所以我觉得现在这些机选的机座模型,其实处在一个往这个mainframe或者是GPC这个方向发展的阶段。但是我们并不知道他相对应的个人电脑或者说是functional one到底是什么样的一个模态。【徐丹飞|佐治亚理工学院助理教授】
然后如果你看一下真正的人类社会里面,人和人互相的交流或者是合作,其实是一个非常复杂的事情。这不并不是说你对着一个台子在在拿起一个东西,放下一个东西,而是说一个非常复杂的过程。所以我想其实下一步的一些研究方案,应该大家应该我们应该放长,把眼光放长一点,看一些人和人是怎么样进行合作与互相互一起工作的。【徐丹飞|佐治亚理工学院助理教授】
然后我们之前很早很早之前2021年的时候做过一个工作,就是怎么样从人和人的数据里面学习人和机器人的交流方法,和协作方法。比方说我可以把其中一个人换成一个机器人。如果要这一个那个那个人机器人可以一个完美的把其中的一个人的他的一些状态建模的话,他其实也可以跟那一个人合作。所以我们做了一些工作。但是这样的话,这个我觉得不太因为时间的关系,所以我不大家讲了。所以我觉得其实人和人之间交互的数据是一个非常好的开始点。因为现在我们有很多很多这样的这些ARVR这些设备,可以采集人和人之间协作的一些数据了。所以可能之后接下来几年,比方说我的实验室或者一些其他的一些可能实验室后也会我我觉得也会往这个方向往下走。【徐丹飞|佐治亚理工学院助理教授】
Ok最后总结一下就是在分化的情况下,就是在硅数据规模的情况下,我们有一些未这模型有些未知能力,可能我们现在还不太清楚。我们需要进行更多的研究才能发现,我们现在其实数据已经多到可以比我们的研究的速度还快了。所以我们需要更加扎实的把每一个研究做好。这样的话我们可以进行更多的更加快速化。【徐丹飞|佐治亚理工学院助理教授】
然后我们其实需要一个更加学界和产业界进行合作的方式来把这个研究做好。然后就是对于素材和建模,对于人类建模的情况下,其实是一个非常难的问题。我觉得可能大家也也有也有所,所以这些东西其实还有很长的路要走。最后我觉得人和机器人是一定要以一个非常自然的方式来进行交交流和协作的。所以之后人和人之间的数数数、交流数协作的这个数据可能会变得非常的宝贵,就讲到现在,在这里谢谢大家。【主持人】
非常感谢徐丹飞教授的深度分享,清晰剖析了人类示范数据在机器人训练中的技术逻辑与规模化落地的可能性。面向机器人灵巧操作这一核心难题,人类采集数据与仿真场景拓展是两条并行且互补的技术路线。接下来有请genesis AI联合创始人,麻省理工学院计算机科学与人工智能实验室的博士学者王尊玄先生带来线上分享。他研究的方向聚焦于构建能够与物理世界交互的智能体,从数据大脑和身体三个维度出发,以更全面的视角审视可扩展性、可靠性以及对物理屈伸性的显示考量。掌声欢迎王尊贤先生在线上带来分享。【王尊玄|Genesis AI联合创始人】
大家好,我是王尊玄,张三,我是general SAI的联合创始人。今天很高兴在这跟大家一起分享,我们最近真的是AI在打造的东西,然后跟分享我们的一些halloween philosophy and vision。我是很少用中文给演讲,所以有些时候有些词要想请大家多多见谅。所以基本上我们的genesis AI在做的事就是想要去解robotics这个问题。【王尊玄|Genesis AI联合创始人】
然后第一个high level philosophy就是我们认为robotics是一个系统性的问题。然后什么是系统性的问题呢?就是我们会从在构建整个机器人系统的时候,从数据收集,从硬件,然后从middleware control stack,然后到数据采集系统,然后到模型训练,数据的管线处理到evaluation,最后再有一个数据翻译轮。我们会一开始会看这个n to n的pipeline,然后去找说哪边是最重要的pen point,然后去找到最最关键性的地方去做优化。然后我们今天的这个主题就是会为围绕我们如何用系统化的方式去解robotics这个问题。【王尊玄|Genesis AI联合创始人】
然后现在接robotics的问题,大家都是在讲scaling。那scaling在基本上在digital I space or这个LM exactly,就是它已经有很巨大的成功了。所以虽然我们不是非得要往LM这个方向,就是跟他们的这个发展方向相同,但是我们可以以此作为接近。【王尊玄|Genesis AI联合创始人】
所以我们一开始可以先看有这个LM它的大概大致是什么,有有几个stages of training。第一个可能就是大规模的预训练,它就是用一些很多网络上的数据,然后这些数据基本上就是大致学这整个世界怎么运作,然后再来会有一个alignment,然后这个alignment可能就是去去对模型去做某种程度微调。让原本学到的一些很发自己的东西,能够让你让让模型能够知道人类需要他想要人类需要模型完成什么样的事情。然后之后现在越来越多哇这个reasoning for就是一些coding agent或是max的问题出发,那就是很多强化式的后训练,那边就是会有很大量的距离,所coding的环境可以让模型进行交互。然后那边的最主要的最终的目的就是能够超越人类所的极限,就是人类的demonstration,然后可以完成自动的消费improvement。look.【王尊玄|Genesis AI联合创始人】
然后我们在思考robotics这个问题的时候,也可以有点anchor到这几个stages。第一我们对于驭胜令来说,我们就是我们的bat就是在使用人类的数据。人类的数据对我们来说就是有两种,一种是手套的数据,另一种是第一人生视角的数据。然后再来也会有这个对齐的步骤,就是告诉模型现在你确切来说你该做什么task。这个就是会有手套的数据,然后有时候会有一点点的这个robot的数据,最后在做ROPOSTRAINING的时候,就是会有我们有一些很大量的仿真的环境,能够让模型在一起。【王尊玄|Genesis AI联合创始人】
然后首先从这个数据的角度来讲,我们想先讲一个我们的一个belief。就是我们在做的是王楚旺的这个手的pen data strategy,就是想办法让手套跟机器手跟人手都长得一模一样。那为什么会这么做呢?就是我们就是现在看现在这个数据采集的这个方案里面,第一可能会有遥操作作。遥操作作他会有一个很大的问题,就是他很难scale,然后因为有很多硬件的问题,另外他在他的这个手的这个动作上,他很难去完成一些比较0小的操作。然后这里展示的是script而已,但是如果我在他是林超手的话,这个遥操作作就更难了。对,然后另一种方案是UMI,我是handheld device,就是这种的。它在采集的过程中scalability来说,已经远比遥操作作好的非常多,而且他的这个dexterity也好很多。【王尊玄|Genesis AI联合创始人】
只是他有另一个知名的问题,当然这个东西要大规模部署到真实的应用场景的时候,他本质上的是会去影响人。他原本就是工人原本在操作他们手的方式,他们需要一段额外的学习去使用这个can help device,然后去做他们原本的工作,然后双方有些原本的工作也做不到。对,然后这个所以我们基本上我们发展的目标就是我们需要有一个机器手,然后手套跟人手基本上是一对一的对应。然后为什么这个会这么重要?【王尊玄|Genesis AI联合创始人】
就是从我们的角度来讲,我们会觉得我们最后在deploy的时候,我们是专注于灵巧操作,然后跟灵巧手的这个embodiment这样做一米6。然后另一个层面来说,当然也可以有一个argument,是啊你现在embodiment不同,所以你可以借由模型训练的方式或者是representation learning的方式,去让你可以携带原本携带譬如说UMI的pre training data,然后some就是transfer到fine tuning。你可以还是做做零销售。【王尊玄|Genesis AI联合创始人】
但是从我们的角度来讲,如果从系统性角度去看这个问题,那基本上那样子是从模型训练或是算法去解决问题。那我们就会问一个问题是,为什么不从硬件设计或者是从素材设备数据采集去解这个问题?所以基本上我们的重点就是能够设计一套素材系统。第一它能够是非侵入式的,然后可以达到我们说的这个被动式的数据采集。就是基本上能戴上我们这个手套。然后我们现在就是工人他们可能就可以直接做原本他们在做的事。然后如果在在apply这个system approach去想这个问题的话,是在数据采集,在部署的时候会有这个商业上的考量。如果你跟你的商业的伙伴说,你现在需要培训你的员工去使用我们这套系统,那这通常会影响你scale scalability。【王尊玄|Genesis AI联合创始人】
然后第二个层面就是这个手套需要可以让我们能够有很大的程度的对齐。就是我们的硬件,我们最后要部署的硬件,还有一些我们自己数据采集跟模型训练的对齐。然后还有一些就是在我们在那个手套上会有tactile sensing,就可以能拿到一些物理层面的咨询。【王尊玄|Genesis AI联合创始人】
然后我们从数据的角度来讲,我们大概可以从两个层面去看它。第一个层面就是就是它在数据采集的scalability,很很直接明白,就是turn up就是最低。然后像欧米这种肯定好很多,但是他永远会很难比得上纯粹的human data,就是包含glove,egocentric或者是internet video。然后还有另一个层面,另一个维度是这里的动作是action fidelity。基本上这里的意思是指你能不能多多跟这个人类手的精巧程度、灵巧程度,做到重整程度的对齐。那就是你相当于离人手直接操作越远,那它的这个fidelity就越低。所以可以看到就是wolf eccentric会是相对高的。【王尊玄|Genesis AI联合创始人】
然后另一个层面,我们在看待数据的时候,会从他们怎么样被使用在这个训练里面。那训练里面如果是分成预训练跟后训练的话,甚至是任务就是test specific的微调的话,那大概可以分成几个维度。第一个维度就是diversity,就是你能收到的数据多多饭多多泛化这样子。然后这个程度就是一个centric data,就是有最最大优势,因为它基本上就是你戴个头套你就可以收集。不过他第一没有这个物理的咨询,他就是video然后跟handy location,他甚至也不一定有contact dynamics。第二他离deployment很远,他离你的这个robot很远。【王尊玄|Genesis AI联合创始人】
对那第二个层面是第二个维度是这个physical information。Physical information就基本上是你的你的数据里面到底有没有包含这个物理的咨询。那很明显的robot data就是有包含很多物理的自身。然后它floor data就是因为它有这个textile sense,所以它也有很多的物理咨询。所以在这个层面上来说,这就会比一个century data还要好。【王尊玄|Genesis AI联合创始人】
然后最后想强调一点是deployment specific dynamics。这个就是在你在部署的时候,他跟你的部署的场景,就是部署的这个robot setup到底多像。然后这个东西想当然就是roma data就是最重要的,就是最最直接相关的。但是它还是有一定程度的局限性,它可能他cover的那个就是当你在竖收集数据的时候,它的cos比较高,你就不能收那么多数据。所以考虑到这几个层面底下,然后我们在我们的训练的这个training recipe,还有data mixture,基本上会按照一些这几个大思路去想说,我们到底把哪些data用在预训练,或者是meet training,或者是post training,甚至test specific by feeling。【王尊玄|Genesis AI联合创始人】
然后数据下一个之后是我们想要强调的是这个仿真。我们想要介绍就是我们现在是怎么使用我们的仿真。然后我们的仿真是啊我们是怎么去思考仿真零小所泛化,零小所运用的功能。【王尊玄|Genesis AI联合创始人】
首先第一个,我们在在发展这个集中模型的时候,评测是非常重要的。它完全的影响你能够你发展的模型的方向跟你模型迭代的速度。然后就是现在在如果你在真实的世界做评测的话,scalability是一个问题。然后他你每次要做的时候,你就要花很大量的人力跟很robot station在那边做。而且你的平行号基本上是从Operation的角度,作品信息化就能做得到,但是boss很高。【王尊玄|Genesis AI联合创始人】
然后第二个层第二个问题是reproducer ability,尤其在越南的test底下,就是很难去reproduce完整的过程。然后在一些真实的场景里面这件事更严重。对。【王尊玄|Genesis AI联合创始人】
然后第二个层面是如果就是现在有他大量的learning from demonstration之后,如果要发展到learning from experience或者是做强化学习的话。那这件事如果发生在甄姬甄甄姬上的话,他就会有出现很多问题,就很慢。或是会有安全性的考量,或是这个硬件的durability的考量。对,所以从这个角度来讲,我们就相信我们的发展这个genesis from能够把这个仿真推到这个fidelity的机制。那我们就是纺纺就是就是rendering跟physical的方向走。然后我们的目标就是往他的fidelity很高。Fidelity这边的定义,当然可能最后就是你能不能被用于这个robot learning上,或者是用于robot evaluation上。【王尊玄|Genesis AI联合创始人】
然后另一个程度的可好像是我们在发展,我们在开发我们的stack就是same infrared的时候,很大程度会去考量到它的efficiency。就因为如果我们要跑大规模实验的时候,很多时候它的平行化可能是一个很重要的事情。然后最后我们在开发我们的这个物理的算法的时候,很大程度是driven from我们的这个评测的需要。就是局域来说,我们觉得现在的这个contact dynamics不太好,那我们就会去往contact dynamic那个方向,继续推进他的这个fidelity。【王尊玄|Genesis AI联合创始人】
然后如果我们一开始最最最一开始在甚至在公司发展之前,我们大家如果有防了我们的话就知道我们一开始是有一个genesis的physics engine。然后那时候我们做的一个最大的push是啊生成式仿真。然后这里想要跟大家分享一下,就是我们为什么创新从从开始生成是仿真for robot learning,所以这个其实比较像是learning from experience,或者是你生成仿真数据,然后去做模型训练。一开始是这个目标,那我们现在怎么会转变成以前做评测再做learning for experience。其实我们的目标都是一样的。然后只是我们一开始在做很多研究的时候发现,learning from synthetic data是一个二阶效应。【王尊玄|Genesis AI联合创始人】
你可以看右边的这个图,基本上是你模型要跟这个仿真环境去做互动,去生成数据。然后生成这些仿真数据之后再去做模型性别。然后最重要的是你这个模型训练最后能够在real中可以work,要不然你在信中可以work,可以意义不大。所以你在研究说这个生产仿真数据的时候,你就是要有两个阶段,这个是比较复杂的。所以我们就是有其他考量,那就是可不可以先把评测这件事做到极致。这也是我们最近之前发布的,就是像他左边这个图,就是横轴跟纵轴分别是sin跟real的这个test performance,所以我们就是尽量把fidelity推到极致。Fidelity这边也定义就是直接定义在这个你能不能把用仿真去做很好的这个模型评测。【王尊玄|Genesis AI联合创始人】
然后这整个发展的过程中,我们最后的目标就是会需要会有这个inner outer outer loop。就是我们最后的这个north star,就是我们能够去让physical AIA也是说是任何机座模型,它能够在仿真里面做self evolution。然后现在如果能做到那样的话,基本上我们就可以把一个被real time局限住的东西,就是如你一直去actively collect experience。这样是从一个现实的问题直接转换成你可以scale compute,你就能解决。就越大的compute你就可以直接把你的performance推的越好。【王尊玄|Genesis AI联合创始人】
确切来说,它就是会是像图图的这两个loop,就是左边这是inner loop,就是你的physics and agent,就是会跟仿真环境去做很很大量的互动。那可以想象一下,其实它就是跟比如说coding agent一样,我们想要建,比如说10万个房间环节。然后这个仿真环境里面都会有AI,就是会有我们的这个模型去跟他去做交互。然后交互之后就可以得到一些分数,然后他可以去做类似barrier层面的更新。然后这件事他需要去被一个outer loop所支持。【王尊玄|Genesis AI联合创始人】
这个auto loop就是在我们要确保我们建的这些访客环境也都是跟真实环境是一样的。这不只是提问题,甚至是啊我们说你建的场景里面跟现在真实事件里面真的有用的应用场景是不是有关。我们是不是能真的从这个商务的use case,就是实际上的use case里面,就是工厂里面,我们是不是能真的造出了那些仿真环境。然后那些仿真环境是真的现在workers在工作的环境,然后用那个feedback去去引导我们去噪这个仿真的环境,然后有这个inner outlook就是我们的最终目标。【王尊玄|Genesis AI联合创始人】
然后最后就是想要提一下,我们是如何看待模型这件事的对。基本上我们现在模型的时候,我们其实不太注重模型架构本身或是我们的看待模型这件事。我们就会认为可以想想审查是一个很巨大的模型,然后我们更在乎的是他的input跟output,然后跟他们的他这些input outputs所带的资讯。如果他带的资讯是有history的话,那是不是你可以去猜,这几个robot dynamics他可不可以做self calibration。或者是在不同info output的这个combination底下,它是不是一个policy问题,或者它是一个invert dynamic问题。对所以我们最重要的就是发生主要是去找到一个整个training recipe,然后不一定是model architecture,就是能够让我们去吸收大量的不同mobility的数据跟能够去使用large scale data。基本上这件事就是可以反映在我们去如何看待这个数据跟模型的研究和and engineering上。【王尊玄|Genesis AI联合创始人】
基本上我的effort就是basic percent,就是scale data。那scale data里面就是包含我们的手套数据,然后第一人称这个培训预训练的数据,还有data CONTECTION、ALIZATION可以看到。最后就是我们的这个访费环境,就是大规模的访费环节。【王尊玄|Genesis AI联合创始人】
我们有少量的20 percent effort的话,在算法层面的improvement,就包含模型架构或是lesson reliability。这可能就是跟一些比如说offline RO或者是human in the loop data collection有关,然后给人大部分抹掉而有算法。然后我们是如何想,就是我们模型的方向,就是我们模型发展的这个目标。基本上我们的scaling的目标就是for instant deployment。Instant deployment但我们的看法就是可以从一个简单的中间这个式子去去理解。就是当你的这个performance,那performance的定义就肯定是这一个是test performance,或者是可以从部署的角度来讲,就是你部署可能客户会有很多不同程度的考量,cause of failure或者是你的速度,就是各种那些都算platforms。可能我是达到一定的程度底下你需要花多少针对这个任务所产生的effort。对,就是这个effort是不不只包含说我是不是只用了1个小时的这个任务的数据,但甚至是包含你这1个小时是怎么样收集出来。【王尊玄|Genesis AI联合创始人】
所以1个小时的telephone数据跟1个小时的手套数据在effort层面上来说是完全不一样的。所以我们发展的目标就是想办法把这个test specific effort推到如此。我们现在的基本上初步的一些结果就是左边这张图就是纵横轴是运动compute,纵轴是我们有一系列circulation benchmark。然后每一点这边大概都是将近210个小时的这个robot human hours。然后我们可以看到就是在月度预训练的数据底下,它的这个zero shot generalization效果就比较好。然后右边这张图就是更接近,直接去显示这个instant deployment。纵横轴横轴也是越来越多预训练数据。然后纵轴就是当你做这个一定程度的test的设计,fine tuning的时候,它的这个performance的效果如何对。【王尊玄|Genesis AI联合创始人】
然后最后我想用在这个问题去总结一下我们在思考的事情。就是我们一直在问这个robotics是不是一个局部的问题?然后为什么这个问题很重要呢?因为这个问题很大程度会影响到我们去如何分散我们的资源。尤其是在说在发展这个机构模型的时候,data跟compute是最重要的那我们需要用什么样的data,然后把图片放在什么样的东西上,就很大程度取决于就可能可以被跟这个问题是有关的。【王尊玄|Genesis AI联合创始人】
有一种可能性是,如果robotics不是一个local problem,那么它就是上面这个就是我们这个physical AI或者robotics本身,它就是就是你没办法你没办法法去用一些pretend model,或者是它这个本身你没办法不strap from essay这个大模这个大语言模型的成功。那这样子你在收数据的时候,你就去可能需要去考虑到好几层。你可能连那个high level reason for cognition那些,你都需要画你的运算资源或数据,或你的任何资源去去处理那些事情。但有另一种可能性就是会去我们比较相应的事情,就是它是一个局部问题。【王尊玄|Genesis AI联合创始人】
局部问题的意思就是我们可以把这些robotics这种问题拆成有好几个层面。最上面的那一层就是你看到上面这个有点倒金字塔的图。就是cognitive capability,或是reason,或者是high level planning这些东西,其实不是一个robotics problem。它可能是你可以借由visual AI那些方向,就是multi model LM的方法去能够去解的问题。然后直接再看最下层,最下层就是motor level control。【王尊玄|Genesis AI联合创始人】
如何先不管你的high level completion,就是你这块你怎么去控制你的这个肌肉,然后去整个去感知到这个物理世界,就是比较偏向是reflex的东西,或是一个dexterity。就是你你在使用你的手的时候,其实你并不会经过很可能高层次的思想。对那这个东西那这个东西就是一个比较局部的问题。所以我们在认为这个问题上,我们就会发资源在好收集。比如说这相关的数据,然后跟这个low level的motorcycle,如何跟high level cognition的结合,就是他两个之间他可能有model mapping。那我们需要收集什么样的数据,才能够可以让我们解底下这两层。所以总结下来说这些就会有很多问题可以去回答。【王尊玄|Genesis AI联合创始人】
然后这些问题都跟我们去怎么去分配我们的资源,尤其是数据,跟运算资源有个像是我们需要怎么样的数据,或是甚至是我们是不是去可以需要from stretch去做robotic spring training,我们可不可以用以及的pretend model。最后就是如果我们either认为它是local或者是global,就是这个东西最后能不能拿到最终点这样所以总结上来说,这就是今天想要跟大家分享的我们现在是CI正在做的事情,跟我们的一些unable celestial seat。然后这边有很多例子,就是我们之前发布的不同,就是灵巧高灵巧的任务就包含有然后有label tomato,然后做milkshake,然后was wearing harnessing,然后还有更多,可以到我们的网站去看。我们现在在在推广继续push的方向,就是可以做到这些东西都是很真实的真实场景。然后我们就是今再把我们原本是在这个lab的场景,就是往这个真实世界的部署这个方向去做推进,然后去能够做到完整的闭环。以上就是我今天跟大家分享的,谢谢。【主持人】
感谢王泽贤先生带来的产业实践分享,让我们看到了人机数据采集与仿真扩量结合,能够高效补齐灵巧操作场景下的数据短板。接下来让我们把视线从全站的系统回到一个困扰行业多年的问题,如何让机器人在真实世界规模化。我们的演讲嘉宾是dana联合创始人马也骋先生兼首席科学家。他与宾夕法尼亚大学获得博士学位期间,开发了可扩展的强化学习算法以及用于机器人学习的基础模型。其研究结果获得了包括2023年nvidia十大研究项目在内的多项荣誉,并受经济学家fox等知名国际媒体的关注。接下来让我们掌声欢迎dana robotics联合创始人兼首席科学家马也骋先生。【马也骋|Dyna Robotics联合创始人兼首席科学家】
Ok大家好,我是马野晨,我是Daniel robotics的联合创始人首席科学家。然后首先想感谢主办方智元和觅蜂科技的邀请。我今天跟大家就来分享一下我们在dynamic robotics的一些最近的发展和我们在做research和deployment一些看法和一些思考。好看。【任至意|Physical Intelligence(PI)研究科学家】
一下。【马也骋|Dyna Robotics联合创始人兼首席科学家】
这样。对,所以我们banner是在2024年9月的时候开始的。然后我们的思路就是说他在research要做这个基座模型。然后在做模型的同时也要把这真正世界的deployment,就是垂直落地和找不同的落地场景都要一起做。之所以我们要这么做的原因就是说我们发现如果在实验室里做模型,然后收集数据,然后做模型,其实是跟这是世界各的各家商家和不同场景他们需求的东西其实是非常不一样的。所以我们在做research的前提下,我们也在做很多product deployment。所以可以用这个deployment去做我们做研究做大模型的一些验证。【马也骋|Dyna Robotics联合创始人兼首席科学家】
然后在做deployment的时候,我们也发现,就是在真实世界里,如果我们要想把这个聚身这个模型真正做下去,还有什么还有什么不同的问题和什么的gap。这样也可以让我们在做research的时间和情况的时候,把research做的更好,挑方向也可以挑的更准确。原来在robot learning这个领域时代,其实可以做东西有太多了。然后像我们前几位嘉宾也讲到了很多不同的思路。我们发现把deployment做好的时候,就可以让我们的research的做法和做什么方向做的特别精致。然后我也想在今天的talk里也把一些我们做的工作也可以稍微讲一下。然后首先我们要做的就是robot foundation models for manipulation。这个大家也可能熟悉,所以我也不用多讲了。【马也骋|Dyna Robotics联合创始人兼首席科学家】
首先我们要收集一些数据,然后把这个数据放到模型里,这样的话这个机器人就可以自己autonomously把这个任务给做了。然后如果你想做foundation model的话,那就要收集很多很多海洋的数据。然后我们在Diana的想法就是不同的数据都可以用上。这个底层就是海量的,比如说互联网的数据,或者是这个人第一视角的数据。然后中间这一层就是在真机上可以是还可以收集海量不同任务不同场景的数据。【马也骋|Dyna Robotics联合创始人兼首席科学家】
但是在最这个金字塔最上面最有用的数据,而是就是在我们做deployment file,做飞轮的时候,收集大量真正高质量在真正应用场景的数据。然后在应用场景里犯错,然后从那些错误的啊啊啊环境里,这个robot怎么去recovery这些数据。然后把这三种不同的数据都混在一起,我们就发现这个预训练可以做的特别的好。然后今天我们这个预训练的数据量也已经超过20万小时的数据。【马也骋|Dyna Robotics联合创始人兼首席科学家】
然后接下来我也会给大家看看我们这个预训练之后,模型在做post training的时候可以做过很多很多不同的人物。做的时候这个post training的数据要求数量质量也会逐渐降低。然后我们在模型上是引用了一套system one和system two的这种做法。【马也骋|Dyna Robotics联合创始人兼首席科学家】
我们发现在做system one的时候,我们今年发现用world action model,就是在这个世界模型的基础下做robotics control的效果,其实是比我们曾经在BLA做的,其实是会更好的泛化的数量的就是数据数量的要求会更低。但是如果只做一个system one的模型,其实是我觉得在真实世界落地是不足够的。我们还要加一个reasoning model,可以让这个整套系统做一些很长长的任务。然后有这一套架构和20万小时的数据之后,我们就发现其实在做一些新的任务,或者做一些很难的任务,其实可以很快用几个小时不到的数据就可以做的。然后这就是我们的一些例子。然后中间就是我们教我们的机器人怎么拿刀去切芹菜。然后这个任务我们的模型就是用一两个小时的finding数据,就是可以无限性循环的做,然后就没有任何的错误。【马也骋|Dyna Robotics联合创始人兼首席科学家】
然后在左边我们也做了一些对这个精准的要求特别高的任务。就是把这个杯子打成一个塔一样,对吧?然后这里其实你出错一次,这整个塔就会倒掉,然后这整个任务就已经没有办法继续执行。然后在右边的话,其实我们也在,这个其实是一个真实应用场景里inspire的任务。然后这就是把不同的这种创口贴都放到一个盒子里。如果你仔细看的话就会发现其实窗口就特别的薄,然后跟桌子的这个颜色也是差不多的。所以对于这些任务的精准的要求特别高。【马也骋|Dyna Robotics联合创始人兼首席科学家】
我们发现在这个预训练语音应用大量的数据,尤其把deployment数据给加进去之后,这个post train就会特别影响。然后接下来这就是我们在post training里做的其他的一些不同的任务。然后这些任务有一个特别有意思的地方,就是我们在dynamic很多这些后训练的工作,已经不是我们研究成员要做的。我们可以我们公司里很多就是刚加入公司的这个数据收集语言,也可以他们自己收集很小的数据,然后这个就可以把自己的任务也做出来。这就证明了我们在把这个模型整个架构,把整个套,比如说收集数据,训练模型做验证。这个系统能不能打好之后,就可以达到可以让任何人自己去收集数据,然后完成word自己喜欢的任务。【马也骋|Dyna Robotics联合创始人兼首席科学家】
然后我觉得这个对长期我们公司做这个产品的形态也是有很大的帮助的。因为我们最后的目标是把我们的模型和我们的机器人送到千家万户,送到各种不同的行业,都可以去解决他们不同行业他们自己想做的任务。所以把这个底层基础任务做好,就可以达到这样的繁华性。然后这也是其他一些我们自己数据收集员工,他们自己想出来任务,然后自己去做。然后中间还有一个是啊折系鞋带这个任务,不是这个鞋带,就是这个。【马也骋|Dyna Robotics联合创始人兼首席科学家】
然后这个模型就可以记一次,然后就解一次记一次就解一次,然后也就达成了自己在真实世界里self improve的这种效果。然后发现把这个模型这一整个架构搭的特别好之后,这个模型的泛化能力其实是特别强的。我们这里就是一个不需要post strain就可以做抓取的一个模型。然后你就发现他可以再抓取任何任任何物体,然后没见过的也可以转。然后现在你就可以看见我们在做医疗的时候,我们可以把不同的object都放进去,然后有不同的这个盒子也可以用。其实我觉得这里最惊讶的就是把这种data driven method做好之后,就会不同的object都可以抓。然后你不需要在每一个object上就是要想,比如说这个物体的这个几何,这个geometry长成什么样儿。然后特地去搞一个抓取的模型,然后这个模型就可以不需要任何task specific fine tunnel的情况下,在不同的container,不同的物体都可以去抓。【马也骋|Dyna Robotics联合创始人兼首席科学家】
但是我们我刚刚给你们看的这些所有的拍的视频,都是在我们实验室里做的。如果我们想把我们的机器人和模型从实验室带到真实世界里的话,那接下来最重要的研究问题是什么呢?在我们看来,我们觉得最重要的问题是把这些模型都做的特别reliable,就是说成功率特别的高。他可以不停止的就是无线的继续续航我不不会出错。【马也骋|Dyna Robotics联合创始人兼首席科学家】
但是现在我们robot learning这整个领域,其实我觉得最难的问题就是我们有很多这些generalist model。就是说通用模型。一个模型可以做很多任务,但这些模型的话做每一个单一任务的成功率不高。所以我们的mission就是说如何把这些模型既做的又可以通用,也可以在一些固定的任务里把这个performance,成功率做的特别差不多。【马也骋|Dyna Robotics联合创始人兼首席科学家】
因为我觉得如果成功率不高的话,其实是啊没有很大的商业的价值。因为在真正部署,真正deploy的时候,你必须成本率特别高。这样的话才能帮下游的这些公司真正达到商业价值。所以如果我们想拿到这个突破的话,我们最重要的工作是什么?所以我接下来也会讲一下我们在这方面的工作。【马也骋|Dyna Robotics联合创始人兼首席科学家】
所以我觉得要把这个模型做的成本率特别高,或者真正的部署能泛化,其实是有两个问题要解决。第一个就是要把一些特别复杂的任务,在成功率在一个某一个固定的场景,在固定的环境里,要把这个success rate做的特别的高。其次就是在这个前提下,如何能够把这个同样的模型在不同的环境里都去跑,然后都把这个success rate做的不会下降。所以在研究这些课题的时候,我们也在商业部署的时候去找一些任务。【马也骋|Dyna Robotics联合创始人兼首席科学家】
然后我们找到了第一个任务,就是我们在做公司的时候,第一个发现的任务就是在餐厅里。则餐厅这个任务其实去国内或者海外各种财经都会发现,在一些比较高上层的这些餐厅里都会有这个任务。然后这个任务其实是特别的难的。因为要折餐间的话,就首先要在一个stack里,要把一个餐厅给首先取出来。然后取出来之后叠好之后,其实各个餐厅对这个餐厅叠完后的这个需求都不一样。然后他们有时候就比如说在右边你可以看到一个grade five和grade three的这个参见的区别就是有11毫米的1厘米的区别。【马也骋|Dyna Robotics联合创始人兼首席科学家】
随着这种精准更精准的要求特别高的任务,如何能把这个模型达到百分之百,这是我们一开始做的研究。所以我们第一种思路,第一种做法就是作为一个VLA,首先在海量的数据里做pre training,然后再做post training。这样做的话其实已经达到了当时的sota,就是说在这个任务上可以达到80%的成功率。但如果达到只有80%的成功率的话,那如果我们要求这个机器人可以一口气折100个餐厅的话,那这个成功率基本上就是0%,对吧?所以你可以看这个视频,它一开始做的还不错,但到后面它就会卡在一些错误的环境,然后它就没有办法去recover。所以我们如何能把这样的VOA或者YM模型做到百分之百的鲁光线呢?【马也骋|Dyna Robotics联合创始人兼首席科学家】
这就是我们data one模型,是我们去年7月份发布的,所以现在也有差不多有一年了。然后这就是我们的一些demo。你可以看这个视频里后面这个中他其实跑的挺快,其实就是证明这个时间一直在飞,然后我们一直叠了八百多个,在24个小时没有停止的情况下,然后我们现在的话这个模型也达到了next level performance。就是现在可以throughput速度已经达到了我们dynamo的时候的两倍的速度了。所以我们是如何达到这种鲁棒性的?我们的突破就是在内部里训练一些叫reward model,就是奖励函数模型。所以这些模型它到底是干什么的?【马也骋|Dyna Robotics联合创始人兼首席科学家】
它的作用就是你给这个模型输出一个做任务的视频,然后他就可以很精准的从0到100,在每一张都预测这个罗宝在做这个任务的时候,已经完成了百分之多少的任务。所以如果有这样的精准模型,可以在任何一张图片都可以告诉这个模型它已经完成多少的话,我们就可以用这样这个模型去找针对这个模型现在他其实在做这个任务的时候,不好的就是做的不好的环节继续去做很针对性的这个human in the loop的这种data collection。然后这张图,这个视频我就可以稍微解释一下这个是怎么做的。【马也骋|Dyna Robotics联合创始人兼首席科学家】
你看我们这个robot现在已经达到90%的成功率了。所以他大概只有每一张餐巾的时候,你可以看这个prediction已经从0到百分之百已经好几次。但是如果这个robot或者这个模型它真正在某一个环节卡的时候,你就可以看见从领导把这个弧度已经不是特别献血了。就像现在对吧?你看现在这个机器人在这个第九章参见的时候卡住,所以你可以看见他这个progress已经不是从0到100特别smooth的网上,而是在中间有这些波动。所以这些波动的话,你就可以在事后写线下,你就可以针对性的去看是什么样的错误环境让这个model犯错。然后在这些错误的环境就可以在在在花很大的功夫把这些recovery给收集。【马也骋|Dyna Robotics联合创始人兼首席科学家】
然后这样的active learning这种loop其实做几次做两三次环节就可以达到一个特别好的效果。然后最后就可以训练出一种模型,它可以在不同就任何错误环境它都可以recover。所以这里我给你放一个,我们在跑24小时实验中真是发现发生了一些场景。你就可以发现在这个视频里,这个机器人他不小心一开始把这整个stack全都给拿过来了。所以就是他这个模型他自己能意识到有这样的错误,然后他就发现要去recover它,就有很多不同的strategy去把不同的餐具都分开,然后就一张一张张一张张的区别。【马也骋|Dyna Robotics联合创始人兼首席科学家】
其实让我最惊讶的是,其实在这种柔性柔性物体去做manipulation的话,这其实有太多不同的不同的configuration。所以其实是不可能把所有的不同的错误环境都收集,对吧?但是我们发现如果能收集的就是一些recovery data的时候,这个模型就已经达到在这个错误环境recovered很强的generalization。它就可以用很多很多不同的策略去尝试从这个error state to recover。然后这就是你现在看的这个视频。然后我当初我们当初跑实验的时候也很强,因为很多情况我们根本就没有数据。然后这个robot就可以继续续航,最后把这个整一个stack全都给折好。然后我觉得在模型能达到这种鲁棒性的时候,就真正会产生商业价值。【马也骋|Dyna Robotics联合创始人兼首席科学家】
因为就是不需要人去监督,他就可以自主的把一些很难的任务都完成。然后接下来用同样的这种reward model,还有一件可以做的就是把这个模型部署之后,我们如何在这个落地场景里也知道这个模型它每一天的performance到底有多好。所以用同样的系统,我们可以算他一天折了多少餐巾,折了多少T袖。然后可以也可以从中发现,比如说他有一个餐巾或者有一个毛巾,他得的特别慢,他到底是为什么得得那么慢?然后有这样的harness的话,就可以在deployment的时候有很多的visibility。【马也骋|Dyna Robotics联合创始人兼首席科学家】
然后让我们模型继续在真实环境里做deployment file will把很高质量的数据,然后把模型为什么是错的这些非常珍贵的信息都反馈给我们研究和技术团队。所以用前面这个model of the replication stack,我们就可以做这种histogram。就说哦啊在每一天部署的时候,它平均的速度是多少,然后最快的速度,最慢的速度,然后有什么样的非常interested in the case都可以抓取。所以我刚刚讲了如何在一些特别难,就是压缩特别高的任务做的很reliable。但接下来如果我们只能把这个model在一个环节能deploy的话,那其实不是特别的scalable。所以接下来要做的就是如何把同样的scale,同样的模型在不同的环境里都deploy。所以这是我们去年在,等一下,这个怎么回去?【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
okay.【马也骋|Dyna Robotics联合创始人兼首席科学家】
那我直接就跳过放这些视频,所以这些视频就是我们在一些真实应用场景。所以第一个视频它左边是一个餐厅,第二个是在一个洗衣房,第三个是一个在一个宾馆。我们的模型和机器人都是第一次就放到这个environment,他就可以开始开工。然后帮这些公司把一些人力要求很高,然后又很累的工作都帮都可以帮他们自动化。然后这也是我觉得对我们一年下达研究的一些很好的验证。【马也骋|Dyna Robotics联合创始人兼首席科学家】
因为我觉得其实从实验室到真实场景里部署的话,其实这个gap还是挺大的。所以在中间也有很多的坑。然后我们也发现如何在不同的环境的deployed的时候,也把一些这些laser都反馈到做预训练的时候。所以每一次做预训练,然后每一次做下一次部署的时候,都可以让这个部署的时间越来越短。所以我现在也总结一下,所以我们公司目前做的就是首先把这个基座模型做的特别好。然后在这些基础pre train模型的情况下,如何让任何人我都可以去做的特别好,成功率特别高。然后接下来就把同样的这些模型做一些泛化的post training的工作。所以可以让他在任何环境里就deploy,然后没有一些performance degradation。然后我们在上海也有一个团队也在招人。所以如果感兴趣想跟我们进行交流的话,也可以加一些我们公众号,然后我们微信的一些码也在这里,所以大家可以扫一下,我们可以线下交流,然后谢谢大家。【主持人】
十分感谢马爱成博士的赶火输出,为我们拆解了真实场景下机器人规模化学习的落地方式。至此上午六位重磅嘉宾的主题分享全部结束。相信在座的各位来宾和线上的观众对于物理AI当前的机遇和卡点都有了更多的思考。接下来我们正式进入本次论坛最受关注的圆桌环节。本场圆桌主题为scaling love的物理强,物理AI如何迎来智能涌现。【主持人】
首先介绍本场圆桌主持人,智元AI算法总监任广辉先生。同时有请本轮圆桌嘉宾上台落座。智元合伙人,觅蜂科技董事长兼CEO姚卯青先生,physical intelligence研究科学家任至意先生。佐治亚理工学院助理教授徐丹飞教授。Dana robotics联合创始人兼首席科学家马也骋。腾讯首席科学家,腾讯robotics x实验室主任张正友教授。Sunday robotics联合创始人兼CEO赵子航先生。【主持人】
接下来将由任广辉先生主持圆桌交流。各位嘉宾将围绕行业核心痛点展开思想碰撞,深度探讨物理AI该如何翻阅scanning love带来的物理边界。好,各位嘉宾可以按照我们大屏幕上的。【主持人】
接下来把掌声交给台上的各位嘉宾。【任广辉|智元AI算法总监】
各位嘉宾,各位朋友,大家早上好。欢迎来到自起具身论坛2026的圆桌讨论环节。我是今天的圆桌主持人任广辉。我们今天圆桌的主题是screen的物理墙,物理AI如何迎来通用智能涌现。过去几年large language model通过数据算力还有模型参数的持续scaling,迎来了非常显著的智能涌现的效果。但是到了物理世界,智能还是面临着非常复杂的真实世界的环境,所以我们也实现物理智能的涌现,还是面临着更大的挑战。【任广辉|智元AI算法总监】
刚才几位老师关于物理AI的最前沿的方向都有一个非常精彩的报告,然后大家也都听的意犹未尽。然后我们的猿桌讨论也是非常荣幸邀请到了当前具身智能领域的,可以说在全明星阵容。然后的话相信大家和我一样有非常关心的问题。然后我也带着大家的这样的一个关心的问题一块和他嘉宾一块讨论一下的。首先我们想从这个数据聊起,我们都在谈论这个机器人的checker DBD时刻。那么我们一个很直接的问题就是如果我们想实现机器人的THTP时刻,我们需要扩大规模的数据以及各个数据的组成或者什么?这个问题我首先想我请教一下姚总。从姚总他同时具有这个资源全站还有觅蜂科技的数据平台这样的一个视角,想请姚总给我们解答一下。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
好的,那我可能就先说说我自己的观点。刚才在包里和大家分享了目前看起来的话,语言模型的预训练,大家都头部团队到了100万亿tokens这样一个语料,可能对应100亿小时的这种正常的说话。那从矩阵数据来讲的话,目前这个规模还是差了可能有1万倍以上的这样一个差距。物理世界我认为其实理论上来讲更复杂,它噪声更大,而且信息的荣誉也更大。那么要达到GPT时刻,首先我们要定义一下,我认为chinese BD就是说能够在物理世界里面去开箱即用,完成一些日常的一些任务。并且是可以去跟随一些开放式的自然语言形态的一些指令。做到这样一个程度的话,我认为可能是需要这个1亿小时级别的数据,才能够去掌握对物理世界通用的一些运行规律的影视的理解,再到开放式指令的理解,到规划,在到常见任务的一些基础的成功率可能在70 80左右。我觉得zero shot去开箱启用能够达到的一个效果。【任广辉|智元AI算法总监】
Ok感谢姚总从全局视角给我们这样的一个分析。然后我想第二个我想问一下线上的赵总。对,然后因为最近这个Sunny robotics也发了最新的模型,这个actual。而且Sunny body应该是行业里边最早利用这个women数据的一些创业公司,他们也是这块的一个非常先驱者。然后的话所以我想问一下,赵总怎么看待刚才的问题,以及5米数据在其中会发挥怎么样的这样的价值的对吧?【赵子豪|Sunday Robotics联合创始人兼CEO】
我认为这很大程度上取决于我们讨论的时间范围。如果看未来几年,最重要的事情是扩大预训练数据规模,而这要求数据具有规模化和无偏性。所谓无偏,是指你把采集到的动作在机器人上重放,机器人也能够完成相应任务。【赵子豪|Sunday Robotics联合创始人兼CEO】
在这些约束下,UMI几乎是一个理性的选择,因为它不存在本体差异,而且成本非常低。总体而言,我认为UMI是一项非常出色的技术,我们都应该充分利用。但从更长期来看,当机器人真正部署到多样化环境中,部署数据的重要性会进一步提升。【赵子豪|Sunday Robotics联合创始人兼CEO】
这和大语言模型阶段有些相似。大家会谈到递归式自我改进,我能想象一种系统:分布式强化学习在整个机器人集群上运行,机器人利用自身的部署数据不断改进。但我想强调的是,这只有在机器人实现多样化部署之后才真正有意义。【赵子豪|Sunday Robotics联合创始人兼CEO】
如果机器人只以非常狭窄的方式部署、只执行少数任务,那么这些数据对更广泛的通用智能帮助有限。可以类比ChatGPT:它有大量用户,但用户反馈数据并不是提升前沿编程能力最有效的数据。总体而言,短期内我认为UMI数据可能是推动智能进步的最高杠杆;但从更长期看,部署数据最终会成为最重要的数据来源。【任广辉|智元AI算法总监】
Ok感谢赵总的分享。然后我们沿着刚才赵总说diverse的这个方向发展。刚才徐老师也在台上分享了非常多ego的。然后我想问一下徐老师怎么看待这个问题,以及易购在其中会发挥怎么样的作用。【徐丹飞|佐治亚理工学院助理教授】
我觉得从一个更大的角度,就是更高的角度来讲,我们其实。数据收集这方面,如果我们看到这个数据收集的产生影响的这个鼻祖就是image net对吧?因为现在是怎么被收集的呢?是他们最开始建了一个叫sensex,名词的这么一个树状结构。然后他们会在每一个树的每每一个每一个层级会收集数据,然后以为什么要这样做呢?是因为我们需要以这种方式来做多样化的一个,怎么说,就是我们要把这个数据变得科学的多样化。但是我们现在作为最人类数据,就是在人类行为数据上面,其实并没有这么一个没有这么一个树状结构,或者是这么一种统一的这种规范化。所以我们我觉得我们现在可能还是在一个非常早期的探索阶段。就是怎么样能让我们收集到更加更更可能多样性的数据上。【徐丹飞|佐治亚理工学院助理教授】
当然当当刚刚才tony说的replay,就是说怎么样能把这个数据真的在真机上replay。然后怎么样把每一条数据都可以在真机上,就是每每一个任务都可以在这上重新在reproduce,这个事情也是一个非常重要。所以我们要在diversity,就是在多样性和真实性,就是在从人到机器人这么一个转化上面都都需要下下很大的功夫。对。【任广辉|智元AI算法总监】
ok刚才前面两位都谈了更多的是无本体这些,但是我看那个派他更多强调一些这些真机上的不是跨本体的。好像对这个吴敏也好或者一个也好,会谈的会比较少一些。我不知道任博士想问一下任博士关系这方面的一些看法。【任至意|Physical Intelligence(PI)研究科学家】
然后我觉得我就稍微补充一下,就是刚才包括这个tony跟丹飞聊的这几点,我觉得其实tony提到一个bias的问题,就是说我们怎么样可以把这个采集的数据去replay,然后直接可以机器人可以完全的复现出来,然后把这个task完成。我觉得如果我们要做最unbiased的这种数据的话,那肯定真机数据是最unbiased。我们只要能把这个数据采集起来,这个机器人是可以replay做这个任务的,当然我觉得我也同意大家的观点,很多观点是说这个真机数据比较难去scale up,这个成本会很高,所以我们应该去混着一些其他数据去学,比如说是ego还是5米。然后我觉得就是在这样的一个框架下边,那我们如果已经去用不同的这种sources data to learn together,那我们就应该把这个embodiment of diversity scope as much as we can。我觉得这样才可以让模型去learn这种embodiment agnostic representation。然后可以去更好的把不管是ego还是无名之间的这个表征给学习出来。【任广辉|智元AI算法总监】
Ok感谢任博士分享。然后刚才其实tony也提到了整个部署的闭环的这些一些关键点。然后刚才丹娜的马博士也在分享中提到了非常多他们丹娜在整个真实场景中的一些这些部署的闭环。所以我想问一下dana怎么看待这些部署,这些回流,这些数据在整个数据skin中的一些重要性。还是说他是比如说他占多大的这样的一个比例会比较关键一点。【马也骋|Dyna Robotics联合创始人兼首席科学家】
其实我们发现就是在部署的时候,你把部署的data放到下一次预训练的时候,这样的话可以让你接下来的部署更efficient。比如说我们做一些折毛巾,折餐巾的这些部署,不是说我们只在一个宾馆里做对吧?我们的目标就是成千上万的宾馆我们都可以部署。所以我们在前几个deployment,大家好,deployment flyway有数据有很多数据的时候,其实放到pre training。然后接下来部署了,这个时间就会越来越缩短。然后最后就会达成零成本,就可以在一个新的地方去做同样的任务。这样的话我觉得其实对落地会有很大的帮助。【马也骋|Dyna Robotics联合创始人兼首席科学家】
但是我也同意做这些five will的前提就是要把预训练这些海量high diversity的数据要做好。因为其实如果如果如果机器人真正想泛化的话,不仅仅是这个动作你要学会其实人为什么这个泛化能力这么强能做这么多任务。因为我们不仅仅对你能可以做不同的动作,也对比如说语言,对环境有很大的理解。但这将模型这些感知的这些知识,其实是不一定需要非要从这个真机数据上学的。你可以从互联网视频,从人第一视角视频里学。所以我觉得最后的这个data recipe,就像我刚刚talk里讲,这个金字塔是个combination,就是最高质量的deployment数据加海量真机数据,然后再加更海量的比如说women,第一人称或者互联网数据。【任广辉|智元AI算法总监】
OK感谢马维斯的分享。然后刚才也提到这个数据金字塔,说底下一个非常大的底座是这个互联网。然后张老师他们带领的这个混元聚身,前两天应该也发布了一系列的这些混元去生的这些模型。所以我也想问一下张老师从这个互联网大厂角度来想一想,想来帮我们分析一下比如说互联网这些数据是怎么在我们这些聚身模型的scheme中发挥的作用,以及到底哪些必须需要一些真实物理交互的这些数据。【张正友|腾讯首席科学家、腾讯Robotics X实验室主任】
谢谢。这数据大家都认知都很重要。我觉得到最后最重要的可能是从数据飞轮那边的得到这个真实的数据。当然数据费是可能这个名字从大模型这个角度引过来的,可能我们还需要把这个数据所有人可能要拓展一下。因为聚生智能到最后本质上是要跟物理世界本来是要交互的,所以这个交互的数据本来就是一个必不可少的。所以你可以把它叫做数据飞轮,是从大模型的原有的这种概念,但是我觉得应该拓展到这个技术智能真正本质的东西是要跟物理世界交互的。这里面交互的东西无论是成功还是那你就要把这些数据收集起来。【张正友|腾讯首席科学家、腾讯Robotics X实验室主任】
然后如何在失败的数据里面学到帮助我们提升这个模型的能力。像我们在那个混匀VOA里面就引入了一些强化学习,就是pro那个flow pro是是把失败的数据来提升整个操作者成功率,所以这个是长远的。但是长远如果真正要部署出去,才会得到更多大量的真实数据反馈。那在部署之前当然答应了他那边已经部署了一些,但是这个量还是有限的。所以要真正部署大批量部署之前,你必须要让这个操作的能力达到一定的效果。【张正友|腾讯首席科学家、腾讯Robotics X实验室主任】
真实数据也是很重要,征集数据。然后这里面我觉得仿真会帮助,但是仿真跟真实之间还是有个gap。有一些数据可能仿真比较难,比方说罗信的这个物体做仿真的话,到目前为止还是有一定的困难。在其他像工厂里面那些物体的话,可能仿真就比较容易。这些数据就比较便宜一点,相对一点,我觉得仿真数据还是非常重要的。【张正友|腾讯首席科学家、腾讯Robotics X实验室主任】
然后再往后面退一步的话,这个第一人称的数据,其实互联网上有很多第一人称的数据。这些数据我们就本来就可以拿来用,来训练这个举证职能模型。但是互联网的上面的数据很多都是有些数据很运用,就是刚才提前面那个嘉宾提到的那个人机交互的数据。人和人交互的数据就可以帮助我们人跟机器人交互的这些训练。这部分是很重要。【张正友|腾讯首席科学家、腾讯Robotics X实验室主任】
但是在操作层面的话,往往第一人称数据里面这个蛇往往是看不见的,因为我们操作的时候不太会去关注蛇里面到怎么操作,因为这个我们能力很强。那现在有一个趋势,就是多采集一些易购这方面的数据。这个数据到底要多少量,这个我不是很清楚,但是这个肯定是很重要,很需要。所以互联网上那些人人和人交互的数据,可以用来帮助人机交互。还有一些操作数据缺乏的那我们要补上通过易购视频,然后仿真也需要到能够这个精确度操作的成功率达到一定程度以后,那就可以布置出去了。布置出去以后,这个数据反馈,这个数据飞轮就可以飞起来了。这是我的看法。【任广辉|智元AI算法总监】
感谢张老师的分享。确实应该说是这个物理AI的scheme的需要的数据应该是多种多样的。可能多种包括整个互联网的这些预训练的一些数据也好,包括这个部署闭环的也好。【任广辉|智元AI算法总监】
然后我们聊完数据的话,我们也聊聊最近大家也比较吵的比较热的这个模型方面。因为这个世界模型也是非常的火热。然后这个网络上也说了很多这些报论,比如说VRA已死或者action model这些。刚才刚才这个马博士也讲了,他们也从这个VRA切换到这个web了。然后最近我看派07他们也加入了这些这样的world model,这个world model这样的一个模块。所以我想问一下,任博士怎么看大家说的这个VR已死这个说法?【任至意|Physical Intelligence(PI)研究科学家】
Ok我觉得首先我其实到目前为止,我没有看到大家有哪一家可以做到比派07更impressive的demo。所以可能VOA还没有死。对,然后我还想说的一点是,我觉得两者完全没有冲突。我觉得对我来说in the可能未来我们真的做的是事情是去训练一个这样原生理解context,然后有对未来知道怎么去生成未来的一个这样的一个模型。我觉得在训练的时候去把对未来建模,去学习未来应该怎么怎么发展。我觉得这个对模型的表征能力决定是有绝对是有提高的。然后这个事情one在做,world model在做,VOA也可以做,我觉得这个完全不冲突。然后我们的时候就包括你说的就是我们派07里面用了这个feature sub goal去生成未来的长什么样子,然后来引导这个底层的模型去做下一步任务。我觉得这个事情也是很make sense的,所以我们应该继续的发展。所以我个人觉得VOA跟这个world model完全不冲突。然后我觉得未来肯定是一个会逐渐收敛的一个趋势。【任广辉|智元AI算法总监】
ok不是说马博是怎么看待刚才任博的这个说法。因为我刚才你这个报告说你们已经你们Daniel one,dana zero应该是还是VRA跟丹丹万现在已经切到这个word acting model了,然后你不知道怎么对。【马也骋|Dyna Robotics联合创始人兼首席科学家】
其实我非常同意阿伦说了,其实本质上我们需要的这些模我们需要我们想让模型有的这些capability都是不冲突的对吧?我们想让模型去,比如说你可以给大家一些语言指令,这些模型也应该有对这个future prediction的一些capability。但是我觉得我的看法就是在我们需要的这些capability里,有时候你用VM去做的话,可能比VLA更高效一点。但也有一些capability可能VLA也是会更高效。所以我觉得是各有千秋。【马也骋|Dyna Robotics联合创始人兼首席科学家】
但在我们的一些task或者一些场景,我们是发现因为我们其实特别care,我们就特别关心这个模型的鲁棒性。然后可不可以用很少的数据就可以让它达到非常高的successful。我们发现在这一些criteria下面,其实我们内部也做了一些非常严谨的研究。我们也可能过一段时间也会跟大家分享。我们就发现VM其实比BLA会efficient很多。【任广辉|智元AI算法总监】
ok行,感谢马博士的分享。然后刚才这个VRA包括web,大家都说这个非常强,各家也都说非常强。但是我想问一下徐老师,从这个学术界来说,怎么评价这两个模型强不强?就现在刷这个奔驰mark是不是能评价他们两个?还是说我们要挑战刚才像这个Allen说的我们更impressive的这种demo也好,或者是刚才这个dana说的这种部署,我们看有没有大规模部署。我不知道从学术界怎么来看待这个路线,是怎么评价呢?对这个刷榜还有价值吗?这些这个。【徐丹飞|佐治亚理工学院助理教授】
问题非常难以回答,就是VOA和one,我只能说从我看来,我也不能代表学术界。从我觉得从机器人deployment就是真的能用的角度来讲,其实就是几个就是他能不能学学到所有训练数据里面的东西,他能不能泛化才能不能跑得够快。因为我们东西要real time。【徐丹飞|佐治亚理工学院助理教授】
我觉得从这三个来讲的话,其实现在没有任何一个,我个人觉得没有一个定论,就是说哪个更好,哪个没有更好。因为你比方说也有人说如果要是你只要只做学一个任务的话,其实就是transfer scratch效果更好。所以我觉得确实就是需要有一个比较系统性的这么一个比较,就是在一些很大规模的情况下进行一些比较。没有,但是我觉得可能最终结果并不是说是哪一个architecture赢,而是说就是这个robot capability,它最终能体现出来的一些新的一些能力。比方说in context learning,或者说是长城的这个index,这种可能会比较重要,就是说可能BLV和v one这个的区别可能没有那么重要。对。【任广辉|智元AI算法总监】
OKOK感谢徐老师的分享。因为刚才大家讨论都是一个端上端这些小模型,但是可能有人问到底是不是这个一上去了说的是不是不是一个单一模块来解决。我看这个腾讯混元这个聚生系列模型也有非常多的通过左脑和右脑这些。我想问一下张老师关于这个问题是什么样的看法?也是单一这些模型还是比较复杂的分层。【张正友|腾讯首席科学家、腾讯Robotics X实验室主任】
的这些我们这个思考可能不是说VOA好,还是我的action model好。首先就是说区分智能还是在起步的阶段,我们整个行业都在起步,还没有一个converge的framework,不像大模型大语言模型。这个基本上全方面就基本上大家都定了,确实只要加数据就可以往前推进。【张正友|腾讯首席科学家、腾讯Robotics X实验室主任】
所以我们的思考不太一样,就是我们是从整个矩阵智能这样的一个完整的一个系统,或者是说embodied这个agent从角度去思考的话。如果借鉴人类的这个人人人这个人作为一个agent一个系统去想的话,那肯定最最上面一层是一个认知系统,然后下面中间一层是一个感知行动的这样一个一个系一个系一个子系统,然后最下面的是一个字体反应。所以我们像我昨天在我们这个论坛上面讲的,就是这个apex show,就是通过这样子三层的关系。但是这个三层里面是互相是自闭环的,是不是一个单一的模型?是三个模型它不断的转,然后互相之间又是有关系的信息,这是传递的,所以本质上就是修像VV就是到底是用一个模型去解决所有问题,还是说一个分层。就是我们尽管是分层,但是也是可以端到端去优化的,只是通过分层让这个三个模型可以在不同频率上面去进行。你想象假如是我们这个具身智能真正是一个智能体的话,怎么可能只有3B4B的这个模型就能解决所有问题,对吧?【张正友|腾讯首席科学家、腾讯Robotics X实验室主任】
这个大约模型都是几百笔及上铅笔的了。是,那我们就要思考,所以我这边就是更多的是思考去生智能agent这样子一个东西怎么样能够达到?假如要达到AGI的话,是怎么样能达到这么高的智能水平?这肯定不是不能直接是用几百B的模型去直接控制操作的部分,运动的部分。所以通过这样的这个模式去分层,同时每一层的信息是有传递的,然后下一层还可以反馈到上面去,然后on demand可以到最上层的这个认知系统那边去做更复杂的推理和想象力。【任广辉|智元AI算法总监】
感谢郑哥张老师的分享,对我们刚才聊了这多模型,其实再好的模型他也在落在一个具体的本体上。我们这个可能我们也要也有一个问题,就是说现在这个本体的设计是不是也会影响整个物理智能的上线呢?然后以及因为现在大家对这个零小手和触觉的关注度也非常高,然后我们也其实也对这个本体有非常多的兴趣。因为我们看到这个sunday,然后这个也是比较坚持的看着用这个三指的这种夹爪,其实我也想问一下这个线上的tony总,是说是你们面向这个家庭场景的这个是某种妥协。比如说是规避现在这个领导者和触觉不成熟,还是说是你们觉得这种山子在大部分家庭中或者大部分场景中,这个操作已经足够了。不知道是想问一下你们的整个这个思路是怎么样的对,谢谢。【赵子豪|Sunday Robotics联合创始人兼CEO】
我认为这其实是各种因素的综合。我们思考本体形态时,更像是在看一个进化过程。现在我们认为人形是终极形态,但在数亿年的时间里,恐龙才是地球上最成功、最具统治力的形态。【赵子豪|Sunday Robotics联合创始人兼CEO】
所以这是一个动态变化的问题,未来也会不断进化。我们对手部形态的看法是,它本质上是成本与能力之间的权衡。现在我们使用三指手,可以把它理解为“20/80”:用20%的成本获得80%的能力。退一步说,我们之所以还没有在家庭、工厂和医院普遍拥有通用机器人,并不是因为缺少五指手,而是因为背后的智能还没有被真正解决。无论是两指、三指、五指,甚至十指,我们都应该保持开放,但必须认识到,真正需要突破的是智能层,这才是让机器人真正进入现实世界的核心。【任广辉|智元AI算法总监】
Ok感谢tony的这个分享。然后tony他们sunday来说是做了自己的这些本体,我看他们是一个坚持只做这个通用大脑的。其实我也想问一下任博士,关于这种,比如说你们只做大脑,然后不做本体会不会也是缺失一些比较关键的这些包括软硬件一体的设计也好,或者是关于整个数据闭环的这样一个关键的,不知道您怎么看待这个。【任至意|Physical Intelligence(PI)研究科学家】
对我同意其实我同意就是说派因为没有自己研发自己的硬件,所以其实我觉得有些时候确实就是可能在一些具体任务上面,我们因为没有自己设计的硬件,可能做不到这些任务。但我同时又觉得,我们的策略更多像是我们用比较简单,比较维护成本比较低的这样一些本体的硬件,去把我们整个info先构造起来。然后通过这样的info去支持我们每一代模型的研发。我觉得我们更多是在做一个research,而不是说我们要想着明天把这个模型一定要再投放在什么地方,我们还想把这个制作模型能力给涌现出来。然后我觉得这样的这个前提下面,如果我们希望整个公司推动的很快的话,我们想用最简单的这样的本体去做这个事情。但是我觉得长期来说,我们肯定会考虑去噪更加可靠的这些硬件,但可能这是一个时间的问题,我觉得。【任广辉|智元AI算法总监】
Ok谢谢任波的分享。然后派他们可能是不做本领,然后资源的话其实他是足是啊双足的或者轮式的,然后这种或者营销手都会做一些。所以我想问一下姚总,关于这个是什么样的看法?为什么资源选择了这种更加更重的这种全站的这种路线的对。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
因为可能智元作为一家权杖公司,在做长期一些研究之外,也在积极做一些商业化的尝试。在商业化尝试这边,其实它很现实。就必须面对一线用户最严格的一些标准,大家可能最关心的一些指标就是说可靠性、成本、成功率,还有一致性是吧?那这些环节的话,你必须通过一些自己的内部的专门的设计,再到一个大规模高标准的量产,才能去满足它这样一个硬件形态的基础标准。同步其实我认为就是自己去做一些硬件上面的研发和测试,也能够更加深刻的去体会这些当前受制于刚刚我们这个问题,也是说有哪些是相当于硬件在限制我们,或者说定义我们的模型,这个也会有更深刻的一些看法。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
比如说刚才张老师也提到了我们鞠身智能的一个类人的高阶智能的系统一定是分层的。因为人肯定也是分层的,可能不止三层、四层、五层,也可能,硬件本身我们现在看起来,比如说端测就是最高制成最先进的芯片,也只能跑5B10B的模型是吧?跑十赫兹不能支持跑你这个200B的模型。那不得不就去催生出一些端云结合的agency的大模型,跑在云端异步的低频的去推理,去通信。然后再到端侧可能跑这个5B10B模型,再到底层去通过这些模型规划出来的路径轨迹,转换成1000赫兹excel cat的底层电机?谐波电机,行星电机的一些通信控制。可能只有说自己能够去钻研到一些硬件底层的设计测试,然后才能够去在所有的一些约束条件之下去优化一个当前的最最高效的系统对。【任广辉|智元AI算法总监】
感谢姚总的分享,然后刚才徐老师在在报告中也讲了非常多human的这些。然后我想问一下徐老师,如果我们要达到比如更好的利用这个human data的话,我们是不是一定因为我我因为我也关注到您最近发了一些的相关的工作,比如说这个零销售、触觉,比如说我想问一下您,比如关于最后的这个通用操作,是不是一定或者某种操作是为了用人脸视频也好。或者是说他确实可以接受更精细,更复杂的一些任务,是不是一定需要高级优度零销售以及这些触觉,还是说他也他只是某种锦上添花的,还是必须的这些。【徐丹飞|佐治亚理工学院助理教授】
我觉得人类数据当然就是他他有很多的不同的形态,我觉得就人本身的数据,比方说我一个可穿戴设备进行采集的数据的,在不影响人操作的情况下,肯定是一个菱角手操作的一个这么一个状态。作为一个科学研究的这么一个主题来说,我觉得我们有一个假设,对吧?就是做一个假设,就是说只要机器人的本体能到达人类的这个灵巧度的,比方说多少一个程度,那么我们就可以直接从人类数据转学习进行的这个policy。我觉得这个假设是成立的,而且我们也有资源和有现在有技术已经到达这个地方了。所以我觉得我们应该就是推一步把这件事情做出来,然后看看他能不能做得成。我我我这是我现在的想法。对。【任广辉|智元AI算法总监】
Ok感谢徐老师的分享。听下来这个本体好像也不是越复杂越高阶越好,也是根据整个我们这个产品还有各种落地的匹配度。然后接着我们其实前面聊了非常多这种技术路线,接下来我们想聊聊整个几个产业格局。因为现在市场上也有一些观点,就是说现在这个大模型厂商越来越强,包括s rapid,包括最近的这个kimi deep sick,这些大门厂商会不会降维打击到我们这些,尤其是机器人的创业公司。因为我看这个马博士之前在一起一些大厂也好,然后后面自己这个创公司也好。我想问一下,我们整个机器人创业公司怎么在怎么防止或者怎么来构建自己的壁垒。面临如果面临这些大名厂商他们来下场做机器人也好,这些挑战。【马也骋|Dyna Robotics联合创始人兼首席科学家】
对我的个人看法就是大厂他们其实他们已经一直在做robotics对吧?就比如说OpenAI他们其实很早以前他们一开始做了技术robotics,然后google NV然后国内的这些大厂也一直在做一些模型。但我觉得这其实跟创业公司,尤其是像我们就是做full stack,从模型硬件然后到deployment都做,其实是没有冲突的。我觉得开源的模型,比如说VOM或者video model,其实都是对robotics公司,尤其是做部署的公司帮助是特别大的。【马也骋|Dyna Robotics联合创始人兼首席科学家】
然后还有一点,从技术角度上来说,我觉得做robotics policy做部署的话,我觉得必须是要在logo里做的。就是说很难在就很难像语言模型,你可以在云端叫一个API。因为我觉得robotics的话对甄姬这个performance要求特别高,所以对延迟都特别的敏感。所以我觉得最后的话都是要做一些local model,对吧?所以如果没有很好的开源模型的话,那就各自robotics company必须要自己做自研模型,就自己研发自己的模型,不管是从open source开始还是train from scratch。所以我觉得这个是啊inevitable,就是必须会发生的。所以这也是为什么我觉得现在各家公司不管用不用open source model,都有很强的能力可以做自研模型。因为我觉得一些大厂做一个模型特别强,然后直接API去做downstream任何任务,任何robot,我觉得还是我个人认为不是特别成立的。【任广辉|智元AI算法总监】
好的,感谢马博士分享。然后我们看我想问一个张老师一个问题,就是张老师他们这种大厂做的这个混源替代,也有发了这个混源巨生系列的模型。我想问一下,就从大厂的角度来说,如果你们下场会不会快速挤压创业公司的这个空间,以及你们在这做这事上的优劣势有哪些,谢谢。【张正友|腾讯首席科学家、腾讯Robotics X实验室主任】
回答这个问题之前,我先回分享一点前面关于全站的工作和指数大脑。我只是觉得各个都有可能性。因为你假如从手机角度来看,全站的有苹果吗?那么不是全站做大脑的那只有有还有安卓,你看都活得都非常好。那你假如是再回到以前PC时代,那也是同样的情况。你有mac这样子一个全站的工作,那你这个windows他支持不同的硬件,他也活得很好,两个都活得很好。所以我觉得在机器人矩阵智能这边同样会发生。所以到底是选择做大脑,还是说全站的,包括本体也去做,这个是各个厂企那个那个厂的公司的选择。从腾讯角度来讲,我们已经明确就是说是只做大脑不会做出本体,因为是腾讯在AI,在那个连接,在腾讯云方面都比较投入比较多,所以比较适合做做大脑。而且腾讯做本体,做做硬件基本上还没成功过,说是这个所以有也有自知之明但是聚生智能还是在比较前沿的,就是前期所以这基本上是前期的话,那个本体跟模型能够结合去思考探索还是很重要的。【张正友|腾讯首席科学家、腾讯Robotics X实验室主任】
像我们实验室从18年成立以来,我们就没有放弃过做硬件,到现在我们还是做一些硬件,但不会是去咗卖硬件,因为做硬件这样帮助我们去思考。包括我们这次在在腾讯展台里面发布的也没发布,只是拿来摆在那边让人家体验是这个按摩机器人,大家这个反应很好。原因是说我觉得现在做的这个操作更多的就是操作物体,然后更多的是偏视觉。那么到最后我们还是需要把触觉力觉这样子的这个信息要跟其他视觉和大模型就要结合起来。物理机器人和机器人的物理接触,就是按摩还是很重要的。这个可以做一个很好的试验场景。所以我们就做了这个按摩的这个大家可以去体验一下,今天应该还有机会去体验一下,大家都反应很好啊。所以我简单的就是讲我觉得两个都是很合适的一个商业模式。【张正友|腾讯首席科学家、腾讯Robotics X实验室主任】
回到这个大厂和小厂对吧?对关于创业公司我一直都在大厂里面,从以前在微软20年对吧?现在在腾讯对吧,这也很也快十年了。大厂的这个问题大家都很清楚。你说你说像这个就是大模型的时代,像google,基本上所有的技术都是google发明的。但是为什么OpenAI出来了,对吧?那同样的我觉得相信我相信这个创业公司,聚众智能创业公司会有非常多的可能性。【张正友|腾讯首席科学家、腾讯Robotics X实验室主任】
但是创业公司到底要做什么事情,我觉得这个是值得思考的。假如是大厂做的一些事情,或者就类似于比方说大模型加强,就是这个open IC当然是一个很大的一个公司,或者google他大模型还在演进。那你假如是创业公司做的事情是被大厂或者是这个大模型之类的,这个很容易会包括到后面的模型里面的话,那你的创业公司这个情景就不会太好。【张正友|腾讯首席科学家、腾讯Robotics X实验室主任】
所以创业公司要去思考的可能就是说,即使那些大厂要去做,或者是有某一个创业公司做做的,把那个那个具身打磨性做的非常好。比方说physical intelligence吓得突突的非常好,那你怎么样来避开他的锋芒?你不要做一些incremental的这种东西,然后很快的就被他们纳入进去。所以像这个数据,场景这些东西,我就想相信这个创业公司会有更深入的思考。但是我相信是很有机会的,所以不要担心这个大查对吧?好好大碴有大槎的问题。【任广辉|智元AI算法总监】
感谢张老师给我们这些创业公司的一些信心。又然后因为我们那个时间关系,我们整个嘉宾分享也都非常精彩。然后我想再问嘉宾最后一个简单的问题,大家都可以回答一下。就是说我们如果要实现这个机器人的Cherry GB时刻,大家比如给一个心中的这个timeline的话会是什么样?比如说是几年,三年或者两年或者然后我们可以要不先从姚总开始。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
那我就先说一下,我觉得是两年,对,主要在数据的一个进展。OK那个。【任广辉|智元AI算法总监】
任博士。【任至意|Physical Intelligence(PI)研究科学家】
我觉得我在加入派之前我是觉得得十年,但我觉得现在可能四五年。【任广辉|智元AI算法总监】
OK徐老师。【徐丹飞|佐治亚理工学院助理教授】
你五年。【任广辉|智元AI算法总监】
ok马博士的您。【马也骋|Dyna Robotics联合创始人兼首席科学家】
我觉得四年差不多。【任广辉|智元AI算法总监】
张浩生你。【张正友|腾讯首席科学家、腾讯Robotics X实验室主任】
看来大家好像有一个共识,好像我是认为3到5年ok,但是要踏踏实实的去做OK这3到5年还是有希望的。【任广辉|智元AI算法总监】
线上的赵总【赵子豪|Sunday Robotics联合创始人兼CEO】
不到三年。【任广辉|智元AI算法总监】
okay. 行,我们今天的圆桌讨论就到此结束了。我们非常感谢各位嘉宾的这个精彩观点。行,也感谢各位观众待到这么晚。对。【主持人】
行好,再次感谢各位嘉宾的精彩观点,嘉宾们可以从舞台左侧回到席位落座。【主持人】
各位嘉宾,我们可以先到舞台的中央,我们再来一张站立的合影留念。来,各位嘉宾可以再往前一点点。【主持人】
我们的来宾也要。【姚卯青|智元合伙人、高级副总裁、具身业务部总裁;觅蜂科技董事长兼CEO】
请各位来宾。【主持人】
将会议耳机留在席位上,我们的嘉宾进行合影留念。【主持人】
再次感谢各位嘉宾,我们可以从舞台的左侧回到喜悦落座。【主持人】
感谢各位嘉宾的精彩交锋,也感谢在座每一位的全程观众。从数据飞轮模型虚实学习到商业规模化落地,今天整场论坛完整串联起物理AI从技术原理到产业落地的全链路思考。随着本次WAIC智启具身论坛会议的全部落幕,也祝愿所有行业伙伴携手深耕物理AI赛道,一起冲破技术边界,迎接通用物理智能的全面有限。本场论坛到此圆满结束,感谢各位的到场参与线上的观众朋友们,我们下次再会。请各位来宾将会议。
资讯来源:华尔街见闻
