9 月 17 日,美国人形机器人公司 Figure AI 创始人 Brett Adcock 在 X 上留下了一句简短的预告:“我们在 Figure 实现了一项 AI 突破,并将在明天展示。”
这条有些神秘的消息迅速引发关注。毕竟,Figure 过去一年已经连续发布过多次机器人基础模型,不少人猜测,这次所谓的“AI 突破”,可能会带来一次更明显的能力跃迁。
(资料图)
一天后,Figure AI 公布了新一代人形机器人基础模型 Helix 2.5。他们宣称,搭载这套模型的人形机器人,到了一个从未见过的家庭后,不需要现场采集数据,也不需要重新训练,就能直接开始干活。
(来源:X)
为了验证这一点,Figure AI 把 Figure 03 人形机器人带进旧金山湾区 30 栋此前没有用于训练的住宅,让它完成整理客厅、叠毛巾和铺床三类任务。测试前,公司没有在这些住宅里采集机器人数据;测试过程中,也没有针对新的房间布局、家具以及玩具、毛巾和床品重新微调模型。每类任务都由同一个固定版本的模型完成。
最终,Helix 2.5 在 420 次测试中完整成功 237 次,总成功率为 56%。其中,铺床成功率 67%,叠毛巾 62%,整理玩具 40%。
这套评测对“成功”的要求也相对严格。整理客厅时,13 至 15 个玩具需要全部被放进篮子;叠毛巾要求所有毛巾完成折叠并放好;铺床则要把两个枕头和被子整理到指定位置。只要任务没有完整完成,或者过程中超时、需要人工进行安全干预,都会直接计为失败。
Figure AI 还做了一组对照实验。在模型架构、下游任务数据、训练方法和评测流程都保持一致的情况下,没有经过大规模人类行为数据集 Index 预训练的模型,在这些陌生家庭里的完整成功率只有约 9%;经过 Index 预训练后,这一数字提高到 56%。
单看结果,从 9% 提高到 56%,进步的幅度确实不小。但发布之后,一些争议的声音也接踵而至。
以 Sunday Robotics 联合创始人 Tony Zhao 为代表的一些机器人从业者,对 56%(237/420)的完整任务成功率提出了质疑。这意味着机器人完成一项完整任务时,仍有接近一半的概率失败。在他们看来,这与 Figure 对外宣称的“机器人已经能在陌生家庭里真正干活”并不完全匹配。
(来源 :X)
某种程度上,这也触碰到了当前具身智能行业,尤其是家庭机器人亟待回答的一个问题:一个还会频繁失败、需要较高容错的系统,是否能够被称为真正能够“干活”的机器人?
Helix 2.5,具体做到了什么?
抛开这些争议,我们先来看 Figure AI 这次发布的 Helix 2.5 到底做到了什么。
它的重点并不是让人形机器人第一次学会铺床、叠毛巾或者整理房间。Figure 此前的 Helix 02 已经能让机器人在室内连续移动,并协调视觉、双手操作和身体平衡完成长程任务。
Helix 2.5 真正往前的一步,是让这些已经学会的技能尽量摆脱对特定训练环境的依赖。
过去,很多机器人任务都需要先在最终工作场景中采集数据,再针对这个环境训练。换到另一栋房子,家具布局、物体位置和光照条件都变了,机器人往往还需要重新适配。Helix 2.5 则试图让机器人在别处学会任务后,直接进入陌生家庭继续完成。
Helix 2.5 试图改变这一流程,Figure AI 先用 Index 中的大规模人类行为数据对模型进行预训练,再用其他环境中的机器人数据,分别教它整理房间、叠毛巾和铺床。最后,再把机器人直接送进 30 个此前没有见过的家庭执行任务。
(来源:Figure AI)
Figure AI 将这种能力称为“zero-shot whole-body generalization”,即“零样本全身泛化”。
其实单纯的“零样本泛化”在机器人领域已经不算新概念。Figure 此前的 Helix 就展示过对未见物体的操作,其他机器人基础模型也一直在尝试让机器人迁移到新的物体和环境。Helix 2.5 这次比较特别的地方,在于把这种泛化继续扩展到了人形机器人的全身长程任务。
以铺床为例,机器人并不是站在固定工位前完成一次抓取。它需要自己走到床边,根据床的位置和周围空间调整站姿,再用双手处理不断变形的被子;如果中途没有处理好,还可能需要重新站位,甚至绕到床的另一侧继续操作。整理客厅也是一样,机器人要在家具之间移动、寻找散落的物体,再不断调整身体位置完成抓取和放置。
而前面提到的 9% 到 56% 的成功率跨越,可以说明 Index 预训练在这种跨环境迁移中起到了明显作用。
Index 是 Figure AI 今年 8 月公开的大规模人类行为数据项目。Figure 希望让模型先通过大量真实世界中的人类活动,接触做饭、清洁、整理、搬运等行为,再用相对更少的机器人数据,把这些经验转化成机器人能够执行的动作。Helix 2.5 发布时,Figure AI 称 Index 每秒新增约 35 分钟的人类行为数据。
Figure AI 还表示,在一个与 Helix 02 的代表性任务比较中,Helix 2.5 大约只使用了此前一半的专项适配数据,就达到了相近的成功率,同时还能把这项能力带到 30 个陌生家庭。
不过,这次成果依然存在明显的局限。首先,它目前证明得比较充分的是环境和物体泛化,还不是开放式的任务泛化。机器人能够完成的,仍然是三个已经经过专门训练的任务。它还没有做到面对一个完全没学过的新家务,只凭语言指令或观察就直接学会并完成。
其次,让机器人进入训练集之外的新住宅工作,并非 Figure AI 首次做到。机器人基础模型公司 Physical Intelligence 此前发布的 π0.5,就已经展示过移动操作机器人进入未见过的真实住宅,整理厨房和卧室,并连续执行 10 至 15 分钟的多阶段任务。
另外,56% 的整体成功率也说明这种泛化还远谈不上稳定。虽然 Figure 的完整任务判定标准比较严格,一次任务只要有最后一步没完成就会被算作失败,但对于真正的家庭用户来说,最终关心的仍然是事情有没有做完。跨环境泛化已经出现,并不等于可靠性问题已经解决。
Figure AI 还公布了一个更有意思的实验。他们把它称为“Human-to-Humanoid Robot Transfer Scaling Law”,即从人类行为数据到人形机器人的迁移规模规律。
(来源:Figure AI)
团队使用四组不同规模的 Index 数据进行预训练,数据量跨度达到 8 倍,同时固定模型大小和下游任务数据。随着预训练数据增加,机器人动作预测的验证损失持续下降,而且研究人员可以根据较小规模训练的结果,提前预测更大规模训练最终能达到的 loss。
所以更准确地说,Helix 2.5 给 Figure AI 这条路线增加了一组比较有力的证据:大规模人类行为预训练,确实可以帮助人形机器人把已经学会的技能带到陌生环境。
但它目前证明的是“这条路线有效”,还不是“家庭机器人已经被解决”。更难的问题仍在后面,这些能够跨环境使用的技能,什么时候才能稳定到足以让人真正把家务交出去。
机器人干活到什么程度,才算真的可靠?
回到开头 Tony Zhao 对 Helix 2.5 的质疑,其实探讨的是具身行业面对的同一道现实门槛:“能做出来”和“能放心交给它做”,正在变成两套不同的标准。
过去,机器人研究首先要证明一项能力存在。第一次叠好衣服、铺好床、整理好房间,本身就足以说明技术往前走了一步。
但当机器人准备真正进入家庭,问题就变了。用户关心的不只是“它会不会”,而是今天能做,明天还能不能做;换个房间还能不能做;中途失败能不能自己恢复;把任务交出去以后,人还需不需要随时准备接手。
所以,可靠性很难只看一个成功率。Figure AI 的 56% 是完整任务成功率。一个玩具最后没放进篮子、一条毛巾最后一步失败,都可能让整次测试被判零分。
但反过来,99% 的成功率也不一定代表问题解决。如果机器人只在固定房间、固定物体上做到 99%,换个环境表现就明显下降,这样的可靠性同样有限。
Sunday Robotics 今年提出的 Solve 框架,则在试图把这些因素放到一起。它把机器人能力拆成三个维度:Performance、Scope 和 Adaptation Cost,也就是完成得有多稳定、这种稳定性覆盖多大的现实变化范围,以及进入一个新环境还需要付出多少额外适配成本。
其最近公布的家务机器人模型 ACT-2,就是沿着这个方向推进。它在衣物折叠任务中完成了 785 次测试,其中成功 778 次,零样本成功率达到 99.1%,覆盖 9 类衣物和不同的未见家庭环境。
(来源:Sunday Robotics)
当然,这个 99.1% 不能和 Figure AI 的 56% 直接比较。前者围绕一个相对明确的任务族做了大量可靠性优化,后者测试的是三个更长程、需要全身运动的任务,任务复杂度和失败机会都不一样。
真正值得关注的,是它们背后体现出的两种技术侧重点。一种思路更接近过去几年基础模型的发展路线:先扩大预训练数据、模型和算力,把能力范围和跨环境泛化做宽,再通过后训练逐步提高成功率。比如 Figure AI 的 Index。
另一种思路更强调,模型“会了”以后,真正困难的是把那些偶发失败一个个找出来,再通过后训练不断提高可靠性。Sunday Robotics 把它称为“Generalizing Reliability”(可靠性泛化)。成功率要提高,同时不能因为换了房子、换了物体就失效。
其实这两种路线最后并不冲突。真正进入家庭的通用机器人,既不能永远只有几项做到 99% 的技能,也很难接受几十项能力长期停留在五六成成功率。能力范围、可靠性和部署成本,最后都要同时过关。
这也解释了为什么近来机器人公司的宣传方式正在发生变化。过去,一段足够漂亮的视频,主要回答的是“机器人能不能做到这件事”。但当公司开始使用“真正工作”“进入家庭”“AI 突破”这样的表述时,外界自然会继续追问:到底测试了多少次?失败率是多少?有没有人工干预?换一个环境以后还能不能保持表现?
这终归是一件好事。
1.https://www.figure.ai/news/helix-2-5-zero-shot-30-home-generalization
2.https://www.figure.ai/news/introducing-index
3.https://www.figure.ai/news
4.https://www.sunday.ai/blog/act-2-preview
5.https://www.humanoidsdaily.com/news/figure-helix-2-5-30-unseen-homes
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
上一篇:热点聚焦:T31固化剂商品报价动态(2026-09-18)
下一篇:最后一页
X 关闭
X 关闭
- 15G资费不大降!三大运营商谁提供的5G网速最快?中国信通院给出答案
- 2联想拯救者Y70发布最新预告:售价2970元起 迄今最便宜的骁龙8+旗舰
- 3亚马逊开始大规模推广掌纹支付技术 顾客可使用“挥手付”结账
- 4现代和起亚上半年出口20万辆新能源汽车同比增长30.6%
- 5如何让居民5分钟使用到各种设施?沙特“线性城市”来了
- 6AMD实现连续8个季度的增长 季度营收首次突破60亿美元利润更是翻倍
- 7转转集团发布2022年二季度手机行情报告:二手市场“飘香”
- 8充电宝100Wh等于多少毫安?铁路旅客禁止、限制携带和托运物品目录
- 9好消息!京东与腾讯续签三年战略合作协议 加强技术创新与供应链服务
- 10名创优品拟通过香港IPO全球发售4100万股 全球发售所得款项有什么用处?

