DIGITIMES

Physical AI还缺什么?机器人都会跳舞、跑酷、接棍子了

徐宏民
2026-10-06

9月底在美国匹兹堡参加机器人顶尖会议IROS 2026。一家机器人新创的摊位上,双臂机器人在玩「接棍子」(falling sticks)游戏,几根棍子悬在上方随机落下,手臂要在半空中瞬间抓住。这类游戏原本用来测试人的反应速度。

这一年也看到不少机器人跳舞、跑酷(机器人障碍赛)、跑半马的影片。这些表演代表什么?机器人已经有完备的AI能力了吗?

先看跳舞。中国一家人形机器人大厂2025年在春节晚会让机器人跳舞。这类表演常见的做法是「动作追踪」(motion tracking),录下人类动作、对应到机器人骨架,在模拟器里用强化学习训练一个照著做又不跌倒的策略,再直接用到实体机器人上。硬件则靠高扭矩关节与3D激光雷達定位。外媒报导指出,这是用真人舞者數據预先编排的表演。

跑酷多了一层判断。2026年初,柏克莱加州大学、史丹佛大学、卡内基美隆大学等研究团队,把多个跑酷技能蒸馏成一个以深度影像驱动的策略。机器人只靠深度鏡頭与移动方向、速度的指令,自己决定障碍物要跨过、爬上还是撑越。但往哪里去?为什么去?仍由人决定。

把这三个例子放进机器人的控制架构来看。控制大致分成5层,往上愈慢、愈抽象,往下愈快、愈贴近实体动作。最上层由大型语言模型理解指令、拆解步骤,大约每秒1次或更少。往下是视觉语言动作模型(VLA),决定手要抓哪里、怎么移。再往下是负责移动与平衡的运动策略、协调手臂与腿部的全身控制,最底层的马达电流控制大约每秒上万次。

借用心理学家康纳曼(Daniel Kahneman)《快思慢想》的说法,上两层像需要专注推理的「系统二」,下三层像快速、直觉的「系统一」。跳舞、跑酷、接棍子,都落在系统一。

这几层的分工目前还在调整。一家美国人形机器人新创把全身控制独立出来,称为「系统零」,用超过1,000小时的人类动作數據训练成一个網絡,业者表示取代10万多行手写程序。运动策略与全身控制两层,看来正被学出来的控制器合并。

为什么停在系统一?因为这几层的數據较易取得。「照著人类动作做、不要跌倒」几乎适用每个动作,成败几秒就知道。刚体与地面的接触也容易模拟,GPU上可以同时跑几千臺虚拟机器人,走路策略很快就能训练出来。上层刚好相反,「折好衣服」「帮我微波午餐」很难写成奖励,手指与物件的细微接触,模拟也不准。所以这些表演多半是模拟器里用强化学习练出来的,机器人身上还缺一个有深度思考、推理能力的「大脑」。

这些表演证明的,是平衡、移动与全身动作已经成熟许多。北京的人形机器人半程马拉松赛,2025年首届多数队伍跑不完,2026年已有队伍50分钟出头完赛。资金也跟著进来,依市场研究机构统计,2025年全球实体AI(Physical AI)新创募资近400亿美元,2026年上半已超过470亿美元(统计范围也包含自驾车、无人机等)。

缺的部分,从系统二到场域部署,我的观察有6项:

第一是长时序任务。公开展示的自主任务,大多只有几分钟、数十个连续动作,离工厂一个班次的8小时还很远,过程中也要能推理、确认自己有没有做完。

第二是泛化,关键在數據。上层要的做完工作的數據,目前多半得在真实世界累积,遥控操作因此从机器人做不到时的补位,也成收集數據的方法。也有团队让模型从实际执行与人工修正中学习。

第三、第四是硬件与接触。便宜的是身体,手、触觉、电池与耐用度还没跟上。2026年7月一家美国科技大厂发表的模型,让人形机器人蹲下从地上捡东西,成功率还不到5成。

第五是安全。固定的机械手臂断电后停在原地,需要主动维持平衡的机器人则可能倒下,针对这类机器人的国际安全标准,目前仍在草案阶段。

第六是部署。依国际机器人联合会(IFR)统计,2025年全球工业与专业用途的人形机器人约7,000臺,不少是买来产生训练數據,实际在场域使用的极少,流程怎么改、投资报酬怎么算,都还在摸索。

这几年控制与硬件的能力、韧性持续进步。硬件价格往下、系统二的能力往上,两条线交会之后,机器人投入场域才看得到投资报酬。如果场域部署的能力也跟著补上,未来几年Physical AI agent对产业的影响,可能又会超乎我们的想像。

台灣大學信息工程学系教授,曾任富士康集团与Stellantis合资车用科技公司技术长暨副总经理,推动ADAS及智能座舱系统产品进入全球车用市场。纽约哥伦比亚大学电机博士,专精于机器学习、电脑视觉、自驾车、机器人等领域。为讯连科技研发团队创始成员,慧景科技(thingnario)共同創始人,NVIDIA AI Lab計劃主持人;曾任IBM华生研究中心及美国微软研究院客座研究员。担任多家科技公司AI策略顾问,习惯从学术与产业双重视角检验技术发展的机会与挑战。
智能应用 影音