DIGITIMES

Autonomy vs. Automation:自主机器人与自动化

徐宏民
2026-09-02
AI语音摘要
00:48

8月中参观臺北国际自动化展。2026年参展活络,规模比2025年成长7%。走一圈下来,实体AI(Physical AI)、视觉语言动作模型(VLA)等字样充满会场,连展臺上的介绍都讲得一口流利的VLA。但是展示机器人仍在栅栏内以固定节拍重复同一个动作,引导对位的是贴在料架上的定位标签,组装线材前先用治具固定线端。

展场的用词走在产品能力前,不难想像。但是眼前这些展示还在「自动化」(automation)范畴,离「自主性」(autonomy)还有多远?

自动化的做法,是把不确定性从环境中移除。治具固定物件的位置,围篱隔开人的动线,逐点教导与离线程序编辑给定动作顺序,安全光栅与急停则用来降低异常状况下的风险。机器人因此能正确地重复工业动作。

自主性的方向刚好相反。环境不动,改用系统本身去承受不确定性。剩下的意外,由备援人员介入。

无人出租車(Robotaxi)算是自主性的先驱。Waymo在2026年2月揭露,约3,000辆车的车队,在線有数十位線上协助人员。车辆遇到状况,人员才介入。这不是盯著特定车辆,也不是線上代驾,但介入从常态变成例外处理,这一步花了十多年。

數字世界的自动化是RPA(流程自动化軟件)。规则先订好,适合重复而固定的工作,没定义的状况就停下来。AI代理(AI Agent)则处理需要判断与例外的任务,自行拆解工作流程,在回馈机制下重新规划、重试或修正,那是數字版的自主性。这主要受惠于近来大型语言模型的技术突破,但是能在非结构化环境中通用操作的实体自主性,仍有相当距离。

既然自动化做得好,为什么还要往自主性走?因为这可能是一次「典范转移」,不只机器人变聪明灵活,而且成本结构、竞争态势也可能改变。

自动化的支出里,为单一场域做的工程往往占比高,每多一条产线就得多做一次。自主性把比重往系统本身移,前期重得多,包括导入与整合成本,但只要有一部分能跨场域重用,就有机会随规模摊掉。

在少数场域,这样的转变已经开始浮现。送餐、仓储搬运与商用清洁的任务与环境高度相似,导入时的建图与流程设定免不了,规模通常远小于改造一条产线。同一款机器可以复制到下一家,按月订阅的方案也跟著出现,收费方式和SaaS类似。这几类还谈不上完全自主,虽然会自己避开走动的客人、重新规划路线,但让规模化成立的主要是任务相似。

若跨场域重用的比重提高,以单一场域定制工程为主的价值可能被压缩。值钱的部分也可能往两端移动,一端是致动器、传动与力傳感,另一端是模型、數據与垂直应用的调校。

自主性可以发挥的,比较可能是场域改造特别贵的地方。长期照护、医院物流、大型设施巡检、灾害现场,这些环境难以预先结构化,过去多半停在展示阶段。其中一些需求不是不存在,而是很难在传统自动化的成本结构下成立。

自主机器人,还需要哪些技术突破?推论与长时序常被提到,专栏先前谈过。比较少被放在一起看的是接触、新硬件与评估。

接触这一项的说法相当反主流。有研究团队在2026年提出,机器人操作之所以慢,是因为整套系统都为了「避开」接触而设计。方向应该倒过来,「Make contacts friends, not enemies」。这不只是加装力觉傳感器,可能要连硬件形态、规划重新考量。

已经有团队初步实现。杂乱的环境里本来就不一定存在完全不碰的路径,于是让VLA先判断哪些东西可以碰、哪些碰不得,例如拨开布偶去拿遥控器可以,撞倒玻璃杯不行,再据此规划动作。

灵巧手与触觉傳感这些新硬件发展较迟。视觉在模拟里已经可以做得很逼真,但一碰到东西就容易失准,形变、摩擦等物理特性较难掌握。电子皮肤与触觉模塊又是每一家一套规格,还没收敛。

评估这一项问的是另一件事,怎么确认做对了,做错了又怎么改。Agent之所以成功,靠的很大一部分是评估验证。失败可以低成本记录、重播与复制,數字工作执行几千次也不会弄坏任何东西,错误看得见,也就修得动。

实体世界没办法这样。机器人失败一次,坏的是真的东西,也可能伤到人,错在哪不见得留得下来。近年多数研究各自订一套评测流程、用自家的指标。能在真实场域中跨平臺收集、又被广泛采用的共同评测框架,仍然很少。

既然实体失败成本高,确认就得挪到动手之前。世界模型受到期待,原因之一就在这里,先在模型里把动作预演一遍,可行再执行。

回到展场。目前多数展示还落在自动化,这套做法仍在创造产值。接触、新硬件与评估不会同时被解决,「自主性」比较可能从某一个场域先突破。当某个场域被证实能以较少的定制工程规模化部署,生意的重心就有机会从逐案的定制与整合,转向可跨场域复制的产品。

台灣大學信息工程学系教授,曾任富士康集团与Stellantis合资车用科技公司技术长暨副总经理,推动ADAS及智能座舱系统产品进入全球车用市场。纽约哥伦比亚大学电机博士,专精于机器学习、电脑视觉、自驾车、机器人等领域。为讯连科技研发团队创始成员,慧景科技(thingnario)共同創始人,NVIDIA AI Lab計劃主持人;曾任IBM华生研究中心及美国微软研究院客座研究员。担任多家科技公司AI策略顾问,习惯从学术与产业双重视角检验技术发展的机会与挑战。
智能应用 影音