上一篇谈到,传统SLAM将地图交给路径规划,任务就差不多完成。对自主机器人来说,地图建好之后,新的应用(与挑战)才开始,包括查找、导航到指定的位置、记住看过什么,以及留给模型(复杂情境)推理时读取。实体AI(Physical AI)的记忆,和大型语言模型的记忆(memory)很不一样,它往往得和3D位置绑在一起,而且可能因环境变化而过期。
先看导航与查找。
指令开始换成自然语言,例如「把二楼会议室的空纸箱收到回收区」,自主机器人得自己把任务标的对应到地图上的位置。这类问题研究上称为grounding,也就是把语言中的描述,对应到空间里的物件或位置。做法是把视觉语言模型的特征结合到地图上,机器人不必事先学会识别那个箱子(现在的视觉语言模型多半具备zero-shot的識別能力),也能找出「靠窗那排料架上白色的箱子」。3D几何地图还是基础,只是现在加上丰富可操作的「语意」。
地图也开始被当成记忆来用。半导体厂使用四足机器人沿固定路线读取仪表、记录管线与机臺外观。这些制造业用户希望机器人在巡检时随时比对,看出环境有没有差异。地图因此要够密、位置要够准,机器人也得记得上一次看过什么。
问题是,这些记忆需要随时被更新。工厂、仓储、卖场的环境常在变动,料架被移动、走道被暂时堆放、产线改造。所以不能只靠定期重建一次地图,机器人得边执行任务边更新。
更新也不必一臺包办。上一篇谈的车队协同,搬到室内同样适用,几臺机器人一起建图,也一起更新「空间」记忆。只是规模不同,路上每天有大量车辆经过同一段路,厂区里往往只有少数几臺机器人,每一次观测都重要。协作时的座标一致性、更新帶寬、运算能力、以及观测不一致时的调整等,各个技术环境都是一个全新挑战。
还有一层干扰来自现场走动的人员与移动机具。多数SLAM假设场景是静止的,这些移动中的人与机具会被划进地图,既干扰定位,也留下抹不掉的残影。常见的做法是额外加上语意分割模型把它们挑出来,代价是画面处理时多花几秒,耽误實時性。我们最近的研究换了个方向,使用追踪器算过的信號判断哪些像素在动,善用时序以及既有的结构信號,降低繁重的深度学习运算,成本可以降低几十倍,使用单一镜头摄影机,在单张消费级显示卡上每秒可以超过20帧。
前面谈的都是怎么把环境记下来。再往前一步,地图甚至开始直接进到模型的推理里。模型读取的脉络(context)也不再只有文字token,开始出现带有3D位置与视角信息的空间token。2026年一项研究把单眼影片重建出的3D特征与鏡頭视角做成空间token,连同影像本身的视觉token一起喂给语言模型,显示物件计数与路线规划都跟著改善。这类做法目前多在室内场景验证,搬到整座厂房、或是大范围的场域还没有定论。
如果机器人进去场域前连地图都没有,任务进行的难度更高。例如,紧急进到灾后或结构受损的建物,楼板与楼梯可能已经变形,机器人得一边走一边把3D的图建起来,还要记得刚刚看过什么,才知道哪里还没去过、哪条路可以通行,万一受困又该从哪里撤出。推理的结果决定下一步往哪走,下一段地图(记忆)也跟著长出来。这还在很早的阶段,真实灾场的烟尘、照明与通讯条件,都比实验环境更恶劣。
这种按位置取记忆的需求,已经开始改变系统怎么做快取。语言模型用键值快取(KV cache)把算过的留著避免重算,存儲器因此成为推论瓶颈之一。也有研究指出,模型连续推演影片画面时,每一帧就要上千个token,1分钟的推演累积到数十万个,吞吐量大幅降低。一般做法是丢掉最旧的,但是在空间自主运作时,再回到同一个地方,先前看过的空间记忆就没了。已经有做法把快取按鏡頭位置分块保存,回到同一个位置时再取回对应的那几块,不必重算。等于用位置而不是时间,决定什么该留下。
地图要能导航,也要能当作空间记忆,让模型拿去推理。SLAM这个老题目,因此有了新的角色。所以Physical AI需要的,可能不只是更长的脉络或更多存儲器,而是一套知道哪里该记、什么时候该更新、哪些东西可以忘掉的记忆系统。