当具身智能行业资金集中涌向执行层时,灵美智能提出了一个不同的问题:任务从哪里来?
近期,灵美智能正式提出System 4——零售具身智能的自主任务层。这一概念把“任务生成”作为零售具身智能需要独立解决的工程层,认为当执行层能力逐渐成熟,机器人的核心瓶颈正在从“能不能做”上移到“该不该做、什么时候做、谁来做”。
这是架构主张,不是产品发布。
执行层在加速,“自主任务层”仍空白
过去几年,具身智能的进展集中在解决“能不能做”。Physical Intelligence的π₀.₅把真实移动操作和实验室数据结合,让机器人能在未见过的家庭环境中完成操作。Google DeepMind的Gemini Robotics系列展示了高层具身推理模型与动作模型的分工:Gemini Robotics-ER负责环境理解与任务拆解,Gemini Robotics VLA模型负责具体执行。国内,智元WorkGPT定位任务级具身多模态模型,银河通用G1已在商超场景完成取货、交付、盘点和补货。
按照灵美面向零售应用的工程划分,这些能力对应System 1(动作与执行)、System 2(理解与规划)、System 3(预测与评估)。三层能力共同提高了机器人完成任务的可靠性,但它们有一个共同前提:任务已经有人提出。
“去补货”三个字背后,包含了一连串先行判断:货架需要补充、商品值得上架、后仓有库存、这件事值得占用当前设备与时间。机器人接到指令时,这些判断往往已经由店员或业务系统完成了。灵美智能认为,机器人的执行越可靠,“任务从哪里来”这个前置环节就越值得被追问。
学术界在探索,但没靠近零售
自动发现需求、安排工作,在自主智能体研究中已有探索。Shen等人在《Get the Ball Rolling》中提出“自主帮助”任务,机器人不等待人下令,而是观察环境并生成子任务;PEPA 则研究了四足机器人在无外部任务清单的环境中,如何通过内部状态记忆和持续反思自主生成目标;还有研究探索为未见过的真实环境自动生成评测任务。
这些研究共同指向一个方向:目标不必全部来自即时指令。但它们分散于医疗、办公、家庭等环境,并不聚焦零售门店的经营决策。
零售场景需要自己的任务定义、数据依据和评价标准。
System 4是什么
System 1让机器人能够行动,System 2让机器人知道怎样完成任务,System 3让机器人判断行动是否达到预期。
System 4要回答的是:在没有即时指令时,此刻应该发起什么任务?其关键,是把过去隐含在人类经验和业务流程中的"任务发起权",变成一个需要明确设计的系统能力。
按照灵美的工程定义,System 4的输入包括货架、客流与商品状态,也包括库存信息、经营规则和可用资源;输出是带有依据、时机和优先级的候选任务;下游系统再结合实际能力完成分配、规划与执行;执行结果则返回任务层,供下一次判断使用。
它生成的不能只有一句"去补货",还要说明:为什么需要补货,何时需要完成,哪些前提必须成立,什么变化会让这项任务失去必要性。
如果店员已经补好货,任务应被取消;如果后仓库存无法确认,系统应先发起核验;如果出现更紧迫的工作,原任务就需要重新排序。暂时不做、先确认一下、交给店员,同样是任务智能的一部分。
人的作用也因此发生变化:经营人员设定目标、规则与授权边界,系统在这些边界内持续发现任务;遇到信息不足或超出权限的情况,再把判断交还给人。
System 4 想要推动的,是让机器人自主性的起点,从收到指令之后,前移到任务产生之前。
目前处于方案设计阶段
System 4 目前仍是一个架构主张,不是已经验证的产品能力。 灵美方面坦言,当前研发重点仍是下层模型能力。System 4 能否被工程化、能否在真实门店的复杂约束中跑通,还需要时间和数据来回答。
但它定义了一个此前没有被系统回答的问题:在没有人逐条发号施令的情况下,机器人依据什么判断此刻什么值得做?
这个问题不只属于灵美。随着机器人执行能力越来越成熟,“任务从哪里来”将逐渐上升为整个行业需要共同面对的问题。谁能先给出可信的答案,谁就可能定义具身智能下一个阶段的讨论。

