9月20日,上纬新材旗下的消费级具身智能品牌启元机器人,与腾讯WorkBuddy达成合作。启元Q1和启元T1正式接入这套助手,可以直接调用里面的上万种技能。

过去,机器人接到一个指令就做一个动作。可真实需求千变万化。查一次行情再播报出来。先自我介绍,再比个心。这些事背后都要过三关。听懂,想明白,动手。
接入之后,这套交互方式变了。WorkBuddy擅长理解与生成。它能听懂自然语言,能检索信息,还能调用各类技能去完成复杂任务。启元机器人负责在物理世界里表达和行动。两边合起来,感知和推理接上行动与反馈,这条链路才算真正打通。
大脑和身体,长期是分家的
过去两年,具身智能的热闹大多在硬件那一侧。关节更灵活,手更灵巧,走路也更稳。可看懂一句话然后照做这件事,进展一直慢。原因不难理解。机器人的大脑和身体本来是两套体系。一边管理解,一边管执行,中间靠人提前写好的固定流程接起来。
大模型的工具调用能力成熟了。情况才开始变。模型能挑工具,能读结果,还能自己决定下一步。把它接到设备上,才第一次有了边想边做的空间。需求一变,流程不必跟着重写一遍。
这一步看着小,影响并不小。过去每加一个场景,都要多写一套流程。现在多数的安排,交给模型自己去做。人只要说清楚要什么。
三种接入方式,机器人自己去找技能
这次合作里最值得看的一点,是WorkBuddy的技能插件能力延伸到了消费级机器人上。双方给了三种接入方式。
第一种,启元Q1和启元T1主动调用这套助手的能力。第二种,用户在WorkBuddy里通过连接器绑定机器人,直接用自然语言下指令。第三种,第三方应用和智能体可以借助两边的插件,按任务动态生成技能。
这意味着用户不需要学机器人编程。以展会或者门店为例,只要描述一句,看到有人来到展台,生成一句欢迎语,向前走两步并挥手。系统就能理解任务,生成对应的技能。再经过启元机器人的能力校验和三维仿真预览,才进入真机执行流程。

展台迎宾、行情播报,现场能干什么
两边的联动已经可以用在不少场景里。展台迎宾,资讯播报,互动小游戏,都是现成的落点。
有人当场提问,机器人可以先去检索公开信息,整理之后再语音播报出来。数据一变,动作也能跟着变。比如A股当天涨了还是跌了,它可以用不同的表达方式回应。「十秒谜题」这类轻量互动,也能让它成为活动现场的活跃角色。
换个角度看,这些场景的共同点很清楚。需求来得零散。一场展会里,观众的问题没法提前排练。一个门店里,顾客想听的东西每天都在换。固定动作库覆盖不了,临时写程序又太慢。
还有一点容易被忽略。这些场景里,机器人不需要样样精通。它更像一个前台,先把需求接住,再决定找谁办。剩下的交给后台的程序和工具。

安全是机器人走进现实的前提
能力扩张的同时,安全是机器人真正走进现实环境的前提。
双方在四个层面做了设置。边界先划清。连接权限,能力范围,上机前验证,真机执行。动态生成的技能要经过能力白名单校验。真机的动作需要现场二次确认。这样做的目的,是让机器人每一次行动都更可控,也更可预期。
尾声
启元机器人与WorkBuddy的这次合作,标志着智能体与具身智能开始形成更完整的能力闭环。从执行预设动作,到理解自然语言任务,再到按需求组合不同技能,个人机器人的能力边界会继续往外推。
这同样是WorkBuddy开放生态扩容的一个切片。今年9月2日,它的开放平台正式上线,首批引入超过百家生态伙伴。往后接入的开发者越多,它和硬件与智能体,还有开放技能生态的结合就会越深。
说到底,这类 AI工具 的价值不在参数表上。它把想和做之间那段反复切换的流程,交给了同一套系统。人只需要把需求说清楚。说清楚就够了。剩下的交给系统。
