快科技10月4日消息,SuperCLUE一份最新的具身大脑评测榜单正式对外公布,用来衡量各大AI模型做机器人“大脑”的实际水平。
OpenAI的GPT-6 Astra拿下综合全球第一,国内这边阿里、中兴两家打成平手,并列拿到国内榜单第一名。
具身大脑就是给机器人用的AI大脑。它不光要看得懂画面、听得懂语言,还得会规划动作,指挥机器人去抓取物品、移动导航,处理现实环境里各种突发状况,不是普通聊天大模型那么简单。
这份榜单做了不少真机实测,不只是跑虚拟仿真题目。评测覆盖环境感知、物体识别、长任务规划、物理世界预判等多个维度,把国内外主流模型拉到同一个标准下打分。
最终GPT综合得分遥遥领先,在长逻辑推理、复杂任务拆解上面优势明显,拿下全球第一的位置。
国内阵营里,阿里达摩院和中兴的模型分数一致,并列国内第一。阿里模型擅长时空记忆,机器人被打断任务之后,还能记住之前没做完的事;中兴的版本则更偏向端侧落地,适配硬件,更适合放到实体机器人设备上面跑。
当然榜单也能看出差距,国内头部选手和GPT相比,总分上还有一截距离。遇到特别复杂、步骤很多的连锁任务,国产模型偶尔会出现判断出错,处理陌生环境的泛化能力还有提升空间。
现在做具身大脑的团队越来越多,大厂、创业公司都在往里砸钱。但市面上评测榜单五花八门,不同榜单的测试集不一样,排名结果经常会出现出入。这份榜单优势在于加入大量真机测试,不是只靠虚拟场景跑分,参考价值会更高。
现在人形机器人还处在早期阶段,具身大脑的能力,会直接决定未来机器人到底能干多少实际活。后续各家还会持续迭代模型,国内外的差距大概率还会继续缩小。


