当前,机器人正从“演示者”加速走向“工作者”,具身智能正处于从“小批量试用”转向“大规模落地”关键拐点。在这一产业热潮中,“智源学者·具身智能学术研讨会”于8月27日在北京隆福寺举办。来自北京大学、清华大学、北京航空航天大学、北京交通大学、中国科学院自动化研究所等高校及科研院所的20余位智源学者齐聚一堂,围绕具身智能领域的前沿方向与关键科学问题展开深度研讨。具身智能正在推动人工智能从数字空间走向物理世界,被普遍认为是下一阶段AI发展的重要方向,而智源学者们正站在这一浪潮的前沿——研讨会设置“世界模型”“具身智能”“灵巧操作”三场专题圆桌,在跨学科的思想碰撞中寻找具身智能走向物理世界的可行路径。
![[MD:Title]](http://img1.mydrivers.com/img/20260828/fecd1f69-ea42-4b59-8c09-00eee490afd6.jpg)
在世界模型圆桌讨论中,智源具身模型研究中心负责人王鹏伟担任主持人,智源青年学者、北京大学计算机学院助理教授唐浩,智源青年学者、北京航空航天大学软件学院教授盛律,智源青年学者、中国科学院自动化研究所副研究员李浩然,智源青年学者、清华大学助理研究员崔森参与圆桌讨论。与会学者围绕通用世界模型是否会收敛为单一范式、世界模型该“吃”什么数据、下一个“GPT-3时刻”缺的是规模还是新范式以及世界模型靠什么证明自身价值等核心命题进行了务实而前瞻的探讨。
与会嘉宾认为,当前世界模型范式多元、尚无突出落地效果,但已在视频生成、JEPA 系列、3D 空间表达等主流路线上进行了重要探索;世界模型要真正服务具身智能,需补齐“物理感知”与“策略学习”的能力闭环,并解决“预测出的未来状态如何指导行动”这一关键缺口。在数据层面,专家们围绕第一视角数据、仿真数据与互联网数据的配比及成本账展开讨论,提出“交互性”与“多样性”是训练世界模型的核心标准。在目标与商业化层面,嘉宾指出具身智能之外,AI for Science、医疗、游戏、数字孪生与文旅等同样是世界模型的重要落地方向,并期待以“极快速泛化”与“in-context 学习能力”为标志的技术突变时刻到来。
当前世界模型形态繁多、但尚未落地,打通"预测如何指导行动"的能力闭环,需建设兼具交互性与多样性的高质量数据,并以跨学科协作驱动其下一阶段突破的关键支撑。
![[MD:Title]](http://img1.mydrivers.com/img/20260828/34336c2a-0a14-4337-9f2f-ff408bbc4f20.jpg)
具身智能圆桌由智源研究院认知团队负责人、旋玑智能创始人王业全主持,智源青年学者、清华大学人工智能学院助理教授刘淼,智源青年学者、北京航空航天大学计算机学院副教授刘艾杉,智源青年学者、北京大学王选计算机研究所助理教授陈文拯,智源研究院研究员于智薇参与圆桌对话。与会学者围绕具身智能从实验室走向规模化部署,从数据瓶颈到真机部署挑战等方面展开全面讨论。
与会嘉宾指出,具身智能尚未迎来"GPT 时刻",制约发展的关键不在本体硬件,而在于物理空间的结构化理解与推理能力,以及本体、模型、数据之间缺乏统一标准带来的高迁移成本;多位嘉宾倾向于采用分层式架构,并探索大模型、世界模型与VLA等不同模块之间的协同。围绕数据难题,专家强调仿真与真机数据的差异,呼吁补齐 corner case 交互行为等高质量数据,并建立分类筛选机制。在落地节奏上,与会者普遍认为工业化等垂直场景有望率先商业化,通用智能落地则需两三年乃至更长时间,安全与生态建设须与落地同步推进。
具身智能落地的关键不在本体硬件,而在"大脑"——打通物理空间的理解与推理,以分层架构、高质量数据和统一标准补齐从感知到执行的闭环。
![[MD:Title]](http://img1.mydrivers.com/img/20260828/5a1e932a-84e0-41f8-ab9c-2fc8365f697c.jpg)
灵巧操作圆桌由智源研究院具身数据负责人姚国才主持,智源青年学者、中国科学院自动化研究所副研究员崔少伟,智源青年学者、清华大学长聘副教授眭亚楠,智源学者、北京航空航天大学教授王党校,智源具身智能研究部负责人杨欢参与讨论。与会学者围绕灵巧操作与人类水平的差距、模型路线选择、数据配方设计及触觉感知必要性等议题展开交流。
与会嘉宾指出,当前灵巧手与人类手仍存在显著差距,“手本身尚未 ready”,达到人手级能力需数十年的长期积累,瓶颈可能锁死在材料这一底层层次;近年来驱动器层面的差距已明显缩小,但传感器层面的差距依然最大,主端遥操作设备普遍缺乏力/触觉反馈、采集频率难以满足精细作业需求。围绕数据难题,专家指出灵巧操作面临"哲学性难题"——聚焦单一任务可超越人类,而面向泛化任务则缺乏足够量级的数据来驱动高维动作空间,当前最难的恰是抓取与不同材质处理等基础动作;视触觉近年来在带宽、帧率等技术指标上取得明显进展,但在标准化、稳定性和弹性体耐久性等方面仍有待突破。
当前灵巧操作仍同时面临本体、感知、模型与数据等多重瓶颈,其中触觉感知和高质量交互数据成为嘉宾重点讨论的短板,需要充分补齐从感知到精细动作的闭环。
![[MD:Title]](http://img1.mydrivers.com/img/20260828/c5a16812-818d-4a0b-81d1-1c06ceea0fb2.jpg)
智源学者研讨会是智源研究院为学者打造的自由探讨、深度碰撞、跨界协作的学术交流平台,致力于为人工智能前沿探索提供持续的思想策源。本期活动落地东城区隆福寺,将前沿学术交流与城市文化空间相结合,体现了东城区支持科技创新、汇聚高端人才的开放生态。本次研讨会上,学者们围绕世界模型、灵巧操作、具身智能三个方向,从技术路线、数据策略、模型架构到产业落地展开了系统性思辨,为具身智能的技术演进与发展辨明方向。
在具身智能领域,智源研究院已构建自底向上的全栈技术体系,先后发布悟界·RoboBrain和悟界·RoboOS。正在研发中的悟界·RoboBrain Orca以预测下一个物理状态为核心构建具身大脑,融合大量第一视角交互数据,强化世界模型的具身表征。智源学者研讨会将持续发挥平台作用,推动前沿思想碰撞与跨界协作,为具身智能从“理解世界”走向“进入世界”提供智力支撑。

