
具身智能技术路线分化具身智能正处在技术路线加速分化的临界点探索越来越多新模型、新方法也不断涌现。一位科技领域从业者称谈到具身智能的技术路线确实有点 眼花缭乱。前两年大家还在讲 VLA最近一年又开始频繁讨论世界模型、隐空间这些新方向也有团队把强化学习、触觉、在线反馈不断加入模型。每家公司说法不同难以判断哪条路线更有未来。中国电子学会机器人分会主任委员席宁表示目前具身的技术路线仍处在 百花齐放 阶段。不同团队尝试各自方法哪条有效还需实践检验在路线收敛前新思路和方法会不断出现。而且即便都叫 世界模型不同团队对它该学什么、解决什么问题也有不同答案。前沿研究者的新成果美国当地时间 9 月 1 日斯坦福大学教授李飞飞团队发布全球首个多模态世界模型 Atlas其核心围绕 理解和模拟 3D 世界希望模型通过物体位置、形状等理解世界。几个月前李飞飞写文章梳理对 世界模型 的思考将其按功能拆成 Renderer、Simulator 和 Planner目前所谓 世界模型 是这个循环在三个方向的投影且如今世界模型还处于多路径并行探索阶段。8 月 24 日图灵奖得主杨立昆等学者发布论文研究世界模型内部表示物理世界的方式提出用稀疏表征替代稠密表征降低规划预测器复杂度。8 月 27 日杨立昆等人又发布 LeVJEPA拓展学习方法到视频研究 AI 从视频理解世界希望用更少计算量学习物体运动等信息。从产业公司到前沿研究者行业关注核心是模型如何理解和表征真实世界并转化为预测、规划和行动能力。国内具身智能团队也给出具体技术答案从不同方向推进。光象科技的物理原生世界模型清华系背景的光象科技联合清华大学李升波教授课题组发布第一代物理原生世界模型 Phi - WM 1.0 ActEffect。这条路线重点在物理状态、转移和动作影响希望提高机器人泛化能力。光象科技创始人兼 CEO 张涛认为具身智能需验证两方面一是机器人能否理解物理世界底层规律减少试错二是这种能力能否进入真实场景解决传统自动化问题并创造价值。光象实验室首席科学家吕尧表示物理世界的 理解 要落实到模型从数据中学到什么真正拉开能力上限的是反事实数据。具身行业数据和模型会迭代差距可能落在 模型到底学会了什么 上。媒体交流会问答让机器人先搞懂 为什么问光象科技发布的 物理原生 具体指什么吕尧一是 Phi 体系面向机器人与真实物理世界交互设计二是在模型架构和训练方式上从交互数据学物理原生信息核心是物理规律和动作因果关系。问为什么认为要换路线吕尧VLA 触碰能力边界在环境理解和长程任务推理有局限且存在模态鸿沟扩大数据规模训练 VLA 获通用泛化能力策略难度大所以很多团队转向世界模型。世界模型应能表征真实世界状态学习状态转移和动作影响。问怎么判断以预测为主的具身智能路线吕尧纯视频预测路线有效果但从 99% 到接近 100% 困难缺少物理规律约束类似大模型 幻觉 问题难解决机器人需学习物理规律和动作因果。张涛举例说明理解底层规律能让模型更快适应新物体。问为什么认为隐空间状态更适合机器人要拆分物理状态吕尧像素空间预测有优势但存在可靠性和推理效率问题机器人完成任务不需要完整还原视觉细节希望模型提取相关状态信息。在此基础上把状态拆成显式和隐式两部分能明确建模的用物理知识难建模的用数据驱动方法学习。问光象科技的模型和其他隐空间世界模型区别是什么吕尧很多隐式世界模型解决表征问题光象科技更关注在隐空间提取物理信号学习物理规律和动作影响关键是模型学到什么。数据再多也得知道该学什么问从物理原生智能角度决定机器人能力上限的是什么数据吕尧关键是机器人在仿真环境试错产生的反事实数据稀缺的是帮助模型反事实推理和对比学习的数据。问进入物理世界Scaling Law 是否成立吕尧成立且需坚持具身智能行业数据规模距完整描述物理世界还远要思考模型从数据中学什么。问不同数据在训练中承担什么角色吕尧强调 数据职能互联网视频和无动作标注 Ego 数据建世界先验有动作标注的 Ego、UMI、真机和仿真数据学动作和状态关系具体阶段加入真机遥操作和仿真数据仿真中进行反事实采样最后真机和真实场景微调。问多种数据混在一起会干扰吗吕尧不能简单混和用相同目标训练要关注不同数据带来的能力和使用阶段。问互联网视频价值大吗吕尧处理难度不高清洗低质量数据即可用于通用预训练关键是中训练和后训练的反事实校正。问仿真数据占比大吗吕尧现阶段应占绝对大头学习状态转移需大量反事实数据仿真可低成本、大规模生成这类数据需求可能是现实成功示范数据的十倍甚至百倍。问进入新工位或任务需补充多少真机数据张涛取决于技术路径光象科技先预训练再后训练一个任务需补充的真机后训练数据约十几个到几十个小时不超 100 小时可降低对真实数据需求。问具身模型参数规模小受哪些因素限制吕尧目前解决工业场景问题现有规模够用且数据不足时增大参数量无意义长期做通用基础模型参数规模会增加。学会了怎么变成机器人的能力问Phi 世界模型如何参与策略训练和转化为动作吕尧把世界模型从 部署规划器 变成 训练反馈器训练时预测动作结果帮助策略优化训练后把理解蒸馏到策略网络部署时策略模型一次前向计算输出动作。问机器人构型变化模型还通用吗吕尧理论上学习方法通用把不同构型和动作维度编码到统一隐藏空间显式物理状态用标准描述通过注入参数和域随机化让模型学习通用规律。问Phi - Bot X1 切换任务要重新训练和调整体系吗吕尧训练体系不变针对新任务精度等重新建立数据和仿真资产主要是后训练和上机调试周期约几周模型微调策略模块并真机强化学习。问通用大模型公司进入物理 AI光象科技壁垒在哪吕尧通用大模型可做具身智能底座但机器人与物理世界交互还涉及专门结构、数据体系等从通用大模型到具身模型距离大。什么样的 工位才适合具身机器人问为什么把汽车制造作为优先落地场景张涛具身机器人应进入传统自动化难解决的场景汽车制造有未解决的工位适合验证具身智能价值汽车企业对 ROI 敏感且工业标准化高利于规模化。问选择工业场景看重什么什么样的不适合张涛一是具身智能要发挥技术价值简单任务用具身机器人价值不高二是真实需求场景方认可且有实际增益才投入三是有规模化潜力。目前门槛高先集中在有价值、有需求和规模化空间的场景。问怎么判断工位用机器人替代人工还是人机协同张涛不同工位情况不同冲压、焊接等场景有风险目标是逐步替代人工装配、总装等场景短期内难全替代人工人机协同更现实要保证任务稳定、不影响上下游、确保安全光象科技在设计中强化协同安全能力。先把商业化的 1 建立起来问怎么看未来机器人商业模式张涛现阶段这种商业模式难成立要先部署机器人解决问题让客户认可价值再增加能力收费现在要先建立 1。问怎么看与车企的关系张涛光象科技技术和商业路径有独立价值车企希望机器人通用化光象科技更强调生产力价值大家出发点和商业路径不同。问具身智能无规模化商业应用行业会降温吗张涛若未来一两年无技术突破和商业模式行业可能降温若有被验证且有商业价值和规模化潜力的应用会推动行业发展。问从模型训练到真实产线工程难点是什么吕尧关键是仿真资产光象科技在场景建模和三维资产重建有积累可快速建立仿真资产和生成反事实数据。问光象科技接下来战略重点和进展张涛模型会快速迭代要放到真实环境验证复杂任务长期发展成通用基础模型。不分开模型研发和商业落地形成闭环。今年年底可能看到新模型版本Phi - Bot X1 在多家汽车厂产线部署收尾希望 2026 年底看到实际部署效果。