自动驾驶是具身智能的上半场?

博主:旭日财富者旭日财富者 2026-08-03 3983

[首发于智驾最前沿微信公众号]2026年5月13日,理想汽车CEO李想在一次公开对谈中提出了一个非常有意思的观点,那就是自动驾驶是具身智能的上半场,通用人形机器人是具身智能的下半场。这个判断迅速在行业内传播开来,被不少人拿来与当年王传福电动化是上半场,智能化是下半场的论断相提并论。仅从自动驾驶是具身智能的上半场这一论断来说,这个说法准确吗?

01是技术底座,还是人才迁徙?

其实有很多人是支持这个观点的,他们认为,自动驾驶已经在感知、决策、控制等核心技术上积累了相当深度,这些能力可以直接迁移到更广泛的具身智能场景中。其实从系统架构来看,自动驾驶与具身智能确实共享相似的框架,它们都需要借助传感器数据实时构建环境模型并做出决策。端到端大模型、VLA(视觉-语言-动作模型)、世界模型这些技术概念,也同时在两个领域被广泛讨论和推进。

但也有一部分人认为,上半场的说法制造了一种逻辑惯性,将先后发生偷换成了因果必然。自动驾驶要解决的核心问题相对单一,即安全的导航移动,这一要求的关键在于环境感知、路径规划和碰撞规避。而具身智能需要同时解决导航移动、运动控制和灵巧操作三大问题,导航移动只是入场券,后两者才是真正的核心挑战。

从技术上看,这两者的区别其实非常明显,自动驾驶在高度结构化的交通规则下追求高效且安全的移动,而具身智能要应对的是更广泛、更复杂的非结构化环境。做一个形象的对比,自动驾驶解决的是让车在平面上不撞东西的问题,而具身智能要处理的是让设备在三维空间里与物体发生交互,两者面临的物理约束和操作对象完全不同。

既然技术上有很多的区别,那上半场论断真正的成立基础在哪里?智驾最前沿以为,上半场的关键或许不在技术本身,而是在人。现阶段,从智驾赛道冲杀出来的工程师们,正携带着被量产工程淬炼出的能力集体涌入具身智能领域,对于这个趋势,智驾最前沿也和大家分析过:智驾人才涌向具身智能,是降维打击还是会水土不服?。

据统计,仅地平线一家就有至少14位核心技术和管理层离职创业,其中13人进入了具身智能赛道;理想汽车前CTO王凯、前智驾技术研发负责人贾鹏等也相继投身具身智能创业。这些人在智驾领域的经验,让他们拥有智驾开发的全套方法论,他们知道如何定义复杂问题、如何在不确定性中拆解任务、如何在资源约束下做关键取舍。

02当VLA走出汽车,还活得下去吗?

2026年,VLA模型成为了连接自动驾驶与具身智能最受关注的技术纽带,VLA在视觉-语言模型的基础上引入动作token,使模型能够从视觉、语言与机器人轨迹数据的配对中联合学习。理想汽车在GTC 2026上发布了MindVLA-o1,并表示自动驾驶只是物理AI的起点,这类基础模型未来将驱动新的具身智能范式;小米开源的Xiaomi OneVL也明确将VLA、世界模型和潜空间推理统一到一个框架里,定位为自动驾驶和具身智能都能用的基础件。

wKgZPGpuo0eACbWLAABRd5L8aUA746.jpg

图片源自:网络

VLA技术可以共享,但存在一个不可规避的问题,那就是延迟,当前VLA模型的推理延迟普遍在100到300毫秒。对于自动驾驶来说,这个延迟的影响很大,当车速72km/h时,车辆在模型推理期间会向前行驶6至8米,在城市路口或高速跟车场景中足以导致碰撞或偏离车道的事故,因此自动驾驶要求端到端延迟必须压缩到50毫秒以内。

但对于人形机器人,多数操作任务都是抓取静止工件、拧螺丝等,对延迟的容忍度更高,即便推理需要200毫秒,机械臂的物理运动本身也会耗时数百毫秒到数秒,模型输出可作为设定值下发,延迟只影响整体节拍而不会直接导致任务失败;只有在应对快速交互时延迟才成为需要考量的关键,但这类场景在具身智能领域并不多见。由此可见,同样的模型架构,在不同的物理载体上对实时性的要求截然不同。

世界模型其实也存在类似的情况,2026年上半年,吉利发布WAM世界行为模型,小鹏发布X-World,小米推出Xiaomi Auto World Model,几乎每一家智能驾驶头部企业都在布局世界模型。世界模型被视为实现通用人工智能的关键拼图,也被产业界看作突破具身智能泛化瓶颈的关键技术,但世界模型在自动驾驶和具身智能两个场景中承担的任务并不相同。

在车端,它主要做场景推演和规划验证,用来测试和优化智驾策略;而在具身智能领域,它需要实现的是真正物理层面的交互推理,如抓取、装配这类动作背后涉及的力学建模。世界模型在两个领域,一个侧重轨迹层面的预测,一个要处理物理接触和操作规划,两者对物理规律的理解深度要求差了不止一个层级。

03从跑起来到干起活来?

从产业的一些数据,也可以看到具身智能的发展潜力,2025年中国具身智能市场规模约9150亿元,预计2026年将达10904亿元,全国具身智能相关企业数量已突破万家;2026年《政府工作报告》将具身智能列为前沿技术重点培育方向;工信部与国资委联合启动的具身智能专项行动,也首次将落地目标量化至万台级。由此可见,在具身智能领域,政策端和市场端的热情已经就位。

市场潜力表现不错,那真实的技术成熟度是否达标呢?有业内人士判断,当前具身智能仍处在从L1向L2、L3过渡的阶段)参照2025年发布的《人形机器人智能化分级》(T/CIE 298-2025)团体标准,L1为基础感知,L2为自主决策,L3为复杂任务),人形机器人可以在部分专用场景中落地,但距离真正的跨场景泛化还有明显距离。星源智创始人刘东将当前具身智能的落地状态类比为2015、2016年的自动驾驶,彼时L2级辅助驾驶也才刚刚开始规模化落地。

现阶段的具身智能确实取得了一些进展,但要说像自动驾驶那样大规模替代人工,还有很长一段路要走。其实回头看自动驾驶的来时路,从2017年大家对L4级量产普遍抱着三到五年就能成的预期,到2026年L2级渗透率才刚超过70%、L3级才刚开始商业化试点,前后经历了差不多十年。具身智能要面对的场景比开车复杂得多,物理交互也丰富得多,这个周期大概率只会更长,不太可能更短。

04自动驾驶是具身智能的上半场吗?

回到最初的问题,自动驾驶是具身智能的上半场这个论断成立吗?

如果我们将上半场理解为时间上先发生、商业上先验证,那它基本成立。自动驾驶确实是具身智能概念下产业化程度最高的应用场景,它率先跑通了从算法到量产的数据闭环,率先建立了传感器、芯片、操作系统的供应链体系,也率先培养了一批懂得如何将AI模型部署到物理世界中的工程人才。

但如果我们将上半场理解为技术上的必经之路或能力上的充分准备,那它并不是严格成立。自动驾驶积累的感知和决策能力可以部分复用,但运动控制和灵巧操作则是新的领域,一套为四轮汽车设计的算法栈,无法直接驱动双足机器人完成抓取和装配。更关键的是,这两者面临的物理规律、交互对象和失败代价完全不同,汽车失控可能造成生命危险,机器人抓取失败可能只是需要重试一次,这种差异也决定了两者的技术路线、安全标准和工程方法论都会走向不同的方向。

可以说,上半场是一个有用的比喻,它帮助产业界理解了两个领域之间的关联和演进次序,但比喻终究是比喻,它简化了现实,也遮蔽了差异。自动驾驶不是具身智能的必然前奏,正如电动化不是智能化的不可逾越的前提。真正连接两个领域的,是那些在智驾领域锤炼过的人才和他们携带的方法论。

从更宏观的视角看,现阶段物理AI的市场正在形成,各车企都在相继发布物理AI,智驾最前沿也关注到了这一现象:各车企相继发布的物理 AI大模型是什么?有何优势?,思略特咨询预计2030年全球物理AI市场规模将达到4300亿欧元,其中自动驾驶和具身智能是核心应用。在这个更大的技术图景中,自动驾驶和具身智能更像是并行推进的两条赛道,共享部分底层技术,但也会各自面对独特的工程挑战。不可否认,它们之间的确存在人才、数据和方法的流动,但这种流动是双向的、渐进的,而不是单向的、决定性的。