人工智能正在走出屏幕,进入真实的物理世界。
当AI开始驾驶汽车、操作机器人,或在其他复杂环境中自主行动,它面对的就不再只是生成内容或回答问题,而是如何感知周围世界、实时作出决策,并与人类安全共处。
近日,在香港举行的LEAP East 2026上,小马智行创始人兼CTO楼天城分享了他对物理AI(Physical AI)的最新思考。结合十余年自动驾驶研发经验,他系统阐述了基础模型、AI编程、强化学习与世界模型的快速发展,如何改变自动驾驶系统的研发方式,以及自动驾驶商业化落地还有哪些现实门槛。
最关键的影响是,工程师的角色正经历着翻天覆地的变化。过去,工程师手把手教系统每一步应该怎么做;现在,工程师学会构建训练环境、定义目标与评价体系,让AI自主寻找更优的解决方案。未来,工程师更重要的任务,是作为AI的助手,把人类的经验传授给AI,帮助AI提升自我进化的速度,在更复杂任务中找到更优的解决方案。
在这个过程中,人的知识和经验依然不可或缺,只是发挥作用的方式正在变化——从直接规定每一个动作,转向为AI有效学习与负责任应用创造条件和提供帮助。
AI从“一问一答”到“闭环迭代”
过去一段时间,基础模型的能力快速提升。其中,编程能力逐渐成为衡量模型能力的重要指标之一。
原因在于,编程让AI不再局限于回答一个问题、执行一次指令。当目标和评估标准足够清晰时,AI可以自主编写代码、测试结果、发现问题,再根据反馈进行下一轮迭代。这种不断循环的工作方式,也就是所谓的“Agent Loop(智能体循环)”。
AI由此从一个响应指令的工具,逐渐成为能够持续执行复杂任务、评估结果并持续自我改进的系统。
在楼天城看来,这一变化的意义远不止于软件开发,同样的思路也可以应用于自动驾驶的研发流程:为AI定义清晰的目标和评价标准,让它在可控环境中反复练习、自主评估,并通过一次次循环迭代持续提升驾驶能力。
把车开好,而不只是模仿人一样开车
楼天城将这一思考追溯至现代AI发展史上的一个标志性事件。
2016年,AlphaGo战胜李世石,证明AI可以掌握围棋这样高度复杂的游戏。随后出现的AlphaZero又向前迈出了一步:它不再依赖人类棋谱,而是完全通过自我对弈学习,最终超越了基于人类经验训练的AlphaGo/Master。
这并不意味着人类知识失去了价值,而是说明,人类积累的知识,虽然是AI提升能力的起点,但是也可能成为限制AI能力上限的因素。
这一点对自动驾驶尤为重要。如果系统只是通过大量人类驾驶数据学习如何“像人一样开车”,可以很快接近人类开车的水平,但是它在模仿人类驾驶习惯的同时,也会继承人类驾驶中的不良驾驶习惯。对于一个被要求达到更高安全标准的AI驾驶员来说,仅仅模仿人类远远不够。
“目标必须从‘像人一样驾驶’,转向‘把车开好’。”楼天城说。
这一转变也是小马智行自动驾驶技术研发的重要思路。自动驾驶系统不能只依赖真实世界中的人类驾驶数据,还需要在虚拟环境中通过强化学习自主探索。工程师负责定义什么是“好的驾驶”,AI则通过持续练习,寻找实现这一目标的最佳方式。
为真实驾驶构建一个虚拟世界
要让强化学习真正应用于自动驾驶,仿真训练环境必须尽可能还原物理世界的真实驾驶场景。
自动驾驶车辆面对的,不只是车道线、交通信号灯和其他道路参与者。它还需要理解他人的意图,应对不确定性,并在真实交通中与车辆、骑行者和行人完成复杂互动或博弈。
虚拟世界越接近真实世界,自动驾驶系统就越能将训练中学到的能力有效迁移到现实道路。如何缩小仿真环境与真实世界之间的差距,也就是“Sim-to-Real Gap”,因此成为关键的技术挑战。
世界模型为这一过程提供了重要基础。借助世界模型,自动驾驶系统可以大规模练习复杂的长尾场景,比较不同决策可能带来的不同结果,并完成自动进化——不必苦苦等待这些极少见的长尾场景在现实中发生,也无需担心在现实中尝试带来的安全风险。
随着技术进一步发展,AI还可以主导自我进化的整个研发过程:发现世界模型的薄弱环节,判断需要补充哪些数据和验证,用于分析问题的根本原因,并给出改进方案实现研发闭环。
由此,真实道路运营、仿真系统、系统评估与技术迭代可以相互连接,形成一套持续自我进化的研发闭环。
同样的逻辑也适用于更广泛的物理AI场景。无论是人形机器人、工业机械臂、无人机,还是在其他物理环境中运行的AI系统,都需要先在安全、可控的虚拟环境中完成自我强化,再能规模化进入真实世界执行任务。
为什么人们对AI有更高要求?
自动驾驶的挑战并不只在技术层面。在圆桌讨论中,楼天城谈到行业面临的一种“双重标准”:人们会认为人类的偶尔犯错在所难免,但AI一旦犯错,却可能被看作整个技术或行业存在问题。
这种更高的期待并非毫无道理。当AI系统逐渐成为社会基础设施的一部分,人们自然会要求它具备更稳定、更可靠的表现。
因此,解决方式不是要求公众降低标准,而是研发出真正能够达到更高标准的AI技术和产品。
对于Robotaxi而言,这意味着其安全表现需要显著优于人类驾驶员;同时,也需要通过持续、可信的验证,让公众有机会亲自体验并逐渐理解这项技术。
信任无法仅靠口号建立。它来自安全的日常运营、透明的评价标准,以及一次次真实而可靠的乘车体验。
监管机构同样发挥着重要作用。通过建立系统化的测试、评估和监测机制,监管机构可以基于客观证据了解技术进展。企业则需要用真实运营表现证明,自动驾驶车辆能够在复杂城市环境中保持安全、高效和稳定。
技术是基础,却不是商业化的全部
当自动驾驶从测试示范走向商业化运营,技术能力还必须与合理的成本结构、可靠的运营体系以及持续完善的监管环境相结合。
楼天城表示,安全始终是首要前提,但Robotaxi能否实现商业上的可持续发展,也取决于车队规模、运营效率和乘客体验。
随着部署规模扩大,更高的车队密度有助于提升车辆利用率和整体运营效率。与此同时,Robotaxi也必须提供乘客真正认可的服务价值,例如舒适的乘坐体验,独立的乘车空间,以及从上车点到目的地的便捷出行。
监管则是决定自动驾驶规模化部署速度的重要因素之一。监管的意义不只是发放运营许可,更在于为企业、政府和公众建立一条有序了解和验证技术的路径。
这个过程一定是渐进式的。但随着系统表现不断提升,监管机构也能够从真实运营中获得更多客观依据。更多部署带来更多经验和数据,而不断积累的信任又能为进一步部署创造条件,两者相互促进。
这一代工程师最重要的课题
在演讲最后,楼天城提出了一个更长远的问题:究竟有哪些人类能力永远不会被AI替代?
他的答案是,这是一个过程,不断发现新可能但又不断被AI否定的过程。随着AI从辅助人类、执行任务,逐渐走向自主创新与系统构建,人与AI之间的能力边界仍在不断变化。例如过去一年,AI逐步证明了人类的编程能力、模型训练、驱动研发体系的能力都可以被AI取代。
但至少在今天,一个相对清晰的判断是:与其把人类和AI看作彼此独立的竞争者,不如寻找更有效的协作方式。人与AI共同工作,往往能够取得比任何一方单独行动更好的结果。
在自动驾驶领域,这种协作将人的工程经验和责任意识,与AI持续迭代的能力结合起来。
这一代工程师面临的核心课题,正是探索人与AI最佳的协作方式,并利用此构建出能力更强,同时也更安全、更可靠、对社会更有价值的AI系统。
这或许正是物理AI的下一阶段:不再止步于模仿人类,而是让AI具备持续自我进化的能力,并以负责任的方式,将这种能力真正带入现实世界。