前阵子,某车企在发布会上抛出一句话,震得圈内人直摇头——他们的车用一个神经网络就能从摄像头直接输出方向盘角度,不需要任何人工写的规则。听起来像科幻片对吧?更像是营销团队喝高了写的PPT。
但这句话背后确实藏着一场真正的技术路线之争:端到端自动驾驶到底是革命性的范式转移,还是又一个被资本催熟的噱头?
先别急着站队。这件事的本质,远比"用一个神经网络开车"这句话复杂得多。
模块化流水线:传统派的"流水车间"
要理解端到端在争论什么,得先看它要颠覆的是什么。
传统自动驾驶系统的架构,基本可以理解为一个高度分工的流水车间。感知模块负责"看"——把摄像头、激光雷达的原始数据翻译成车道线、障碍物、红绿灯这类结构化信息;预测模块负责"猜"——前面的车会不会变道?那个行人是要过马路还是在路边等公交?规划模块负责"想"——我要走哪条轨迹?什么时候变道?控制模块负责"动"——方向盘打多少度?油门踩多深?
每个模块各司其职,模块之间通过工程师明确定义的接口传递数据。感知输出障碍物列表,预测输出行为概率,规划输出轨迹点,控制输出转向扭矩。整个链条清清楚楚,哪里出问题一眼就能定位——是看错了、猜错了、想错了还是动错了。
这种架构最大的优势是可解释、可调试。出了事故,工程师可以回溯日志,看见感知模块把白色卡车识别成了天空,导致规划模块认为前方畅通无阻。问题定位明确,修复路径清晰——要么改感知算法,要么在规划模块加一条兜底规则:前方有大面积"天空"时减速观察。
但模块化流水线的代价是什么?信息在每个传递环节都在流失和扭曲。感知模块把丰富的视觉信息压缩成"前方10米有障碍物"这种干巴巴的标签,规划模块永远不知道那障碍物是一个纸箱还是一块落石——它只能看到标签。更关键的是,每个模块都是工程师用规则和模型手工拼出来的,这意味着每个环节都可能成为瓶颈,都需要大量人工调优。
端到端:让数据自己说话
端到端的思想简单到一句话:既然人类司机看到画面就能直接打方向盘,为什么机器不能?
做法是把原始传感器数据——摄像头图像、激光雷达点云——直接喂给一个巨大的神经网络,让网络自己学会从输入到输出的映射。没有感知、预测、规划、控制这些人为划分的模块,没有工程师定义的中间接口,只有一个黑盒子:输入画面,输出方向盘角度、油门刹车信号。
听起来很疯狂对吧?但细想一下,这其实是最接近人类驾驶本质的方式。没有人教我们"看到红色八角形标志要先识别为停止牌,然后查询停止规则,再规划停车轨迹,最后执行制动动作"。我们只是看过足够多的驾驶场景,大脑就自动学会了"看到这个画面,脚就踩刹车"。
端到端的核心信仰是:驾驶行为本质上是一个从视觉到动作的映射函数,这个函数太复杂了,复杂到人类无法用规则穷尽,但数据可以教会神经网络逼近它。
Tesla FSD V14就是这条路线的激进实践者。根据公开信息,其神经网络参数规模相较上一代提升了十倍——这不是小修小补,而是从"用模型辅助驾驶"到"让模型学会驾驶"的质的跳跃。BEV(鸟瞰图)+ Transformer + Occupancy(占据网络)这套感知栈,已经成为行业新标配,本质上就是把感知模块从"检测物体"升级为"理解空间"。
三种端到端:激进、温和与务实
但端到端并不是只有"纯端到端"这一种形态。行业内目前大致分化出三种路线。
最激进的是直接端到端:传感器数据进,控制信号出,中间完全没有人为设计的结构。这是一种对数据量的极端信仰——只要数据够多,网络就能学会一切。问题是,这种路线对数据量的要求高到令人窒息。Tesla全球车队每天产生数百PB的驾驶数据,但真正有价值的"关键时刻"数据仍然稀缺。更重要的是,这种系统几乎无法调试——出了问题,工程师面对的是一个包含数亿参数的黑盒,根本无从下手。
温和一点的是模块化端到端:网络内部仍然有感知、预测、规划这些子模块的影子,但模块之间的接口由神经网络自动学习,不再由工程师硬编码。这种方式保留了部分可解释性,又避免了人工接口带来的信息损失。Waymo的部分技术路线就带有这种特征——在感知阶段仍然输出结构化信息,但规划控制阶段采用端到端学习。
最务实的是混合架构:端到端负责常规场景,规则系统负责兜底。换句话说,99%的路况让神经网络自己应对,剩下那1%神经网络可能犯错的极端情况,用人工规则保命。这种架构承认了端到端的不完美,也承认了规则系统在安全底线上的不可替代性。目前大部分声称"端到端上车"的厂商,实际上都在走这条路线。
现实困境:黑盒、长尾、安全验证
问题来了:既然端到端听起来这么符合直觉,为什么行业争议这么大?
第一个问题是黑盒不可解释。传统模块化系统出了问题,工程师可以逐层排查:感知对不对?预测准不准?规划合不合理?端到端系统呢?输出错了就是错了,你问网络"为什么这么开",它只能给你一堆梯度下降的数值,不会告诉你"我误判了那个行人的意图"。
第二个问题是长尾场景无法穷举。驾驶场景的数量级是多少?有人估算过,考虑天气、光照、路况、参与者行为等所有变量组合,场景空间是天文数字。端到端依靠数据驱动,但再多的训练数据也只是这个空间中的一个稀疏采样。人类能凭直觉应对从未见过的场景,但神经网络缺乏这种泛化能力——它只能复现训练数据中见过的模式,遇到真正的未知,表现往往是灾难性的。
第三个问题更致命:安全验证怎么做。传统系统可以用形式化方法验证某些安全属性:变道前必须确认安全距离、遇到红灯必须停车。端到端系统呢?你没办法证明"这个网络99.999%不会撞人",因为网络的行为本身就是数据驱动的概率输出。监管机构怎么批准这样的系统上路?出了事故责任怎么界定?这些都不是技术问题,而是制度问题。
更现实的是,端到端系统的迭代方式与传统软件完全不同。传统系统发现bug,工程师定位问题、修改代码、发布补丁,路径清晰可控。端到端系统发现一个corner case表现不好,解决方案是什么?收集更多类似数据,重新训练网络,然后祈祷新网络在其他场景不要退化。这种迭代方式,对习惯了确定性工程的汽车行业来说,简直是一场文化冲击。
为什么行业还在投?
说了这么多问题,为什么Tesla、华为、小鹏这些头部玩家还在往端到端上砸钱砸人?
因为传统路线的天花板已经显现了。
过去十年,自动驾驶行业的普遍预期是:把感知、预测、规划、控制每个模块都做到99.9%的准确率,整个系统就能实现安全的自动驾驶。但现实给了行业一记重锤——每个模块99.9%的准确率,乘起来意味着每千次驾驶就会出现一次系统失效。更何况,在城市复杂场景下,模块化系统感知预测的准确率远达不到99.9%。
模块化系统更深层的问题是:规则是工程师写的,而工程师的想象力有限。你可以写一万条规则覆盖一万种场景,但第一万零一种场景呢?驾驶场景的长尾,比任何工程师团队的想象力都要长得多。
端到端的核心价值,恰恰在于用数据突破人工规则的天花板。人类写不出一百万条驾驶规则,但一百万公里的驾驶数据,可以让神经网络学会人类无法穷举的行为模式。这就是为什么头部玩家愿意赌——赌的不是端到端没有问题,而是赌传统路线已经走到尽头,端到端是突破瓶颈的唯一路径。
我的判断:混合架构是未来十年的现实
说了这么多,我的立场很简单:端到端是自动驾驶的正确方向,但纯端到端大规模上车,至少还需要五到十年。
为什么?
第一,数据量还不够。端到端需要的是覆盖所有corner case的海量高质量数据,而目前即使是Tesla,真正有价值的关键场景数据仍然稀缺。数据收集、标注、训练、验证的完整闭环,还没有哪家公司真正跑通。
第二,安全体系还没建立。传统汽车行业有成熟的功能安全标准ISO 26262,但这些标准都是针对确定性系统设计的。端到端这种概率性输出,如何做ASIL等级划分?如何做危害分析和风险评估?行业还没有共识,更谈不上标准。
第三,责任界定还不清晰。模块化系统出事故,可以说"是感知模块误检,供应商A负责"或"是规划模块逻辑错误,主机厂B负责"。端到端系统出事故,责任归谁?算法供应商?数据标注团队?训练集群运维?这种模糊的责任边界,在事故追责时会引发巨大的法律和商业纠纷。
所以我的判断是:未来五到十年,混合架构会是主流落地形态。端到端网络承担大部分常规驾驶任务,规则系统在安全底线位置兜底。人类司机学开车,驾校教练也会教"不确定就踩刹车"——端到端系统需要同样的保命机制。
纯端到端有一天会上车吗?我相信会。但那需要数据量、安全验证、责任体系三座大山都被移走。在这之前,那些声称"一个神经网络搞定一切"的营销话术,听听就好——真信了,可能就要出事。
端到端是革命,不是噱头。但革命需要时间,需要基础设施的成熟,需要整个行业对"驾驶"这件事的重新定义。在此之前,我们看到的所谓"端到端量产",大多只是在这条路上的早期探索——值得鼓励,但不必神话。
毕竟,真正的革命,从来不是靠PPT完成的。