当前位置:首页 > 科研成果库

自主系统研发:我们离真正的智能还有多远?

2026-08-04 09:32:50小研科研成果库16

做自主系统第三年了,头发少了,bug多了。上周测试无人车,它突然在十字路口停下来对着空气鸣笛——我们查了三天,结论是阳光角度偏了15度,视觉系统误判了阴影。对,就这么简单。而且这种事情你没法写在论文里,对吧?一边崩溃一边还得改代码。

说实话,外界对「自主」这个词误解太深。以为装上激光雷达、跑个深度学习模型就万事大吉了。有一回投资人来参观,非让我们把避障系统关掉,说「这样才能看出真本事」。你猜怎么着?车子缓缓撞上垃圾桶,他还挺兴奋,觉得有数据了。我——算了,不提。

但话说回来,近两年确实有几个突破让人眼前一亮。比如基于神经辐射场的场景重建,以前要靠人工标注的三维地图,现在用消费级相机转一圈,算法能自动生成厘米级精度的环境模型。不过这种技术想实时跑在嵌入式设备上,还是奢望。功耗、计算延迟,哪个不是坑?

感知-规划-控制?说好的闭环呢

教科书的经典架构,一拆开处处是裂痕。感知模块会把塑料袋识别成行人,规划模块设计的轨迹偏偏穿过消防栓,控制模块为了避让一只狗猛打方向盘——然后宕机。整个链条里每个环节都在做局部最优,合起来就是灾难。而且时序对齐做得稀烂,明明传感器延迟才几十毫秒,但累积到决策时整个系统的反应像老年人的反射弧。

自主系统多传感器融合时序错位示意图自主系统多传感器融合时序错位示意图

去年参加一个竞赛,我们队突发奇想,用因果推理替代单纯的模式匹配。比如识别停止标志,不是因为它长得像,而是因为它「意味着必须刹停」。尽管在仿真里表现一般,真实路测反倒可靠多了。后来查原因,发现是训练数据太干净,而我们那个方法对纹理变化不敏感。不过竞赛评委完全不认可,说不够端到端——啧,学术界有时也挺顽固的。

从实验室到真实世界,中间隔着一万个Corner Case

什么长尾问题,简直是个鲸鱼尾巴。下雨天摄像头起雾、突然窜出的球后面跟着小孩、地图上根本不存在的施工路障……你永远猜不到下一秒会发生什么。我们团队有个文档,专门记录奇异场景,已经快两千条了。其中最离谱的一个:有辆测试车在郊区遇到一匹脱缰的马,激光雷达点云里那玩意儿看起来像一堆杂乱的柱状物,算法直接拒绝了识别。后来人工接管才没撞上。事后分析,目标检测模型根本没包含马这个类别——谁家数据集会放马啊?

安全冗余设计说起来简单,落地时却是巨大的成本漩涡。 感知要双冗余,计算平台要双冗余,执行器还得双冗余,最后车重超标,续航缩水。更别提软件层面的监控和降级策略,万一主系统死锁,备份系统得在几十毫秒内接管,并且状态同步不能错一比特。我有时候觉得,我们不是在造产品,而是在解一团缠死的线。 自动驾驶系统安全冗余架构设计图自动驾驶系统安全冗余架构设计图

但转折来了。今年初行业有个案例,一家初创公司用仿真结合少量真实数据,竟然生成了覆盖九成以上罕见工况的测试集。不是靠盲目增加数据,而是用生成式AI补全了可见物的物理交互——比如模拟塑料袋在风中的运动轨迹。他们把碰撞率压到了十万分之一以下。方法很聪明,不过人家保密,细节一概不透露。气得我们啃了两周论文,也没复现出来。

别迷信深度学习,自主系统需要的是常识

没错,深度学习让端到端系统变得性感。可是你见过哪个纯视觉方案能正确理解交警的手势?手臂挥动幅度、身体朝向、周围车流密度——全是上下文。一个经验丰富的司机瞟一眼就知道该停还是走,但算法只会输出置信度72%的「停止信号」。这种不确定性在封闭园区还行,跑到开放道路就是潜在的杀手。

所以现在很多团队悄悄回退到混合架构:底层仍靠规则,上层用学习模型做意图预测。看似保守,实则有效。我们组试过把知识图谱嵌进去,让车辆明白「救护车鸣笛时所有车应靠边」这类常识。结果呢,测试时碰到一辆警车,它就真的停到路边——可是那条路根本没让行空间,反而堵死了。常识这东西,还得加上灵活变通,太难了。

不过近期有个让我惊喜的进展:符号化强化学习。简单说,就是把策略表示成可解释的决策树,而不是黑箱神经网络。在无人机穿环任务里,它不仅能学会如何飞,还会自行归纳气流扰动规律,甚至能反向纠正姿态传感器的漂移误差。我看了那段飞行视频,无人机像有直觉一样主动绕开乱流区,背后没有人类预编程——那是机器自己摸索出的本能。也许这才是所谓自主的意义。

说到底,自主系统研发就像在黑暗里搭积木,你不知道下一块是平整的还是带刺的。但每当你眼睁睁看着它完成了某个不曾期待的动作,那种惊喜又会冲散所有疲惫。上周我们的物流机器人在仓库里,居然自己学会推开挡路的空箱子,而不是傻等工人来清理。那一瞬间我觉得,头发白得值。