小米汽车端到端全场景智能驾驶系统解析
核心观点与技术路线
小米汽车聚焦“端到端”全场景智能驾驶技术,采用深度神经网络驱动,覆盖从车位启动到高速领航的完整场景。该技术区别于传统模块化架构,通过物理世界直接探索(传感器与执行器收集数据)持续优化AI模型,实现数据驱动和模型泛化,提升车辆在复杂环境下的适应能力。
技术架构与实现
- 物理世界建模框架:采用三层神经网络框架——原始数据观测层(大OT)、深度神经网络特征层(大GT)、显示符号层(大SG)。通过多目相机等传感器收集数据,经神经网络处理形成场景理解,并解码为静态(车道线、斑马线)和动态(行人、车辆)符号表达,支持精准决策规划。
- 动态系统建模与未来预测:针对智能驾驶系统的动态特性,研究未来一段时间内的表现预测。通过数据观测层、隐私特征层和显示符号层联合建模,结合3DGS重建技术、diffusion order regression生成技术等,实现未来特征预测。显示符号层则利用人类认知规则、代码与模型结合完成时序建模。
数据积累与迭代进展
- 数据规模:自2024年3月交付以来,用户车队规模超18万辆,月增超2万辆,日行驶里程近1000万公里,全场景数据从238万clips增长至1360万clips,为千万级模型训练奠定基础。
- 技术迭代:通过英伟达合作优化云端推理效率(标注利用率翻倍、GPU利用率提升30%)和车端模型部署(加速20%-40%)。从高精地图模块化架构快速迭代至端到端架构,场景覆盖从高速领航扩展至全场景(泊车、城区领航),实现连续自驾体验。
关键成就与未来规划
- 全场景覆盖:OTA升级后,车辆具备车位启动、自主泊车、高速/城市领航能力,实现全国范围全场景自动驾驶。
- 持续演进:未来将逐步实现车位到车位的完整体验,持续交付高级自驾功能,并探索三层表达联合时序建模以提升预测精度。
工程优化措施
- 云端优化:自动化标注与GPU利用率提升。
- 车端优化:模型设计、算子性能优化,硬件端图像前处理与点云数据压缩。