多模态座舱交互是智能座舱发展的重要方向,它旨在通过整合多种交互方式,让用户与车辆的互动更加自然、便捷和智能。以下是关于多模态座舱交互的一些关键信息:
- 定义:在人机交互中,多模态交互指系统整合人类的视觉、听觉、触觉等感官输入,利用多种通信通道响应,模拟人与人之间自然的交互方式[3]。简单来说,就是你可以用语音、手势、眼神、触摸等多种方式和车机系统交流。
- 核心交互方式:目前主流的是语音与其他模式(如唇动、面部、手势识别等)结合的交互形式,已在多款车型中应用[3]。此外,视觉交互(如眼球追踪)、触控等也是重要组成部分[1]。
- 技术特点与优势:
- 成熟度提升:以科大讯飞为代表的头部厂商推出的多模态交互模型趋于成熟,可通过座舱内软硬件的充分协同强化感知智能和认知智能[1]。
- 场景化应用:能够应用于休息、办公、露营等个性化场景,提供更精准的服务[1]。
- 提升交互体验:使得用户能够更自然、更便捷地与座舱系统进行互动,丰富了交互体验,提高了可用性和直观性[2][3]。
- 简化操作:多模态AI大模型通过更简单、流畅的人车交互方式,将多种功能进行统一调度和管理,降低用户使用难度,推动座舱功能分类和操作简化[4]。
- 发展趋势:
- 向全场景演进:正从单一/部分模态交互模式(如屏幕、音响、语音、触控、手势、简单问询)向综合视觉、语音、声学的感知智能和大模型、语义、翻译的认知智能的全场景多模态交互模式演变[1]。
- 超拟人交互:未来将实现拟人级别的感知、理解、记忆与交互能力,强化情感陪伴、长期协同等深层价值,推动座舱智能体迈向“数字生命伙伴”终极形态[5]。
- 主动服务:随着技术进化和需求提高,未来智能座舱将通过更精细智能的多模态交互,创造更安全、舒适、个性化的驾驶环境,并具备主动服务能力[3][4]。
- 端云协同:基于端云协同、大小协同的交互功能智能分配将成为座舱的应用范式[5]。
- 车企与科技公司实践:
- 蔚来:推出NOMI GPT端云多模态大模型,包含自研的多模态感知、认知中枢、情感引擎和多专家Agent[2]。
- 东风汽车:基于多模态大模型构建智能座舱系统,融合DVR摄像头数据与语音文本,整合舱内OMS摄像头、语音和传感器数据进行多模态识别和意图推理[8]。
- 吉利、东风、广汽等:与DeepSeek等AI大模型深度合作,以提升汽车座舱智能化能力[6]。
- 科大讯飞:作为头部厂商,其多模态交互模型趋于成熟[1]。
总的来说,多模态座舱交互正在深刻改变我们与汽车的关系,让汽车不再仅仅是交通工具,更成为一个懂你、助你、陪伴你的智能伙伴。