机器人交互现状与趋势展望
人机交互发展历程
人机交互经历了从以机器为中心到以人为中心的自然交互发展过程,经历了四次黄金期:1956年人工智能概念提出,1970年第一次黄金期,1990年第二次黄金期,2006年第三次浪潮,2022年第四次浪潮。交互方式从键盘、语音、视觉、触控、多点触摸、手写、手势、脑机、动作等逐步演进。
万物智联时代与大模型引领
在万物智联时代,大模型引领机器人交互新体验。科大讯飞通过麦克风阵列、语音交互开发板、多模态交互开发套件等硬件模组,结合前端声学算法、语音唤醒SDK、WS API等接入方式,以及设备端、云端、三方能力(技能开发、智能体开发、知识库开发、角色开发)和人机交互平台、大模型交互系统、内容平台等,构建智能体开发体系。
核心技术优势
- 原创多型麦克风阵列:线性2麦至环形6麦,独家AI+麦克风阵列技术,实现语音属性解耦、声源精准定位、回声消除、信号时空分离、自适应场景降噪、说话人分离。
- 远场人声增强:测试集MultiM-ASR-Eval-2.0中,多人语音降噪分离准确率达90.1%,三人语音分离准确率达87%。
- 语境感应打断:通过语音VAD、语义VAD、大模型VAD实现智能响应,判断用户是否在对话,避免误响应。
- 会聊天的大模型:语音识别加入情绪识别能力,高情商交互对话数据训练,超拟人合成升级,情绪可调节,情感更丰富。
- 类人记忆系统:长短时记忆融合架构,三层记忆保障个性化交互,单次对话支持超多轮上下文保障模型理解对话情境。
丰富的内容信源
提供4000万首正版音乐、1200万小时有声内容、10+娱乐生活精品智能体等丰富内容信源,支持搜索、听、唱、看等多种交互方式。
多模态交互范式
面向鸡尾酒会场景,构建多模态交互范式,打造拟人化交互体验,支持多模态降噪精准拾音、人脸识别锁定ID信息、视野外语音唤醒临时插入对话、侧向对话等多模态支持3-5人同时交互。
面向开放场景,解决真实世界中人和机器人的交互问题,通过麦克风阵列、语音交互、单人多模态交互、机器人超脑平台等实现理解真实世界。
全系列软硬件模组
- 硬件模组:覆盖录音、降噪、语音交互、多模态交互和机器人主控,包括USB声卡、降噪板、星火超脑板2.0、聆思AI芯片、多模态交互板、语音交互板等。
- 定制优化:面向人形、四足、轮足、桌面等形态定制优化低成本交互硬件,如前四后四麦克风阵列、四足降噪算法、环形6+1麦阵等。
- 交互硬件:适和可移动桌面机器人和小型四足机器人,如极小尺寸环形四麦(4.2cm直径)、360°声源定位效果无损(92%识别ACC)。
UWB精准定位与智能贴身随行
基于星闪和UWB的自由跟随,测角范围水平360°/垂直0°~90°,连接方式星闪+蓝牙双模,目标支持多TAG(≥2)同时测角测距并发连接,锚点同时连接2个TAG、TAG可同时连锚点和手机,性能指标工作距离50m/测距精度±3cm/角度误差<5°。
人形机器人交互方案
- 前四后四麦阵:结构贴合全尺寸人形机器人,正负10°定位准确率90%,识别率提升至93%,360°声源定位媲美环形麦阵,支持语音和多模态的分级降噪。
- 双耳麦阵:1米内穹顶式隔音,双耳8麦麦克风阵列打破传统拾音局限,机器人1米以外的人声和噪声全隔离。
- 语音戒指:开放场景精准控制,续航持久充电<2h,续航5~7天,尺寸小6.8mm宽×2mm厚,防水等级高IP68, 5ATM,重量轻2-3g,链接距离远>5米(安卓),传感器丰富PPG、3D加速度、体温。
便捷的接入方案
- 麦克风阵列封装版:轻薄封装厚度仅8mm,无需占用额外空间,声学可靠,安装快捷,支持表贴/嵌入,结构要求大幅降低。
- AI背包和机器人头部:即插即用无需改动硬件,交互功能全支持,声学保障、科技外观,结构小巧、可夹可贴,支持从语音到多模态的全链路交互。
多种噪音场景下的降噪方案
- 低噪音5人办公室/家居书房:麦板封装版接入。
- 高噪音20人办公室/展会展厅/嘈杂街道/酒店大厅:机器人多模态套件线性四麦、环形六麦、前后双四麦。
- 外挂式AI背包:噪音程度接入难度不同,多模态软核授权裸板接入开发量大、声学结构设计复杂,外形结构贴合,适合量产产品开发量小、声学结构设计简单,外形有影响,适合小批量开发。
自由的交互方式
- 全离线接入:支持端侧大模型、本地RAG、离线转写合成、全链路交互,大小脑主板系统计算核心提供强大AI算力,确保算法模型高效、实时本地运行。
- 端云融合接入:控制指令端侧极速响应、复杂交互云边弹性扩展,让轻量设备享受云端无限能力,端侧处理毫秒级响应、断网可用,云端交互复杂意图理解、信源扩展。
全球覆盖与多语言支持
覆盖东南亚、中国、中东及非洲、欧洲和北美等主要区域,支持公有云和私有化部署,包括翻译助手(支持40+种语言实时翻译)、智能设备控制(支持IoT、智能家居等设备语音控制)、知识问答助手(支持企业内部知识的即时问答)、智能家居语音控制等。
机器人智能控制
通过RobotClaw实现机器人智能控制,所说即所得自主执行,硬件层激光雷达、压力传感器、麦克风阵列、RGB摄像头、深度相机、双目视觉、IMU等多模态感知融合,任务规划与执行、记忆与自学习、自主推理与决策、自然语言理解与交互。
人机交互未来展望
未来人机交互将更融合视觉、声音和触觉等感知能力,更多元交互模式如多模态交互、脑机接口、虚实结合具身智能,交互结果类人方式直接反馈,用人工智能建设美好世界,解放生产力,释放想象力。
科 大 讯 飞刘 可 为
人机交互的发展史就是走向自然交互的发展过程
万物智联时代大模型引领机器人交互新体验
人机交互是复杂的系统性工程
智能体
独家AI+麦克风阵列技术,精准识别语音和声源定位
Ø语音属性解耦Ø声源精准定位Ø回声消除Ø信号时空分离Ø自适应场景降噪Ø说话人分离
远场人声增强,多人交互、精准识别
语境感应打断,有所闻、有所不闻
拒识非人声噪声不响应电视、音箱等背景音
会聊天的大模型,人情练达,共情交互
语音识别加入情绪识别能力,从音频中提取说话人当前情感
千万条高情商交互对话数据进行训练,专门为交互打造的语言模型
超拟人合成升级,情绪可调节,情感更丰富
类人记忆系统,共同成长的陪伴搭子
长短时记忆融合架构,让伙伴对你“印象深刻”
用户应用设定基础信息交互中获取和更新基础信息
丰富的内容信源,能搜、能听、能唱、能看
业界首发百变声音复刻,一句话上演角色宇宙
生成语音风格和描述一致性主观体验85.6分
面向鸡尾酒会场景,构建多模态交互范式,打造拟人化交互体验
机器人超脑平台,让机器人理解真实世界
全系列软硬件模组,助力产品快速智能化
覆盖录音、降噪、语音交互、多模态交互和机器人主控
多形态支持,定制方案,结构贴合
面向人形、四足、轮足、桌面等形态定制优化
四足机器人交互:极小尺寸环形四麦
适和可移动桌面机器人和小型四足机器人
尺寸极小4.2cm直径
定位精准360°声源定位
效果无损92%识别ACC
四足机器人交互:基于星闪和UWB的自由跟随
UWB精准定位,360°感知,智能贴身随行
星闪+蓝牙双模
连接方式
多TAG(≥2)同时测角测距工作距离50m /测距精度±3cm /角度误差<5°
锚点同时连接2个TAG、TAG可同时连锚点和手机锚点直径等于两枚1元硬币TAG支持按键、语音输入、NFC、蜂鸣器等功能
极致尺寸功能丰富
性能指标
人形机器人交互:前四后四麦阵,结构贴合
贴合全尺寸人形机器人结构特点,实现360°声源定位,可扩展多模态降噪使用
比环形麦克风阵列更适合全尺寸人形机器人
结构贴合
功能完备
•分布式麦克风,前后距离可调•贴合人形机器人结构要求
•360°声源定位,媲美环形麦阵•支持语音和多模态的分级降噪
安装便捷
效果领先
•原线性4麦可直接扩展•插线即用,安装便捷
•正负10°定位准确率90%•识别率提升至93%
人形机器人交互:双耳麦阵,1米内穹顶式隔音
以麦克风阵列创新实现全球最领先的“抗噪识别”
机器人1米以外的人声和噪声全隔离
人形机器人交互:语音戒指,开放场景精准控制
户外远距离控制,可通过智能穿戴设备实现机器人精确管理
更便捷的接入:麦克风阵列封装版
告别结构设计难题,快速接入验证
•轻薄封装厚度仅8mm,无需占用额外空间•声学可靠封装版经过专业人机交互声学设计•安装快捷支持表贴/嵌入,结构要求大幅降低
更便捷的接入:AI背包和机器人头部,即插即用
不同噪音场景下的降噪方案选择
外挂式AI背包
裸板接入
更自由的交互:全离线接入
支持端侧大模型、本地RAG、离线转写合成、全链路交互
算法能力
硬件平台
低配机器可流畅运行
主流信创平台全适配
1、全离线语音转写和语音合成2、支持中英文混合识别和播报3、端侧热词、数字规整和标点快修
1、转写运行内存<2GB,准确率>95%2、合成运行内存<100MB,MOS>4.03、超拟人合成,支持发音人定制
大小脑主板
系统计算核心,提供强大AI算力支持确保算法模型高效、实时本地运行
更自由的交互:端云融合接入
控制指令端侧极速响应、复杂交互云边弹性扩展、让轻量设备享受云端无限能力
更自由的交互:80种语言支持,30种语言免切换
覆盖东南亚、中国、中东及非洲、欧洲和北美等主要区域,支持公有云和私有化部署
更自由的交互:RobotClaw,实现机器人智能控制
像教人做事一样给机器人派活
人机交互未来展望
更直接的交互反馈
更融合的感知能力
更多元的交互模式
具身智能,交互结果类人方式直接反馈
多模态交互、脑机接口、虚实结合
视觉、声音和触觉等感知技术深度融合
解放生产力释放想象力
用人工智能建设美好世界