机器人交互现状与趋势展望
人机交互发展历程
人机交互经历了从以机器为中心到以人为中心的自然交互发展过程,经历了四次黄金期:1956年人工智能概念提出,1970年第一次黄金期,1990年第二次黄金期,2006年第三次浪潮,2022年第四次浪潮。交互方式从键盘、语音、视觉、触控、多点触摸、手写、手势、脑机、动作等逐步演进。
万物智联时代与大模型引领
在万物智联时代,大模型引领机器人交互新体验。科大讯飞通过麦克风阵列、语音交互开发板、多模态交互开发套件等硬件模组,结合前端声学算法、语音唤醒SDK、WS API等接入方式,以及设备端、云端、三方能力(技能开发、智能体开发、知识库开发、角色开发)和人机交互平台、大模型交互系统、内容平台等,构建智能体开发体系。
核心技术优势
- 原创多型麦克风阵列:线性2麦至环形6麦,独家AI+麦克风阵列技术,实现语音属性解耦、声源精准定位、回声消除、信号时空分离、自适应场景降噪、说话人分离。
- 远场人声增强:测试集MultiM-ASR-Eval-2.0中,多人语音降噪分离准确率达90.1%,三人语音分离准确率达87%。
- 语境感应打断:通过语音VAD、语义VAD、大模型VAD实现智能响应,判断用户是否在对话,避免误响应。
- 会聊天的大模型:语音识别加入情绪识别能力,高情商交互对话数据训练,超拟人合成升级,情绪可调节,情感更丰富。
- 类人记忆系统:长短时记忆融合架构,三层记忆保障个性化交互,单次对话支持超多轮上下文保障模型理解对话情境。
丰富的内容信源
提供4000万首正版音乐、1200万小时有声内容、10+娱乐生活精品智能体等丰富内容信源,支持搜索、听、唱、看等多种交互方式。
多模态交互范式
面向鸡尾酒会场景,构建多模态交互范式,打造拟人化交互体验,支持多模态降噪精准拾音、人脸识别锁定ID信息、视野外语音唤醒临时插入对话、侧向对话等多模态支持3-5人同时交互。
面向开放场景,解决真实世界中人和机器人的交互问题,通过麦克风阵列、语音交互、单人多模态交互、机器人超脑平台等实现理解真实世界。
全系列软硬件模组
- 硬件模组:覆盖录音、降噪、语音交互、多模态交互和机器人主控,包括USB声卡、降噪板、星火超脑板2.0、聆思AI芯片、多模态交互板、语音交互板等。
- 定制优化:面向人形、四足、轮足、桌面等形态定制优化低成本交互硬件,如前四后四麦克风阵列、四足降噪算法、环形6+1麦阵等。
- 交互硬件:适和可移动桌面机器人和小型四足机器人,如极小尺寸环形四麦(4.2cm直径)、360°声源定位效果无损(92%识别ACC)。
UWB精准定位与智能贴身随行
基于星闪和UWB的自由跟随,测角范围水平360°/垂直0°~90°,连接方式星闪+蓝牙双模,目标支持多TAG(≥2)同时测角测距并发连接,锚点同时连接2个TAG、TAG可同时连锚点和手机,性能指标工作距离50m/测距精度±3cm/角度误差<5°。
人形机器人交互方案
- 前四后四麦阵:结构贴合全尺寸人形机器人,正负10°定位准确率90%,识别率提升至93%,360°声源定位媲美环形麦阵,支持语音和多模态的分级降噪。
- 双耳麦阵:1米内穹顶式隔音,双耳8麦麦克风阵列打破传统拾音局限,机器人1米以外的人声和噪声全隔离。
- 语音戒指:开放场景精准控制,续航持久充电<2h,续航5~7天,尺寸小6.8mm宽×2mm厚,防水等级高IP68, 5ATM,重量轻2-3g,链接距离远>5米(安卓),传感器丰富PPG、3D加速度、体温。
便捷的接入方案
- 麦克风阵列封装版:轻薄封装厚度仅8mm,无需占用额外空间,声学可靠,安装快捷,支持表贴/嵌入,结构要求大幅降低。
- AI背包和机器人头部:即插即用无需改动硬件,交互功能全支持,声学保障、科技外观,结构小巧、可夹可贴,支持从语音到多模态的全链路交互。
多种噪音场景下的降噪方案
- 低噪音5人办公室/家居书房:麦板封装版接入。
- 高噪音20人办公室/展会展厅/嘈杂街道/酒店大厅:机器人多模态套件线性四麦、环形六麦、前后双四麦。
- 外挂式AI背包:噪音程度接入难度不同,多模态软核授权裸板接入开发量大、声学结构设计复杂,外形结构贴合,适合量产产品开发量小、声学结构设计简单,外形有影响,适合小批量开发。
自由的交互方式
- 全离线接入:支持端侧大模型、本地RAG、离线转写合成、全链路交互,大小脑主板系统计算核心提供强大AI算力,确保算法模型高效、实时本地运行。
- 端云融合接入:控制指令端侧极速响应、复杂交互云边弹性扩展,让轻量设备享受云端无限能力,端侧处理毫秒级响应、断网可用,云端交互复杂意图理解、信源扩展。
全球覆盖与多语言支持
覆盖东南亚、中国、中东及非洲、欧洲和北美等主要区域,支持公有云和私有化部署,包括翻译助手(支持40+种语言实时翻译)、智能设备控制(支持IoT、智能家居等设备语音控制)、知识问答助手(支持企业内部知识的即时问答)、智能家居语音控制等。
机器人智能控制
通过RobotClaw实现机器人智能控制,所说即所得自主执行,硬件层激光雷达、压力传感器、麦克风阵列、RGB摄像头、深度相机、双目视觉、IMU等多模态感知融合,任务规划与执行、记忆与自学习、自主推理与决策、自然语言理解与交互。
人机交互未来展望
未来人机交互将更融合视觉、声音和触觉等感知能力,更多元交互模式如多模态交互、脑机接口、虚实结合具身智能,交互结果类人方式直接反馈,用人工智能建设美好世界,解放生产力,释放想象力。