您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [科大讯飞]:机器人交互现状与趋势展望 - 发现报告

机器人交互现状与趋势展望

机械设备 2026-06-29 科大讯飞 Elise
报告封面

科 大 讯 飞刘 可 为 人机交互的发展史就是走向自然交互的发展过程 万物智联时代大模型引领机器人交互新体验 人机交互是复杂的系统性工程 智能体 独家AI+麦克风阵列技术,精准识别语音和声源定位 Ø语音属性解耦Ø声源精准定位Ø回声消除Ø信号时空分离Ø自适应场景降噪Ø说话人分离 远场人声增强,多人交互、精准识别 语境感应打断,有所闻、有所不闻 拒识非人声噪声不响应电视、音箱等背景音 会聊天的大模型,人情练达,共情交互 语音识别加入情绪识别能力,从音频中提取说话人当前情感 千万条高情商交互对话数据进行训练,专门为交互打造的语言模型 超拟人合成升级,情绪可调节,情感更丰富 类人记忆系统,共同成长的陪伴搭子 长短时记忆融合架构,让伙伴对你“印象深刻” 用户应用设定基础信息交互中获取和更新基础信息 丰富的内容信源,能搜、能听、能唱、能看 业界首发百变声音复刻,一句话上演角色宇宙 生成语音风格和描述一致性主观体验85.6分 面向鸡尾酒会场景,构建多模态交互范式,打造拟人化交互体验 机器人超脑平台,让机器人理解真实世界 全系列软硬件模组,助力产品快速智能化 覆盖录音、降噪、语音交互、多模态交互和机器人主控 多形态支持,定制方案,结构贴合 面向人形、四足、轮足、桌面等形态定制优化 四足机器人交互:极小尺寸环形四麦 适和可移动桌面机器人和小型四足机器人 尺寸极小4.2cm直径 定位精准360°声源定位 效果无损92%识别ACC 四足机器人交互:基于星闪和UWB的自由跟随 UWB精准定位,360°感知,智能贴身随行 星闪+蓝牙双模 连接方式 多TAG(≥2)同时测角测距工作距离50m /测距精度±3cm /角度误差<5° 锚点同时连接2个TAG、TAG可同时连锚点和手机锚点直径等于两枚1元硬币TAG支持按键、语音输入、NFC、蜂鸣器等功能 极致尺寸功能丰富 性能指标 人形机器人交互:前四后四麦阵,结构贴合 贴合全尺寸人形机器人结构特点,实现360°声源定位,可扩展多模态降噪使用 比环形麦克风阵列更适合全尺寸人形机器人 结构贴合 功能完备 •分布式麦克风,前后距离可调•贴合人形机器人结构要求 •360°声源定位,媲美环形麦阵•支持语音和多模态的分级降噪 安装便捷 效果领先 •原线性4麦可直接扩展•插线即用,安装便捷 •正负10°定位准确率90%•识别率提升至93% 人形机器人交互:双耳麦阵,1米内穹顶式隔音 以麦克风阵列创新实现全球最领先的“抗噪识别” 机器人1米以外的人声和噪声全隔离 人形机器人交互:语音戒指,开放场景精准控制 户外远距离控制,可通过智能穿戴设备实现机器人精确管理 更便捷的接入:麦克风阵列封装版 告别结构设计难题,快速接入验证 •轻薄封装厚度仅8mm,无需占用额外空间•声学可靠封装版经过专业人机交互声学设计•安装快捷支持表贴/嵌入,结构要求大幅降低 更便捷的接入:AI背包和机器人头部,即插即用 不同噪音场景下的降噪方案选择 外挂式AI背包 裸板接入 更自由的交互:全离线接入 支持端侧大模型、本地RAG、离线转写合成、全链路交互 算法能力 硬件平台 低配机器可流畅运行 主流信创平台全适配 1、全离线语音转写和语音合成2、支持中英文混合识别和播报3、端侧热词、数字规整和标点快修 1、转写运行内存<2GB,准确率>95%2、合成运行内存<100MB,MOS>4.03、超拟人合成,支持发音人定制 大小脑主板 系统计算核心,提供强大AI算力支持确保算法模型高效、实时本地运行 更自由的交互:端云融合接入 控制指令端侧极速响应、复杂交互云边弹性扩展、让轻量设备享受云端无限能力 更自由的交互:80种语言支持,30种语言免切换 覆盖东南亚、中国、中东及非洲、欧洲和北美等主要区域,支持公有云和私有化部署 更自由的交互:RobotClaw,实现机器人智能控制 像教人做事一样给机器人派活 人机交互未来展望 更直接的交互反馈 更融合的感知能力 更多元的交互模式 具身智能,交互结果类人方式直接反馈 多模态交互、脑机接口、虚实结合 视觉、声音和触觉等感知技术深度融合 解放生产力释放想象力 用人工智能建设美好世界