语音识别全栈国产化技术实践白皮书总结
一、白皮书简介
《语音识别全栈国产化技术实践白皮书》介绍了一套基于紫光计算机集群和摩尔线程全功能GPU的语音识别解决方案,包含流式语音识别和离线语音转写两大核心服务。该方案具备完整音频预处理与后处理能力(VAD、ASR、标点生成与文本归一化ITN),支持热词增强与垂直领域语言模型定制,输出可选字级/句子级时间戳,满足实时转写、检索索引和高精度后处理需求。系统已通过国家工业信息安全发展研究中心(“国检”)检测,验证其在多种噪声环境下的稳定性和识别准确性。
二、应用场景
- 电话客服质检与话单转写:支持大批量录音离线转写与准实时通话监控,便于质检、关键词抽取与话单归档。
- 会议与访谈记录:长时音频离线转写、自动切句和时间索引,便于内容检索和二次编辑。
- 客服机器人/IVR打点与实时转写:流式模型低延迟输出,结合热词和垂类LM提升行业用语识别率。
- 媒体转写与字幕生成:自动标点、数字与格式归一化(ITN)保证字幕可读性与同步性。
- 行业定制场景:金融、电力、医疗等需要垂直语言模型适配的场景,通过语言模型定制提升专业词识别能力。
三、技术介绍
(一)主要功能
- 支持单声道8k、16k音频请求,覆盖中文普通话、中英混合、英文识别。
- 全链路语音处理能力:
- 语音活动检测(VAD)
- 端到端语音识别(ASR,流式/离线)
- 自动标点恢复
- 文本归一化(ITN)
- 字级/句子级时间戳输出
- 行业定制与增强能力:
- 热词自定义(Custom Hotwords)
- 垂类语言模型定制(Domain LM Adaptation)
- 多场景适配(日常生活对话、电话客服、会议访谈等)
- 多线程调用:支持多线程、多并发请求。
- 高识别准确率:国检测试显示,底噪、高噪环境下关键词识别、连续语音识别、数字识别准确率均大于90%。
- 高识别速度:
- 单张MTT S4000显卡,1并发非流式离线转写RTF 0.02,10并发RTF 0.06
- 流式实时识别1并发RTF 0.08,10并发RTF 0.23
(二)核心技术特色
- 端到端统一架构:支持流式与非流式推理,延迟可控且准确率高。
- 自注意力机制建模:结合摩尔线程MUSA推理架构,提升识别准确性。
- 大规模数据驱动与领域自适应:
- 结合质检大模型生成伪标签数据
- 使用NST技术迭代质检大模型
- 训练语料:数十万小时通用语料+数万小时电话客服垂类语料
- 垂类语言模型微调与深度适配
- 分阶段课程表学习与多任务训练:
- 课程表学习提升模型收敛速度与稳定性
- 多任务联合训练提升边界检测、时序对齐与后处理能力
- 强化学习技术:增强对长音频、含噪音频的解码能力及关键词识别。
- 中英混识别能力:通过自研语音合成大模型生成中英混音频数据,增强中英混识别能力。
- 全链路工程化后处理能力:
- 内置VAD、自动标点恢复、ITN、字级/句子级时间戳输出
- 支持字幕生成、质检索引与精确对齐
- 支持热词注入与偏置、垂直语言模型在线/离线融合
- 推理优化与高吞吐低延迟:算子融合、显存调度与流水线并发优化,降低单样本延时与并发RTF。
- 评测与行业基线:在电话客服等行业数据集上使用CER、NIST等指标衡量,保持行业领先准确率与稳定性。
(三)接口协议
- 流式语音识别接口:
- 交互流程图、接口清单、API调用说明
- 按照0.1s一包发送PCM binary数据
- 示例代码(Python asyncio实现)
- 离线语音转写接口:
- 交互流程图、接口清单、API调用说明
- 发送PCM binary数据
- 示例代码(Python asyncio实现)
四、系统部署
(一)部署架构
(二)配置要求
五、公司介绍
- 摩尔线程:以全功能GPU为核心,提供加速计算的基础设施和一站式解决方案,致力于数智化转型AI计算支持。
- 紫光计算机:提供国产全栈式AI产业解决方案,赋能行业数字化转型,核心业务包括PC终端、智算一体机、智算中心部署实施与运维算力租售。