AI销售助手背景介绍
AI销售助手主要通过真实销售录音和外呼话术录音进行语音合成,以提高接听率和转出率。影响接听转出率的因素包括商机质量、话术内容、对话能力(ASR、NLU、DM)以及表达能力(人工录音或语音合成)。语音合成需解决机械感、书面化、口音匹配等问题,并需关注拨打合规率、接听率和接听转出率。
基于真实对话数据的少样本声音克隆
数据来源与特点
数据来源包括真实销售录音和外呼话术录音,采样率选择为真实销售和外呼话术录音。存在的问题包括噪音问题、发音不稳定和数据量不稳定。
数据预处理
使用NISQA语音质量评价模型进行数据预处理,包括MOS(自然度)、Noisiness(噪音程度)、Discontinuity(连贯性)、Coloration(语调丰富性)和Loudness(响度)。人工校对规则中的文本和停顿,修复识别错误的文字,保留口语词,并使用中文逗号、句号或问号表示停顿。
前端文本分析
前端文本分析决定读的准确性,包括文本归一化、分词和停顿说明。韵律分析对于多说话人语音合成模型至关重要。
多说话人语音合成模型
声学模型采用Tacotron2和FastSpeech2,声码器采用Multi-Band MelGAN。训练技巧包括使用合成谱相对原始谱训练声码器音质更好。MB-MelGAN声码器结构包含Generator与Discriminator两部分。
长句合成解决方案
针对长句合成问题,采用分段合并的方法。TestCase显示,长句合成可能不通顺,需要修复长句问题。
声音克隆效果评测
评测维度包括可懂度、自然度和说话人相似度。结论显示,克隆音已十分接近人工录音水平,但仍存在音质、稳定性、口语词和口音问题。
多口音口语风格自然度优化
音质优化
采用数据降噪、模型降噪和TrimSilence等方法。结论显示,适度的数据降噪可以提升整体合成音质,但降噪后训练会使合成频谱有较多的“镂空”,听起来更不自然。模型降噪效果明显,但在实际数据中使用会误伤人声。TrimSilence可以解决静音不稳定的问题,但可能导致发音不准确和突发噪音问题。
发音与稳定性优化
问题描述包括随着文本变化,合成效果波动较大,存在发音不准确的问题。采用文本与说话人/噪音解耦的方法,并使用TransformeràConformer进行优化。结论显示,基于Conformer的声学模型具有更好的发音清晰度与韵律稳定性。
文本风格迁移
口语化程度对合成效果有重要影响。人工录音比合成音更自然的原因包括会犯错、有情绪、有笑声,停顿更加科学,带口音的音频需要对应调整文字描述。改写后的句子包括加口语词、改成四川话风格。模型选择为PromptCLUE-base,通过prompt融合多种和语音相关的任务。数据构造针对不同音色与不同口音个性化构造口语风格,并使用10w组风格迁移数据。
克隆音优势
克隆音的优势包括对不同城市用当地的口音话术,可以提高外呼效果;使用克隆音方便修改话术节点内容;使用克隆音可以高效的更换多种音色。
声音克隆服务部署
语音合成部署方案
采用文本前端、声学模型+声码器的部署方案。语速/音调/停顿控制包括直接对duration乘以倍数控制语速,从前端修改声调控制音调,通过调整fastspeech的duration控制停顿。
未来计划与相关工作
持续优化合成音质,韵律风格迁移,少样本合成一致性优化,压缩新音色的训练时间。相关工作包括WeNet中开源EfficientConformer模型端到端语音识别技术在58同城的探索实践,3人半年打造语音识别引擎——58同城语音识别自研之路,PPT+视频回放|语音技术在58同城的应用,流式和离线语音场景下VAD语音端点检测算法实践,语音识别中的WFST和语言模型。