登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
小米-张俊博-声音技术的未来——大模型带来的音频算法革新
信息技术
2024-08-21
2023第十二届全球TOP100软件案例研究峰会
刘银河
对大模型的思考
大模型的核心特征
:大模型的成功体现了“发现”而非“发明”,其原理是量变导致质变,效果上呈现“涌现”现象,但人类对其原理尚未完全理解。
大模型的发展方向
:大模型的成功为AI研究指明了方向,尽管其原理尚未完全明晰,但研发门槛较低,推动了大模型技术的快速发展。
大模型的局限性
:大模型目前主要以文本形式训练数据为主,但人类更倾向于视觉和声音交互,未来多模态大模型(如GPT-4-V)的发展将更为重要。
小米的音频大模型探索
小米的IoT平台规模
:小米拥有全球最大的消费级IoT平台,已连接6.99亿设备,其中5个及以上小米IoT设备的用户数占比显著。
小米声学语音技术
:小爱同学背后的语音识别技术框架在手机和IoT设备上针对垂域的识别率极高,已形成成熟的迭代优化流程。
Whisper与小米Prompt-ASR
:Whisper采用多语种训练数据和带有多任务标签的680,000小时监督数据,而小米Prompt-ASR通过prompt约束提升语音识别率。
基于大模型的语音合成
:小米基于大模型的语音合成技术更加自然,支持Prompt定制,如VALL-EX模型展示了显著的合成效果提升。
小米自然语音TTS技术
:小米声音识别技术框架基于基座音频编码器,训练数据时长超过30年,参数量超过10亿,并探索百亿参数量模型。
基座音频编码器的多任务应用
:基座音频编码器已应用于声音增强、编辑和生成,部分具备大模型能力,需进一步整合。
基于Prompt的声音生成
:小米在声音生成领域取得进展,但仍需进一步整合各任务和模态。
结语
大模型的意义
:大模型的成功为AI研究指明了方向,多任务统一学习可带来真正的理解能力和任务自推广能力。
未来趋势
:各任务的统一、各模态的统一是大势所趋。
你可能感兴趣
传媒互联网行业周报:坚定拥抱AI大模型带来的产业革新,新版号强化AI+游戏投资机会
文化传媒
德邦证券
2023-03-26
音频广告创新的现状与未来:2025年音频广告技术报告
文化传媒
AdSwizz
2025-02-03
声音的力量:2026音频从媒介渠道重塑为文化力量研究
文化传媒
电通
2026-06-12
7-5 端侧隐私计算的算法与应用探讨 -王俊
信息技术
DataFunSummit2022:数据安全与隐私计算峰会
2022-07-18
大模型及机器人算法-VLA技术分解
信息技术
-
2026-01-08
【机构龙虎榜解读】多模态+AI大模型+机器人,自主研发深度学习人脸识别算法,在视觉图像识别及人机智能交互方面拥有产业链关键技术,并于去年开始在双足和四足机器人方向展开技术探索,机构大额净买入这家公司
未知机构
2023-12-13
传媒:Aigc/chatgpt:大模型等技术路径带来的变革-数据交换能力;用户=终端
文化传媒
安信证券
2023-03-13
数据交换能力;用户=终端:Aigc/chatgpt:大模型等技术路径带来的变革
安信证券
2023-03-24
戴尔Dell最新财报中明确提及AI带来的业绩增益;全球首部AI长篇电影即将首映,模态大模型快速更迭加速AI应用落地,该公司在动画电影《雄狮少年》制作中已开始尝试与相关AI技术的融合-20240304
财联社
2024-03-04
【风口研报·洞察】GPTs带来AI应用全面爆发,分析师称不具备底层代码能力的“大模型”公司或迎巨大打击,而“核心专业数据库”将成为未来竞争最关键点:2024年A股盈利增速怎么看
未知机构
2023-11-16