登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
小米大模型端侧部署落地探索
信息技术
2024-10-28
黄武伟
全球人工智能开发与应用大会
晓燚
端侧AI与大模型端侧部署技术探索
01 端侧AI的重要性
定义
:端侧AI指在终端设备上直接运行和处理人工智能算法。
优势
:
可靠性
:减少网络依赖,提升系统鲁棒性。
隐私安全
:本地数据处理,避免数据传输风险。
个性化服务
:根据用户习惯提供定制化体验。
成本效益
:降低云端计算需求,尤其在大规模部署时显著。
小米布局
:小米以“软件×硬件”战略推动轻量化、本地部署的端侧AI技术,依托庞大的端侧设备数量。
02 LLM端侧部署的挑战
核心挑战
:
内存瓶颈
:端侧设备内存有限,难以承载完整大模型。
推理速度
:端侧推理速度较慢(20 tokens/s以内),远低于人类快速阅读速度(100+字/s)。
03 相关技术探索
大模型推理时延优化
优化公式
:推理时延 = 计算时间 + 数据搬运时间。
优化策略
:
减少计算量
:剪枝、量化。
减小数据搬运
:剪枝、量化、投机推理。
LLM剪枝技术
原理
:移除神经网络中不重要的权重或神经元连接。
技术进展
:
ShearedLLaMA
:剪枝深度和hidden dim,但存在KV cache压缩不足问题。
剪枝校准
:通过加mask训练优化损失和稀疏度,剪枝+少量恢复训练可超越同等规模的预训练模型。
TransAct剪枝
:保留深度和hidden dim,减小MHA和MLP模块激活维度,显著降低KV cache占用。
LLM量化技术
定义
:将浮点数值转化为定点数值,降低模型大小和计算需求。
关键问题
:
Outlier影响
:权重中的异常值会显著影响量化精度。
优化方法
:
参数弥补
:逐行量化并调整未量化权重弥补损失。
Outlier处理
:裁剪或放缩Outlier值,结合硬件特性优化计算开销。
放缩转移
:将难量化值等价转移操作。
LLM解码加速技术
推理阶段
:预填充阶段(数据访问搬运)和解码阶段(算力充足但带宽不足)。
解决方案
:投机推理
流程
:Speculative Inference(高效生成候选)+ Verification(并行验证)。
Prompt优化
:通过Prompt tokens生成投机词,利用Attention mask提升效率。
端侧推理效率优化
实践案例
:MiLM端侧部署
模型规模
:1.3B~6.7B参数范围。
平台支持
:高通/天玑GPU及对应NPU平台。
04 总结与展望
核心结论
:通过剪枝、量化、投机推理等技术,可显著优化LLM端侧部署性能,实现高效本地推理。
未来方向
:持续探索模型压缩和硬件适配技术,推动端侧AI大规模应用落地。
你可能感兴趣
黎立-端侧大模型落地关键技术探索
信息技术
2024AI研发数字峰会AiDD北京站
2024-11-17
【风口研报·洞察】小米推出MiMo推理大模型,仅用7B参数超越OpenAIo1-mini,其轻量化设计或驱动AI端侧需求爆发,模型端侧化趋势下端侧算力-提升成为共识..
未知机构
2025-05-06
电子行业点评报告:AI+端侧之AIPC:大模型+生产力,本地化部署第一站
电子设备
开源证券
2025-02-06
大模型获得首批可信证书,探索端侧AI应用场景
信息技术
民生证券
2023-12-29
电子元器件行业系列四:加速端侧AI推广落地,Deepseek本地部署加速端侧AI推广落地
电子设备
国泰君安证券
2025-02-03
计算机行业周报DeepSeek本地化部署持续扩容,端侧AI加速落地
信息技术
上海证券
2025-02-10
计算机行业周报:大模型持续升级,端侧应用加速落地
信息技术
上海证券
2025-12-08
AI行业深度更新报告:大模型“开源、轻量、端侧”化,视频与语音加速落地
信息技术
国泰君安证券
2024-08-04
计算机行业周报:大模型Scaling Law开启新范式,端侧智能加速落地
信息技术
上海证券
2024-09-18
半导体行业12月份月报:AI大模型和端侧应用持续落地,芯片价格持续低迷或展示供给依然充裕
电子设备
东海证券
2025-01-07