事件描述
字节豆包大模型团队发布全新稀疏模型架构UltraMem,有效解决MoE架构推理时的高额访存问题,推理速度提升2-6倍,推理成本最高降低83%。
事件点评
UltraMem在PKM架构基础上优化模型结构、value检索方式和稀疏参数,在保证性能的同时大幅提升推理效率。具体优化包括:
- 优化模型结构:将PKM的单个内存层拆分嵌入Transformer层,实现并行访存和计算;
- 优化value检索方式:采用TDQKR乘法方法精准检索相关value;
- 隐式扩展稀疏参数:引入虚拟内存提升性能而不增加部署复杂度。
实验显示,训练规模达2000万value的UltraMem模型在同等资源下实现业界领先的速度和性能。
推理成本下降加速应用生态繁荣
根据Semianalysis数据,截至2024年底,GPT-3质量模型推理价格下降1200倍。2025年DeepSeek模型成本不到o1模型的1/25,UltraMem将进一步降低主流稀疏模型成本。模型调用价格是用户选择的重要因素,厂商将持续推动成本下降,带动AI应用加速落地,并促进从云端向端侧拓展。
投资建议
重点关注:
- AI应用相关标的:金蝶国际、泛微网络、金山办公、科大讯飞等;
- 国产算力芯片厂商:海光信息、寒武纪等;
- AI服务器厂商:四川长虹、浪潮信息等;
- 算力云厂商:青云科技、优刻得等;
- 端侧硬件厂商:美格智能、乐鑫科技等。
风险提示
AI产品落地不及预期、行业竞争加剧、技术研发进展不及预期。