-
新架构GQA的实现方式
- 采用两阶段检索机制:先用Index Branch进行粗检索,再用Sparse Branch对筛选出的block执行真实注意力计算。
- 类比阅读过程,避免逐字重读整本书,提升效率。
-
GQA的效果与提升方向
- M3在长上下文处理(1M上下文)中,prefill速度比M2快9.7倍,显著优化推理成本。
- 后续迭代重点在于扩展长上下文能力与降低推理成本,两者均有较大提升空间。
- V4应用的DSA/CSA与GQA类似,均为序列稀疏选择方法,是兼顾精度与成本的核心趋势。
-
Minimax注意力机制的演进
- 经历两轮重大变革:从M1的线性注意力(Lightning)→ M2的全注意力 → 现阶段的序列稀疏选择(GQA)。
- 新机制与DeepSeek的DSA/CSA技术路径交汇,验证了稀疏注意力在降本增效上的有效性。