核心观点
- 智算集群需求升级: 大模型发展推动智算集群规模向十万卡级演进,对互连链路带宽、延迟和功耗提出极致要求,传统电互连方案面临“带宽墙”、“延迟墙”及“功耗墙”等瓶颈。
- 光互连技术革新: 芯片级光互连技术通过将光电转换集成到芯片级别,实现电信号传输距离从米级压缩至毫米级,有效解决电互连瓶颈,成为下一代智算基础设施的关键技术。
- 芯片级光互连技术路线: 主要包括近封装光学(NPO)、共封装光学(CPO)和片间光学互连(OIO)三类,其中硅光集成方案目前为主流,VCSEL和Micro-LED方案也具备潜力。
- 国内外产业现状: 国际产业由芯片巨头和光引擎企业牵引,已形成从技术验证到商用量产的闭环,CPO技术正从交换侧向算力侧渗透;国内产业处于起步阶段,虽已制定相关标准,但产业链生态尚未完善。
- 技术挑战: 芯片级光互连技术面临标准化、封装工艺、器件性能、散热、仿真测试及良率等挑战;设备级光互连技术如光交换和LPO也面临可靠性、控制复杂性、光电协同等方面的问题。
- 产业蓝图: 中国移动呼吁产学研合作,构建面向大规模智算集群场景的一贯式全光超节点系统架构,计划分三阶段推进,最终实现全光传输路径和多任务训练负载的高速互通。
关键数据
- 模型参数规模增长速度约每两年400倍,算法结构引入扩散模型、专家系统等,算力需求呈爆炸式增长。
- 超大模型训练过程依赖集群内GPU芯片之间频繁的数据交互,互连速率提升滞后于算力演进,限制集群规模扩展。
- 超节点智算集群展现出互连性能高、算力密度高、能效PUE高等特性。
- 铜缆传输距离限制在10米以内,功耗占比超过40%,速率难以突破200Gbps,布线难度大。
- 光信号传输损耗比电信号低4至5个数量级,传输距离可轻松覆盖数百米甚至10公里以上。
研究结论
芯片级光互连技术是解决智算集群互连瓶颈的关键方案,具有巨大潜力,但仍需克服技术和产业的双重挑战。未来需加强标准化、工艺封装、仿真建模、测试验证等方面的研发,并推动产业链协同,加速技术商用落地,推动我国智算基础设施实现跨越式升级。