智算基础设施发展概述
智算,即人工智能算力,是用于支撑加速人工智能算法模型训练与推理的算力,其部署层级分为芯片级、单服务器节点级、多服务器集群级。智算基础设施,即人工智能算力基础设施,是基于人工智能专用算力芯片及加速芯片等组成异构计算架构,以智能计算设施为核心设施,以智能算力集群为核心载体,面向人工智能应用场景,提供所需算力服务、数据服务和算法服务的公共算力基础设施。
供需布局
- 基础大模型训练推动大规模智算集群强增长:大模型的参数规模与对算力的消耗成正比,参数规模越大,对算力的需求越大。推进基础预训练大模型(千亿级以上参数)需要大规模智算集群支撑。万卡集群成为这一轮大模型基建军备竞赛的标配。
- 模型推理应用将构成智算基建第二条增长曲线:随着AI大模型的应用落地,推理智算需求正迎来爆发。大模型推理应用对智算基建的低成本性、实时性、稳定性提出更高要求。
- 区域智算基建布局综合考虑训练与推理需求:国内智算中心单体算力规模分为三个层次,与布局区域特点高度协同。从重点城市来看,我国已初步形成三级智能算力基建布局体系。城市布局智算中心综合考虑区域内AI训练与推理需求。
- 跨区域调度协同强力支撑智算基建供需对接:电信运营商智算基建跨区域调度能力较为突出。地方层面多元异构算力互联互通调度平台持续涌现。为应对当前AI预训练超大模型对AI算力的巨量需求,智算资源跨区域协同研究正在同步推进。
智算基础设施的能力要求
- 算力有效性是核心:智算基础设施的算力有效性,主要指集群算力利用率,其决定了智算基础设施最终的有效算力供给能力。模型计算利用率(MFU)是集群算力性能的核心指标之一。
- 集群稳定性是保障:AI大模型训练面临智算基础设施稳定性、可用度挑战。网络的可用性直接决定着智算基础设施算力的稳定性,网络故障引发的影响具有放大效应。
- 绿色低碳性是前提:智算中心自身能耗和碳排放将带来不小挑战。推进部署高集成性智算液冷整机柜,是当前智算基础设施应对高能耗的先进解决方案之一。构建智能化能耗管控平台,实现自动化按需制冷,也是智算基础设施推进低碳减排的重要手段。
- 服务易用性是亮点:智算基础设施提供云化服务趋势明显。云化服务是智算基础设施能力触达广大中小企业及个人开发者的重要渠道。全栈式技术能力是智算基础设施生态构建的基础。普惠泛在的智算服务是智算基础设施服务发展趋势。
智算基础设施的赋能模式
- 产研合作行业大模型:部分智算基础设施将创新重心放在“AI for Science”,积极联合科研院所与头部AI厂商,深度参与行业大模型应用创新,输出智算资源、算法资源、研发资源等,开展行业大模型的研发,并着力推进产业化落地。
- 龙头引领联合创新:部分智算基础设施牵头整合AI创新全要素资源,囊括算力、模型、算法、数据、场景等核心要素,联合相关领域核心科研机构、高校以及产业链上下游企业等共同发起成立人工智能全要素创新联合体,推动AI技术突破和应用普及,加快人工智能赋能新型工业化建设。
- 央国企示范应用发展:部分智算基础设施着力面向央国企主体支持全栈AI应用发展,积极响应国资委“人工智能+”专项行动要求,依托智能计算基础软硬件方案,推进央国企主体AI应用全栈方案部署,确保性能先进与自主可控。
- 超智融合算力生态:部分智算基础设施以智能超算中心的模式进行赋能,可同时提供智能计算和高性能计算两种技术路线的算力服务,在社会治理、科学研究、生产制造、智能感知、区域治理等方面,都具有更高的算力适配和算法匹配优势,并延伸更为广阔的应用场景及便捷服务。
发展建议
- 投资布局要分类引导,分级建设:基础通用大模型的训练推理,需要大规模智算集群的支撑,技术门槛高、投资规模大。行业大模型研发及落地赋能,技术门槛略低,个性化程度高,适宜作为地方智算基建的主攻方向。
- 服务能力要标准先行,强化引导:重视智算基础设施建设运营的标准化规范化。行业层面应强化标准规范体系建设,推出智算基础设施赋能能力引导性规范。
- 要素资源要联合创新,直击场景:支持智算基础设施运营方牵头AI全要素联合创新,鼓励多种模式探索组建人工智能全要素创新联合体。鼓励先进省市先行先试,组建智算基建全要素创新组织。