研报正文总结
1. 算力能效成本三大挑战
智能化转型面临算力需求爆发、效能瓶颈(CPU实际利用率10%-15%)和稳定性与成本瓶颈(牺牲成本优先保障业务稳定性)三大挑战。业务资源需求呈现固定资源与弹性混合模式,某业务一天弹性用量达数百卡GPU。
2. 技术支柱:云函数超级节点与原生节点
为应对挑战,提出云函数超级节点和原生节点两大技术支柱:
云函数超级节点
- 特点:Serverless容器服务,自带50000 TPS网关,主动弹性扩容,支持任务/请求排队,费用与容器对齐,资源可跨地域、跨项目复用。
- 价值:极低门槛管理Serverless资源,像管理一台Node一样管理Serverless资源,迁移成本低,运维成本低,成本管控灵活。
- 性能:冷启动10-25秒,热启动3-5秒,支持包月/按量/离线资源,适合通过副本数量控制弹性的场景。
- 计费:支持包年/按量/离线资源,建议包月资源配合超级节点按量使用。
原生节点
- 特点:腾讯自研能力全面加持,FinOps产品化支持(CPU Burst、内存压缩等),支持GPU虚拟化,适合POD req和limit配置不相等的场景。
- 性能:CPU节点2分钟启动,GPU 8卡非HCC节点3分50秒启动,支持包月/按量资源。
- 优势:资源保障足,超安全稳定,极致可靠,多种资源供给方式。
3. 创新场景:调度重构与体验重构
智能辅助驾驶
- 场景:百Gb吞吐数据处理,算力错峰复用实现最优成本。
- 解决方案:任务实时接收进入待执行队列,智能调度离线任务,动态GPU资源池调度。
- 落地效果:使用700+卡GPU卡即可完成1600+TB/天的数据处理,总成本降低30%。
EMR on TKE
- 架构:基于TKE集群,任务提交后由EMR管控配置下发扩缩容。
- 优势:基于预测的回收和本地实时用量的回收,弹性资源上报,节点gos-agent执行规则。
白天推理,晚上训练
- 场景:白天进行推理任务,晚上进行模型训练任务。
- 优势:资源高效复用,降低成本。
关键数据与结论
- 弹性伸缩能力:支持3000/min的并发弹性,计划弹性模式(计划6月GA)。
- 资源保障:在线GPU、在线CPU100%保障,近线GPU/CPU中等保障,离线GPU/CPU尽力而为保障。
- 性能对比:TKE Serverless冷启动耗时<5秒,原生K8S节点资源耗尽耗时约3分钟。
- 成本优化:超级节点与原生节点结合,实现资源复用,降低30%成本。