背景介绍
腾讯云异构计算平台提供多元化异构实例、领先的虚拟化技术、高性能加速框架和灵活的服务模式,通过GPU、FPGA、NPU等异构硬件和多元算子实现软件框架层面的协同统一,解决高性能计算场景中网络瓶颈问题。
业务挑战
高性能计算场景对网络要求苛刻,VPC网络时延约40-60us,不适用于多机并行计算场景。主要应用场景包括AIGC大模型训练、自动驾驶训练、科研计算和自然语言处理等。
腾讯云高性能计算集群(HCC)
HCC面向大规模AI及高性能计算场景,适用于自动驾驶、商业推荐系统、语音识别、图像识别、人脸识别、AI制药等模型训练场景。关键特性包括:
- 搭配A100、A800及H800NvLinkGPU,提供强大算力
- 低延时RDMA网络,节点互联网络低至2us,带宽支持800G-1.6Tbps
- GpuDirectRDMA:GPU计算数据无需绕行,跨机点对点直连
- TACO训练加速套件:一键提升人工智能训练性能,差异化性能提升
腾讯高性能计算网络方案——星脉
提供极致集群性能与智能运营的计算网络基础设施,包括:
- 自研高性能网络架构:1.6Tbps带宽接入,800T交换容量,流量亲和性FatTree组网
- 自研协议TiTa:端网协同自研协议栈,可编程RDMA拥塞控制算法
- 高性能集合通信库TCCL:拓扑感知流量亲和性调度,负载路径优化,集合通信加速
- 端到端网络运营系统:一键式RDMA网络配置,网卡配置自动部署,网络故障快速定界+快速自愈
腾讯云AI加速套件—TACOKit
集成腾讯自研加速技术,提升AI计算效率,产品形态为AI推理及训练加速组件,使用方法为透明替换客户的应用框架,代码无需变更,适用场景为AI计算。
异构计算加速软件服务产品介绍
一键优化AI分布式训练及推理性能,产品能力包括:
- TACO Train与TACO Infer提供全流程加速服务
- 快速完成工业级训练或推理任务部署
- 无感接入,轻量部署
- 极致性能,助力业务从数倍到数十倍的加速优化
- 全场景支持CPU/GPU,各版本CUDA及Tensorflow/Pytorch/Onnx
自研集合通讯库TCCL
针对星脉网络硬件架构定制设计,为AI大模型训练提供更高效的网络通信性能,基于开源NCCL代码扩展优化,替代客户软件栈中的NCCL库。
大模型预训练加速框架Angel PTM
用更少的资源以更快的速度训练更大的模型。
腾讯云GPU算力隔离套件--qGPU容器虚拟化
qGPU是腾讯自研的新一代容器GPU虚拟化方案,提供算力隔离、资源共享、灵活性、强隔离、在离线混部能力、覆盖度、云原生、兼容性和高性能等特性。
存储解决方案:分布式文件系统
- 腾讯云COS+GooseFS对象存储方案:IO性能要求较低
- 腾讯云CFS文件存储:IO性能要求高
场景及客户案例介绍
- 广告推荐场景方案:提升GMV,助力广告转化
- 解决方案:模型训练使用A100GPU极致算力,在线预测使用T4/A10GPU最优性价比
- 产品组合:模型训练使用高性能计算集群HCC,模型推理使用GPU云服务器,软件加速使用TACOKit计算加速套件
- 自动驾驶场景方案:算法大脑,决定自动驾驶的可靠性和软件定价
- 解决方案:算法训练使用高性能计算集群HCC,算法仿真使用A10仿真集群
- 产品组合:qGPU算力隔离,软件加速使用TACOKit计算加速套件,算法训练使用高性能计算集群HCC,算法仿真使用GPU云服务器
- 降本方案:qGPU算力隔离套件
成功案例
- 某大学NLP大模型训练
- 解决方案:A100&V100GPU高性能计算集群HCC、云服务器CVM、对象存储COS、数据加速器GooseFS
- 测试对比:性能提升显著
- 某车企自动驾驶训练集群
- 解决方案:GPU云服务器、高性能计算集群HCC、云服务器CVM、自动驾驶云、对象存储COS、数据加速器GooseFS
- 测试对比:性能提升显著
附录
- 高性能计算GPU规格:针对场景提供灵活多样的实例规格
- 腾讯云AI加速套件—TACOKit