腾讯云智算解决方案深耕高性能AI基础设施,坚定基础平台研发与生态建设,打造算存网数安一体的高性能智算底座。核心能力包括:
1. 自研软硬件能力
- 自研星星海AI训练服务器、星脉网络交换机,构建算存网数安+生态的高性能智算底座。
- 发展历程:2019年发布第一代高性能计算集群,2021年推出A100 GPU训练集群并获信通院认证,2022年升级800G星脉网络架构,2023年首发H800 3.2T训练集群、1.6T超带宽训练集群及昇腾910B训练集群,2024年联合Gartner发布AI原生云建设指南,2025年升级智算2.0平台。
2. 智算平台特征
- 云原生、同源同构、场景驱动,支持多元硬件生态,提供TACO Infer推理加速(提升1.5x-2.5x)、TACO Train训练加速(性能提升30%)、星脉网络(3.2Tbps RDMA)、TurboFS/GooseFS(高并发存储)、TKE & qGPU(GPU卡使用率提升60%+)、HCC(高可用计算集群)、向量数据库(10亿级规模,百万级QPS)等。
3. 高性能计算集群HCC
- 训练稳定性领先,全面拥抱大模型,提供云原生一致体验,支持主流AI框架及一键部署。
- 星脉网络:集群规模提升100%,训练通讯耗时占比大幅缩短,自研交换机及光模块实现3.2Tbps接入带宽,成本降低67%。
- 高性能存储:ckpt写入时间缩短90%,样本高并发处理,数据零等待,模型分发时间缩短90%。
4. 丰富的智算生态
- TACO加速套件:提供全流程加速服务,无感接入,极致性能,助力业务加速。
- qGPU:透明替换客户应用框架,代码无需变更,适用AI计算异构计算加速。
- 知识引擎:集成腾讯自研加速技术,提升AI计算效率。
5. 数据安全保护措施
- 构建安全的数据流转环境,包括数据溯源、敏感数据发现、动态脱敏、身份认证、权限控制、数据库安全审计等。
6. 本地部署场景
- 支持公有云能力1:1完全输送,提供分布式云、专有云、私有云多形态分布式部署。
- 全面自主可控,软件开放、硬件开放,蕴含公有云大规模稳定运营的最佳实践。
7. 开箱即用的推理服务
- HAI相关产品:快速部署,丰富模板,可视化AI调试,一站式开发管理工具。
结论
腾讯云智算解决方案通过自研软硬件、高性能计算集群、丰富生态及数据安全措施,打造算存网数安一体的高性能AI智算底座,助力产业突破算力瓶颈,加速释放AI生产力。Gartner®生成式AI云基础设施领域新兴市场象限中位列新兴领导者象限,产品性能、未来潜力维度均位列亚太厂商第一。