大模型正在重新定义软件
人工智能进入大模型时代
人工智能正进入大模型时代,从单模态向多模态发展。ChatGPT 实现了真正像人类一样进行聊天交流,而 Midjourney 则在图像创作领域取得了突破,其作品《太空歌剧院》获得了人类艺术比赛冠军。此外,阿里云视频生成大模型 I2VGen-XL 能够在上传一张图片后 2 分钟内生成高清视频,推动了视频生成行业的发展。
AI 加速了行业智能化升级,创造了更大价值。例如,在金融领域,AI 企业财务异常识别准确率提升了 20%;在医疗领域,药物研发周期从数年缩短到 1 个月;在智能制造领域,工业质检准确率提升了 14%。
大模型训练对分布式技术的挑战
大模型训练对分布式技术提出了挑战,主要体现在以下几个方面:
- 数据预处理:数据预处理频繁、随机小样本读取对文件系统提出挑战。现有分布式文件系统无法同时满足可扩展和低延迟的需求。
- 海量小文件存储:大模型训练需要收集海量多模态小文件,这些文件的特点是任一模态的数据集包含多达数亿至数百亿个小文件,海量小文件的存储对文件系统提出了挑战。
- 海量算力需求:大模型训练需要海量算力,包括模型训练、模型微调和模型推理等环节。
解决方案
针对上述挑战,提出了以下解决方案:
- SingularFS 文件系统:采用元数据解耦的架构,将目录元数据集中管理,实现低延迟路径解析;将文件元数据分布式管理,支持文件数目横向可扩展。
- 诸葛弩大数据处理引擎:采用以数据为中心的执行模式,降低数据读入开销,实现动态负载均衡。
- 分布式检查点策略:针对神威平台的存储架构特点,采用分布式检查点策略,解决进程数不足和负载不均的问题。
- 八卦炉基础软件系统:支撑国产 AI 算力的基础软件集,包括并行加速、通信库、容错系统、内存系统和存储系统等。
- FastMoE 并行加速系统:采用新的并行策略,解决显存容量不足、网络通信量过大、集群负载不均衡等问题。
- IntelliGen 编译器:擅长为 Attention 等访存密集型算子自动生成高性能执行代码。
- 清程推理服务器:使用闲置 CPU 和主存来处理 KV-Cache,提升 GPU 利用率和聚合存储带宽。
- Mooncake 分离式推理架构:以 KVCache 为中心的分离式推理架构,提升吞吐量并降低响应延迟。
国产 AI 算力发展
中国 AI 内循环加速到来,国产算力非国产算力占比快速提升。国家力量推动智算中心建设,引导国产算力发展。国产 AI 芯片和基础软件系统不断取得突破,为 AI 大模型发展提供了有力支撑。
研究结论
大模型正在重新定义软件,AI 技术将迎来爆发式增长。解决大模型训练对分布式技术的挑战,需要从文件系统、数据处理引擎、算力系统、编译器等方面进行技术创新。国产 AI 算力发展迅速,将为 AI 大模型发展提供有力支撑。