智能涌现
全球大模型技术蓬勃发展,中国大模型数量已达130个,超过美国。蚂蚁金融大模型快速演进。
大模型可观测体系
大模型工程包括训练、推理、应用三个阶段。大模型训练需几百甚至上千小时,基础设施痛点突出。LLM应用框架关注GPU资源利用率、硬件故障、模型收敛等。
蚂蚁AI-Infra可观测技术分享
Antmonitor是蚂蚁集团自研的可观测监控产品,支撑百万级容器及分钟几十TB数据处理。大模型可观测能力(LLMOps)覆盖训练、推理、应用阶段。技术架构包括关系模型、时序模型、多维时序模型。应用案例包括资源数据多维分析、内置Tensorboard查看训练指标、指标监控告警、推理服务监控。
技术开源
蚂蚁开源可观测产品HoloInsight,集数据采集、洞察分析、智能运维于一体,服务于蚂蚁生态及出海业务。LLMOpsPlugins已部分开源,包括GPU、OpenAIMonitor、LangChainMonitor。LangChain&OpenAIMonitor插件可跟踪模型使用情况,监控接口调用性能。
核心观点与关键数据
- 全球大模型数量:中国130个,美国114个。
- 大模型训练时间:1750亿参数的GPT-3模型需34天训练。
- Antmonitor:支撑百万级容器及分钟几十TB数据处理。
- HoloInsight:轻量化、全功能、智能化可观测性产品,核心代码已开源。