大模型时代的可观测技术探索与实践
智能涌现
全球大模型技术蓬勃发展,截至2023年7月,国内大模型数量已达130个,超过美国的114个。蚂蚁金融大模型快速演进。
大模型可观测体系
大模型工程包括训练、推理和应用三个阶段,其中Langchain大语言模型(LLMs)应用的框架、Prompt工程及Agent开发、向量数据库等是应用关键。大模型训练通常需要几百甚至上千小时的训练,例如使用1024张80G显存的A100卡训练1750亿参数的GPT-3模型需要34天。
蚂蚁AI-Infra可观测技术分享
蚂蚁可观测性产品Antmonitor是自研产品,支撑内部百万级容器及分钟几十TB的日常数据处理。大模型可观测能力(LLMOps)覆盖训练、推理、应用各个阶段。
AI-Infra可观测技术架构
- 多维时序模型
- 案例一:资源数据多维分析(应用、用户、基础资源数据关联监控分析)
- 案例二:内置Tensorboard查看训练指标(核心模型训练指标监控)
- 案例三:指标监控告警(训练指标、异常事件告警)
- 案例四:推理服务监控(请求耗时、成功率、流量等维度分析)
技术开源
蚂蚁可观测开源产品HoloInsight是面向云原生时代的轻量化、全功能、智能化可观测性产品,集数据采集、洞察分析、智能运维于一体,服务于蚂蚁生态用户及蚂蚁出海业务,核心代码已开源。
LLMOpsPlugins已部分开源
- GPU、OpenAIMonitor、LangChainMonitor插件
- LangChain&OpenAI可观测案例:基于token消耗跟踪模型使用情况,监控接口调用的性能
GOPS全球运维大会2023·上海站