腾讯云CLS Agent可观测解决方案的核心观点在于,Agent可观测对象已从关注传统系统的"运行状态"转变为关注AI系统的"系统质量"。传统可观测主要看系统是否稳定运行,而Agent可观测则聚焦于AI系统是否真正达成目标,具体体现在任务完成度、Token消耗与浪费等方面。
Agent生产化后的五类黑盒问题:
- 运行黑盒:难以理解Agent内部推理、工具调用和决策偏差。
- 安全黑盒:高权限Agent的行为审计与授权边界不清晰。
- 成本与资源治理:多租户Agent成本分摊与优化困难。
- 能力地图:面向生产级Agent的全域观测与分析能力体系。
- 客户案例:通过五个案例覆盖Agent生产化的核心问题。
解决方案框架:
- 接入层:统一采集数据。
- 分析层:Session、Trace、LLM、Tool等统一关联分析。
- 数据层:全局总览、链路追踪、会话分析等。
- 应用层:AI诊断、成本归因、异常打标等。
关键数据与案例:
- 某培训机构知识助手:通过调用链瀑布图、会话回放等技术定位答案错误原因。
- 某top教育企业AI平台:通过Skill调用分析实现统一运营和反馈闭环。
- 某头部零售企业:通过Token归因与成本优化实现多租户成本分摊。
- 某金融机构:通过行为链、证据链等技术实现高权限Agent的可控可审计。
- 某top模型厂商:通过坏例沉淀、AI打分等技术优化模型能力。
研究结论:
- Agent可观测不仅是单点Trace工具,而是从接入、建模、分析到Agentic Ops的全域能力体系。
- 通过真实Agent运行数据优化模型能力,实现错误可归因、样本可沉淀、版本可验证、优化可闭环。
- 让企业的Agent在生产中持续变好,通过跑批实验、灰度发布、效果回归等技术实现持续优化。
业务价值:
- 运营更有依据,Token、Skill、模型选型有数据支撑。
- 故障定位更快,从IP/SessionID直达Trace。
- 告警更准确,根因判定更准。
- 过滤探索性错误,只看真正失败。