核心观点与关键数据
- Token需求“通胀”:大模型时代,Token消耗量结构性上升,从“问答”变为“干活”,从“单轮”到“Agent的多轮”,推理强度上升,Token从免费流量转变为可计量的生产资料。
- 价格变化:智谱上调GLM Coding Plan订阅价格至少30%,海外云厂商如Google Cloud和AWS也纷纷提价,反映Token需求“通胀”利好云端算力和模型厂商议价权。
- 传统互联网 vs 大模型:传统互联网软件通过免费吸引用户规模,云时代按量计费,而大模型时代以Token消耗为计量单位,Token消耗成为刚需。
大模型时代的变化
- Token成为“可计量的生产资料”:大模型将“对话/写代码/生成内容”等服务转变为依赖算力的在线推理服务,每次推理消耗GPU、显存、带宽和电力,Token成为新的计量单位。
- 供需链条:智谱用户增长导致算力紧张,通过“限量发售”和涨价筛选需求,保护用户体验,并通过分层定价提升毛利和现金流。
Token需求“通胀”的原因
- 从“问答”变为“干活”:编程场景天然消耗大量Token,如重构代码、改写文件、生成文档和跑测试等。
- 从“单轮”到“Agent的多轮”:Agent场景下,模型多次调用导致Token消耗按步骤累加。
- 推理强度上升:深度思考和长链路推理显著提高Token消耗,用户愿意增加投入换取效率。
投资建议
- 大模型厂商:关注能在高ROI场景中维持订阅留存和扩张的公司,如MiniMax和智谱。
- 云厂商与算力基础设施:关注GPU算力、存储和网络I/O等“伴随型消耗”的增长,如金山云、优刻得和首都在线。
- 安全治理与运行时防护工具:关注AI安全平台/治理平台需求,如深信服、启明星辰和三六零。
风险提示