Token作为大模型主流计价、计量及收费单位,其价值并非稳定,不同模态、模型规模下差异显著。Token增长需区分质量,关注任务完成率、人工占比及可优化的重复上下文。计价单位正逐步向结果靠拢,商业模式创新空间大,2028年或更清晰。大模型收费参考云计算、游戏行业路径,未来价值单位或逐步上移,厂商具备运营空间。
训练为前置集中能力资产,成本含GPU租赁、数据研发等,全成本难精准核算;推理为持续可变成本,受输入输出结构、算力利用率等影响。长文档摘要侧重prefill成本,长报告写作、代码生成侧重decode成本,语音对话、多轮交互则两者压力均大。推理成本结构受缓存、算力利用率、延迟吞吐三角约束影响,混合专家模型(MoE)需工程优化才能实现降本。
缓存、算力利用率、延迟吞吐是影响推理毛利率的核心变量。算力利用率直接影响成本效益,缓存优化可减少重复计算,延迟吞吐则关乎用户体验。混合专家模型(MoE)需通过工程优化降低成本,提升毛利率空间。不同厂商在算力调度、缓存管理等方面的能力差异,将直接影响成本控制效果。
当前市场形成两极定价,价格由供给与差异化共同决定。不同类型厂商(独立模型厂商、云厂商、互联网平台)的成本压力与盈利逻辑存在差异。独立模型厂商可能面临更高成本压力,而云厂商依托现有算力基础设施具备一定优势。市场定价正逐步向结果导向转型,未来商业模式创新空间大,预计2028年将更清晰。
需关注模型全成本核算难度、推理动态成本的精准把控,以及商业模式向结果导向转型带来的运营挑战。不同厂商在算力调度、缓存管理等工程优化能力上的差异,将影响成本控制效果。此外,Token消耗质量、业务模式迭代及价格变化趋势也需持续跟踪,以应对市场变化。