智谱正式上线GLM-5.3-FlashX,最高推理速度达200 tokens/s,较GLM-5.3-Flash提升5倍,价格提升约2.5倍,实现“5倍速度+2.5倍价格”的模型产品分层,重点满足企业客户低延迟、高并发需求。
智谱从Coding扩展至Co-work及Cyber,Co-work行业订单已超10亿元,Cyber场景规模化落地,超100家安全厂商接入。Cyber等场景直接进入企业核心流程,客单价、使用时长及Token消耗有望进一步提升,成为API之外的新增长点。
公司与国内外头部CSP探讨开源模型分成协议,智谱输出模型能力,CSP提供算力、云平台及企业客户渠道,放大Token调用规模,加快海外企业客户渗透,降低自身Capex依赖。
智谱完成50亿美金融资后算力瓶颈解决,GLM-5.3-Flash上线后调用量快速增长,10万张国产芯片推理集群上线后迅速进入高负载状态;Infra Agent持续优化使端到端吞吐提升约3倍。
智谱依赖算力供给,需持续优化Infra能力;海外市场拓展面临竞争压力;Cyber等新场景商业化落地存在不确定性;模型迭代更新需保持技术领先性。