观点重申:在算力瓶颈背景下,智谱采取“先优化,后放大”的策略。以上下文从200k拓展到1M为例,长上下文并非免费午餐,扩展上下文窗口意味着:1)训练时单步成本暴增;2)需要重新调整位置编码;3)依赖稀缺的高质量长文本训练数据。过早投入算力于长序列训练会挤占提升推理、代码、数学等核心能力的资源。GLM-5.2架构的核心目标是在百万级上下文下,解决“计算”和“显存/KVcache”两条瓶颈。