GPT-6 Astra在多个测试集上表现突出,数理和逻辑推理能力在ARC-AGI-3测试集中得分99.9%,远超人类测试员;数学能力在FrontierMathTier4 v2测试集上达97.6%,领先Claude Fable 5。编程能力在Terminal-Bench 4.0测试得分57.9%,DeepSWEv1.1测试得分74.1%,优于GPT-5.6 Sol和Claude Fable5.1。Agent和计算机使用能力在Agent’s Last Exam测试中得分59.3%,OSWorld 2.0测试中任务评分更高,输出token量少于GPT-5.6 Sol。
当前大模型行业呈现加速迭代态势,Anthropic发布Claude Fable 5.1和Claude Mythos 5.1,性能翻倍但Fable 5.1因安全漏洞被叫停,凸显监管趋严。智谱GLM-5.2全量开放,支持1M上下文,体现国产模型价值。行业竞争激烈,技术突破与安全合规成为关键焦点。
本报告重点分析了GPT-6 Astra的核心能力表现,包括数理逻辑、编程、Agent和计算机使用能力,并与Claude等竞品进行对比。同时,梳理了行业动态,如Anthropic和智谱的最新进展,以及计算机板块的市场表现,最后提示了技术迭代和市场需求两大风险点。
本周计算机板块相对上证综指跑赢0.09%,表现优于TMT其他行业,显示市场对大模型技术进展的积极反应。板块整体呈现结构性机会,但需关注行业整体估值和资金流向变化。
本报告提示两大风险:一是技术迭代不及预期,大模型能力提升可能面临瓶颈;二是市场需求不及预期,企业应用落地速度可能放缓。需持续关注技术突破和市场需求变化对行业发展的实际影响。