太阳【Computer Use能力跨越式提升,Agent进一步走向复杂任务执行】 OpenAI正式发布GPT-6 Astra,在Computer Use、浏览、软件工程、网络安全、科研及专业工作等方向实现全面升级。Astra在OSWorld 2.0得分72.6%,高于GPT-5.6 Sol的65.7%;Agents’ Last Exam得分59.3%,ScreenSpot-Pro达到92.7%。模型可直接操作浏览器及专业软件,完成表单填写、CRM更新、数据分析、网站开发、软件安装测试等多步骤任务,进一步强化端到端Agent能力。 太阳【专业工作与Coding能力继续突破,输出向直接交付演进】 Astra针对专业工作环境进一步强化训练,可执行复杂多步骤工作流,并直接生成文档、PPT、Excel及分析结果;AutomationBench得分41.4%,较GPT-5.6 Sol的18.1%大幅提升,BenchCAD达到95.9%。Coding方面,Terminal-Bench 4.0达到57.9%,较GPT-5.6Sol的37.3%明显提升。同时,Astra在Codex中强化长任务中的上下文管理和信息检索能力,有望提升大型重构、复杂调试等长周期软件工程任务的连续性。 太阳【科研及网络安全能力进一步突破,模型能力边界持续外扩】 GPT-6 Astra在FrontierMath Tier 4达到97.6%,ARC-AGI-3达到99.9%,Terminal-BenchScience 0.1达到64.6%,科研推理能力进一步提升。网络安全方面,Astra在ExploitBench达到100%(GPT-5.6 Sol为78.5%);在另一项专门测试近三个月新披露漏洞的ExploitBench(2026年6-8月)基准中,Astra还发现了两个此前未知的0day漏洞。模型能力正进一步从通用问答和代码生成延伸至科研、网络安全及复杂专业任务。 太阳【价格进一步提升,但任务效率同步改善,复杂Agent商业化基础继续夯实】 GPT-6 Astra API定价为输入10美元/百万Token、输出50美元/百万Token,较上一代模型进一步提升。与此同时,OpenAI披露Astra在真实知识工作任务中的执行效率明显改善,OSWorld 2.0单任务用时由GPT-5.6 Sol的约75分钟降至约40分钟,减少约47%,同时任务得分由65.7%提升至72.6%;结合新版Codex harness后,Mind2Web任务完成速度提升至1.9倍。我们认为,模型单Token价格提升的同时,复杂任务的完成速度和能力上限也在提升,随着Agent逐步进入更高价值的专业工作场景,其商业化空间有望进一步打开。