GPT-6 Astra发布,多维度能力实现大幅升级
模型分阶段灰度上线,多渠道逐步开放调用权限
2026年9月4日OpenAI正式发布GPT-6 Astra,采取分阶段的灰度开放策略:优先定向向部分机构客户开放,后续数日逐步覆盖ChatGPT Plus、Pro、Business、Enterprise全量付费用户,同时支持OpenAIAPI、Microsoft Azure、AWS Bedrock三大对外调用渠道。Pro、Business以及Enterprise企业用户还可额外获取更高规格的GPT-6 AstraPro版本。企业侧工作空间默认关闭Astra访问权限,需要管理员手动开启后才可使用,体现出对高能力模型企业部署的安全管控思路。
计算机自主操作能力显著增强,任务耗时大幅缩减
模型可独立完成大量真实电脑端业务流程:填写线上表单、更新CRM客户档案、整理日历日程、开展网络调研、邮件与文档摘要起草;同时覆盖科学数据分析、图表生成、网站搭建、前端质量校验、软件安装测试、屏幕故障排查等复杂实操任务。OSWorld 2.0延迟模拟测试中,GPT-6 Astra得分72.6%,单任务平均耗时约40分钟;前代GPT-5.6 Sol得分65.7%,单任务平均耗时75分钟,单任务完成时间直接降低约47%。AI不再局限于输出文本、代码,而是可以直接操作软件完成完整业务链路,向自主智能体迈出关键一步,为企业端大量重复性办公流程自动化打开空间。
专业工作流能力强化,模板遵循与多步骤协作能力提升
Astra将电脑操作能力与面向专业环境的训练结合,用于多步骤工作流程,并生成文档、电子表格与演示文稿。发布文将遵循已有模板、匹配写作与视觉风格,以及筛选与任务相关的上下文,列为专业工作能力的具体改进方向。官方展示案例包括:在KiCad中进行印刷电路板布局,将电子原理图转化为可制造的PCB;利用OpenAI演示文稿模板中的少量参考页,制作关于虚构模型GPT-Gaia的幻灯片;在Blender中建模住宅,并将其转化为Unreal Engine 5中的可漫游场景。在人机协作方面,Astra能够利用上下文补全常规信息缺口,并在答案可能影响结果时提出针对性问题。对于重要决定则等待用户输入。Astra能够将新增要求纳入原任务,减少因中途调整而丢失原有目标和约束的情况。
编程能力持续迭代,新增长任务上下文记忆实验性功能
编程依旧是Astra重点优化赛道,多项权威评测指标实现明显提升。Terminal-Bench 4.0评测中Astra得分57.9%,GPT-5.6 Sol仅37.3%;DeepSWE v1.1评测Astra得分74.1%,对比前代小幅提升。针对长时间调试、大规模代码重构这类超长任务,OpenAI为Codex配套全新实验功能:跨上下文窗口保存笔记,同时支持检索历史窗口全部信息。模型可以回溯过往消息、工具输出中的需求、测试结果,不完全依赖笔记压缩摘要保存信息。该功能现阶段处于可配置开启的实验阶段,官方计划数周后将其设置为Astra默认能力,缓解超长任务下上下文丢失、信息压缩失真的行业痛点。
数学与科研能力提升,网络安全能力同步增强
科研数学能力上,FrontierMath Tier4(v2)评测Astra得分97.6%,GPT-5.6 Sol为83.0%;GPQA Diamond评测Astra得分96.0%,前代模型94.6%。官方演示案例显示模型可直接调用专业科研软件完成测序质量校验、遗传变异可视化,真正介入科研实操环节,而不只是输出理论文本。网络安全领域,Astra达到OpenAI Preparedness Framework安全框架的Critical关键能力阈值。关闭生产防护的测试环境中,ExploitBench评测拿到100%满分,GPT-5.6 Sol仅78.5%。面向普通用户的正式发布版本,支持安全代码审查、漏洞修补等防御性工作,但会拒绝生成漏洞利用POC等高风险任务,能力做分级管控,评测高分不等于向普通用户完全放开全部能力。
ARC Prize肯定ASTRA交互推理进展
ARC Prize第三方评测结果显示,在ARC-AGI-3半私有测试集,标准运行框架下Astra(max)得分62.7%;切换至支持跨请求推理状态保存、长对话压缩的Provider Adapter框架后,Astra(high)得分高达99.9%。Provider Adapter框架下,96.0%的关卡Astra操作次数少于人类参与者中位数,平均每关操作次数降低51.7%。ARC Prize机构特别提示:基准测试接近满分,并不等同于实现AGI,封闭测试环境无法完全复刻现实世界复杂多变的真实业务场景,跑分仅作为参考,不能直接等同于真实业务落地效果。不同运行框架带来巨大分数差异,也提示我们,模型实际产出效果,是模型本身能力+运行调度框架共同决定。
来自产业专业用户的真实反馈,复杂业务场景实用性得到验证
OpenAI引用多家产业机构的实测反馈,印证Astra在真实专业任务中的表现。法律服务商Harvey应用研究负责人Niko Grupen反馈,Astra处理复杂法律任务时,可以区分原始文件与既定业务记录,识别材料中缺少论据支撑的假设,并且把信息缺口转化为可落地的法律起草立场。AI开发公司Cognition研究高级副总裁Silas Alberti表示,电脑操作、文本写作、代码库理解能力的升级,直接优化Devin产品内部测试效果,输出视频可读性更强,业务报告更加简洁清晰。来自产业端的反馈,说明模型能力已经可以对下游产品形成实际赋能,而不只是停留在演示案例层面。
市场核心担忧:商业化是否高度依赖编码赛道,非代码场景落地进度存疑
现阶段大模型商业化收入很大一部分来自代码生成、代码辅助类Coding场景。编码需求付费意愿强、价值容易量化,是海内外模型厂商ARR增长的核心支柱。但市场同时存在顾虑:除编码之外,办公、法律、科研、硬件设计、工业流程等大量非编码专业场景,当前模型大多仅能完成信息摘抄、初稿辅助,很难交付可以直接落地的完整成品,端到端闭环能力不足。市场担忧非编码领域商业化落地节奏会显著慢于编码赛道,大模型长期商业化天花板会被约束。若B端付费长期集中在软件开发赛道,整个大模型行业市场空间将受到压制,会影响市场对大模型企业长期价值的判断。
GPT‑6 Astra发布的核心信号:不只是编码变强,非编码专业场景能力迎来实质性跃迁
本次迭代中,编码能力固然继续提升,但更大的亮点恰恰集中在编码之外的各类专业工作交付能力:自主操作电脑完成表单填写、CRM维护、日历管理;直接输出符合企业模板规范的PPT、表格、正式文档;完成PCB硬件设计、3D建模引擎联动、法律材料梳理、科研数据分析等大量非代码专业任务。这意味着,除软件研发之外,企业内部通用办公、法务、科研、硬件研发等岗位,都打开了AI降本增效以及商业付费的想象空间,大模型商业化并非只有Coding单一主线。现阶段优先看好结果易核验、出错易修正的普通办公自动化场景;法律文书、科研结论、网络安全等高风险业务,模型输出必须经过专业人员审核,不能直接采信模型输出。官方演示案例不能直接等同于全行业规模化生产力提升。但产业趋势层面,Astra证明非编码场景模型能力迎来拐点,办公、专业服务赛道商业化落地节奏有望加速,拓宽大模型整体商业化空间。
未来大模型竞争不局限于代码能力比拼,面向真实B端岗位的任务交付能力将成为拉开商业化差距的关键
国内厂商除打磨编码能力外,也需要在通用办公、多行业专业工作流、计算机操作智能体方向持续投入,挖掘更广阔的商业化空间。