GPT-6 Astra在自动化任务表现显著增强,AutomationBench从18.1%提升至41.4%;OSWorld2.0从65.7%提升至72.6%;ScreenSpot-Pro从76.9%提升至92.7%。单任务耗时减少约47%,支持Excel、Power BI、KiCad等专业软件的持续操作,Agent应用场景延伸至设计、工程和办公工作流。
GPT-6 Astra支持105万Token上下文及12.8万Token最大输出,512K-1M长上下文MRCR得分达96.3%,较Sol提升22.5pct。通过异步工具调用、中途纠偏及跨上下文检索功能提升长任务连续性,综合智能指数小幅升至61.2,Coding Agent指数升至67.0。Max档Coding Agent任务Token用量约为Sol的1/3,性能增量主要来自任务状态保持、无效探索减少及长流程交付效率。
Astra在专业软件操作、长任务处理及跨场景应用上实现突破,推动Agent技术向设计、工程等领域渗透。数小时级任务的落地标志着模型复杂度与算力需求的同步增长,利好国产模型、算力及具备数据和工作流壁垒的AI应用。未来需关注国产模型与算力发展,以及具备核心场景壁垒的AI应用商。
GPT-6 Astra的发布标志着AI在计算机使用领域进入跨越式发展阶段。其长任务处理能力显著提升,支持数小时级连续任务,如大型系统审查时间从Sol的20分钟以上缩短至10分钟;单张建筑照片驱动模型连续运行13小时,生成13类成果。这表明AI技术正从简单自动化向复杂流程整合演进,算力需求持续扩张,国产模型与算力厂商迎来发展机遇。
报告显示AI模型复杂度与算力需求同步增长,可能带来算力资源紧张及成本上升风险。此外,数小时级任务对模型稳定性和数据准确性提出更高要求,需关注模型在复杂场景下的泛化能力。同时,AI应用落地依赖特定行业的数据和工作流壁垒,缺乏核心场景壁垒的应用商可能面临竞争压力。国产模型与算力的发展仍需克服技术瓶颈和生态建设挑战。