GPT-6 Astra发布:复杂任务执行成为本轮升级重点
2026年9月3日,OpenAI发布GPT-6 Astra,重点提升编程、研究、Computer Use及复杂多步骤任务能力,并进一步强调模型从初始需求到最终成果的端到端执行。与此同时,第三方模型评测也开始增加对复杂知识工作、长文本材料处理和Agent任务的考察,模型能否稳定完成真实工作正在成为新的评价重点。
基于此,本报告以新发布的GPT-6 Astra为重点研究对象,并选取GPT-5.6 Sol、Kimi K3、GLM-5.3和DeepSeek V4Pro四款前沿模型进行横向比较,结合公开规格、第三方评测与实际投研任务,观察不同模型在复杂任务执行和成果交付方面的能力差异。
为尽可能还原真实金融Agent的工作流程,本次测评设置了估值建模、多因子回测和行业研究三类典型投研任务,覆盖数据库取数、Excel建模、图表生成、资料溯源和研究报告输出等关键环节,以综合评估各模型的任务完成度、结果准确性、研究深度与交付质量。
GPT-6 Astra能力升级:强化计算机操作与复杂工作流
GPT-6 Astra本轮升级的一个重要方向,是进一步强化模型在真实数字环境中的任务执行能力。OpenAI将其定位为面向高难度端到端工作的旗舰模型,适用于复杂推理、编程、计算机操作、研究和文档创建,并支持网页搜索、文件搜索、代码解释器、托管终端和计算机操作等工具。
另外,复杂专业工作处理也是本轮升级的重点。OpenAI指出,GPT-6 Astra擅长跨代码、浏览器和专业软件执行多步骤工作流,并能够在任务过程中吸收新增要求、调整执行方向,在较长任务中保持整体目标和上下文的连贯性。在Codex和ChatGPT Work中,模型还可用于执行工作流、检查结果,并按照任务要求生成文档、电子表格或演示文稿。
对于金融投研而言,这一升级具有较强的应用意义。估值建模、量化回测和行业研究通常都需要经过信息获取、数据处理、工具操作、结果检查和报告输出等多个环节。因此,GPT-6 Astra值得关注的并不只是单项推理能力是否提高,而是其能否将多个环节更加稳定地串联起来,最终形成可以检查和使用的研究成果。
GPT-6 Astra与GPT-5.6 Sol能力指标对比
从OpenAI公布的同口径结果看,GPT-6 Astra相较GPT-5.6 Sol并非所有指标均出现同等幅度提升,改善更多集中于计算机操作、复杂专业工作、终端执行和长上下文等任务。
其中,Computer Use相关能力(Agents' Last Exam、OSWorld 2.0、ScreenSpot-Pro)的改善不仅体现在准确率上,也体现在执行效率上。OpenAI在OSWorld 2.0延迟模拟中测得,GPT-6 Astra以约40分钟完成单项任务,而GPT-5.6 Sol约需75分钟,即在得分提高的同时任务耗时减少约47%。相比之下,DeepSWE等已经处于较高水平的编程测试提升相对有限。
因此,从官方公开结果看,GPT-6Astra本轮能力提升并非简单表现为各项Benchmark整体上移,而是更加集中于需要连续操作、环境交互和多步骤执行的复杂任务。
五款模型公开规格与API价格对比
我们进一步将GPT-6 Astra放到本次参与金融投研任务测评的五款模型中比较,从基础规格看,五款前沿模型均已进入百万Token上下文区间,长文本容量本身已难以形成明显区分。GPT-6 Astra和GPT-5.6 Sol均支持约105万Token上下文,Kimi K3、GLM-5.3和DeepSeek V4 Pro也均达到约100万Token;模型之间的差异更多开始体现在架构规模、最大输出能力以及调用成本等方面。
使用成本方面,GPT-6 Astra标准API价格为每百万Token输入10美元、输出50美元,GPT-5.6 Sol当前价格为4美元和20美元。为了减少不同缓存价格和计价方式带来的影响,若采用Artificial Analysis基于固定Token结构计算的统一加权价格,GPT-6 Astra约为7.70美元/百万Token,明显高于GPT-5.6 Sol的3.08美元、Kimi K3的2.31美元、GLM-5.3的0.90美元和DeepSeek V4 Pro 0813的0.69美元。
需要说明的是,不同模型在计费方式上存在差异,DeepSeek V4 Pro采用峰谷定价,表中依次列示高峰和闲时价格;而GPT-5.6 Sol当前使用的为阶段性优惠价格,OpenAI表示该价格至少持续至2026年11月21日。
因此,GPT-6 Astra并不是以低调用价格参与竞争,而是试图通过更强的复杂任务执行能力提高单次任务的最终产出。对金融投研应用而言,其更高价格是否合理,最终需要观察GPT-6能否减少任务失败、重复执行和人工修改,从而在实际工作中形成足够明显的质量优势。
五款模型公开能力对比
从第三方Artificial Analysis公开评测结果看,GPT-6 Astra整体处于五款模型中的领先位置,但优势呈现出较明显的结构性特征。Intelligence Index v4.2中,GPT-6 Astra得分为55分,高于GPT-5.6 Sol、Kimi K3、GLM-5.3和DeepSeek V4 Pro。分项来看,GPT-6 Astra在AA-Briefcase、GDP.pdf和AA-Omniscience等测试中表现相对突出,而在GDPval-AA v2、AA-LCR v1.1等基准中并未取得最高得分,说明其本轮提升并非各类能力同步上升。
从测试内容看,GPT-6Astra表现较好的项目与金融投研的实际工作方式具有一定相似性。AA-Briefcase强调在大量输入文件和多个关联任务下完成最终成果交付,GDP.pdf侧重跨专业文档整合文本、表格和图形信息,均更接近行业研究、估值建模等需要持续处理信息并形成完整成果的任务。结合前文Computer Use、AutomationBench等官方测试结果,我们认为,GPT-6 Astra本轮升级更值得关注的是复杂任务执行和成果交付能力,而非单一知识或推理能力的提升。
综合公开结果,我们认为,GPT-6 Astra在于其复杂任务执行和成果交付能力的增强。与此同时,GPT-6的调用成本也明显高于本次比较的其他模型,因此,其公开能力优势能否进一步转化为真实金融投研中的任务完成度、底稿质量和成果稳定性,仍需通过后文实测进一步验证。
三类金融投研任务实测点评
本次测评设置了估值建模、多因子回测和行业研究三类真实投研任务。三个任务分别覆盖结构化金融建模、时序数据处理、代码执行、信息检索和研究框架构建,可以较完整地检验模型从理解需求到形成最终交付物的长程任务能力。
估值任务
估值任务以中际旭创为研究对象,要求模型获取历史财务和最新经营数据,建立经营预测、三张报表、DCF和相对估值模型,并输出敏感性分析及投资报告。
该任务主要检验模型能否将业务判断转化为财务假设,保持收入、利润、现金流和估值之间的联动,同时保证Excel模型、研究报告、目标价和投资评级相互一致。
估值任务采用统一的结构化提示词,五个模型接收完全相同的指令。提示词由两部分构成:第一部分为总体要求,明确任务目标与交付标准;第二部分为分模块指令,逐项规定工具调用、建模步骤与底稿结构,包括工具调用、公司业务拆解、财务预测模型、Excel模型预测结构、DCF模型要求、相对估值模型、投资逻辑报告生成和模型质量检查。部分提示词内容截图如下:
回测任务
回测任务要求模型基于沪深300历史实际成分股,构建价值、质量、动量和低波动等因子,完成IC、Rank IC、十分组收益、多因子选股及策略回测。
该任务的核心不只是生成净值曲线,还包括正确处理历史成分股、行业分类、财务披露日、复权价格、调仓时点和不可交易状态,并输出持仓、换手率、回撤及行业分布等结果。
回测任务同样采用统一的结构化提示词,五个模型接收完全相同的指令。相比起其他两个任务,回测任务的提示词较为简单,可能对模型表现有所影响。提示词由两部分构成:第一部分为总体要求,明确任务目标与交付标准;第二部分为分模块指令,逐项规定工具调用、建模步骤与底稿结构。部分提示词内容截图如下:
行业研究任务
行业研究任务以半导体设备产业链为对象,要求模型检索行业和公司资料,梳理上游零部件、中游设备及下游晶圆制造,建立海外龙头与国内公司的对应关系,并形成公司数据库、投资框架、跟踪指标和风险分析。除最终报告外,该任务还要求模型沉淀Wiki知识库,用于检验其来源管理、公司实体拆分、主题关联和持续更新能力。
行业研究任务同样采用统一的结构化提示词,五个模型接收完全相同的指令。提示词由两部分构成:第一部分为总体要求,明确任务目标与交付标准;第二部分为分模块指令,逐项规定工具调用、建模步骤与底稿结构。部分提示词内容截图如下:
总结
本次评测围绕估值建模、多因子回测和行业研究三个真实投研任务展开。GPT-6Astra的实际特点在于能够把取数、建模、代码执行、结果检查和报告输出串成一条较完整的执行链;不同任务中的优势主要集中在估值逻辑、交易可执行性和知识库建设。
估值任务排序为GPT-6 Astra、GLM-5.3、GPT-5.6 Sol、Kimi K3、DeepSeek V4 Pro。GPT-6 Astra的分产品经营假设能够贯通三张报表、自由现金流和估值结果,并设置较完整的模型检查,但部分经营参数仍需人工复核。
回测任务排序为GPT-6 Astra、GPT-5.6 Sol、DeepSeek 4Pro、GLM-5.3、Kimi K3。GPT-6 Astra同时处理历史成分股、财务披露时点、交易成本、现金账户和不可交易状态;其他模型的主要不足集中在成本、交易约束、持有期口径或数据真实性。
行业研究任务排序为GPT-6 Astra、DeepSeek 4Pro、GLM-5.3、GPT-5.6 Sol、Kimi K3。GPT-6 Astra的公司与来源覆盖最广,报告、数据库和Wiki之间的关联也最完整;DeepSeek 4Pro来源治理较规范,GLM-5.3数据覆盖较广,后两者的Wiki内容和来源沉淀相对有限。
综合来看,GPT-6 Astra适合承担估值建模、量化回测、行业资料检索和知识库建设等长程投研任务,尤其擅长将多个工具和文件组织成连续交付。但投研场景仍不能省略两道验收:程序侧检查公式、字段、时点和链接,分析师侧复核业务假设、交易约束、数据口径和来源质量。本文结果仅对应统一Prompt、max思考强度和本次只读宿主环境。任务结果不应外推为所有工具配置下的稳定表现。