OpenAI 发布了名为 GPT-6 Astra 的新模型,定位不再是单纯的对话生成,而是直接面向计算机应用、编程、专业工作流程、科学和网络安全场景。该模型最初只向部分组织开放,随后逐步推向 ChatGPT Plus、Pro、Business 和 Enterprise 用户,以及 OpenAI API、Microsoft Azure 和 AWS Bedrock 的开发者。

这次发布最核心的变化,是 OpenAI 把模型的应用范围从“生成响应”扩展到了“直接在软件中执行多步骤任务”。按官方描述,Astra 能与图形界面交互,可以填写表单、更新 CRM 记录、开展研究、创建网站、分析数据、安装和测试软件,还能排查那些可以从屏幕上直接看出来的问题。在衡量计算机操作能力的 OSWorld 2.0 测试中,OpenAI 报告 Astra 得分 72.6%,高于 GPT-5.6 Sol65.7%

编程是本次发布的另一个重点。OpenAI 报告称,Astra 在 Terminal-Bench 4.0 上得分 57.9%,在 DeepSWE v1.1 上得分 74.1%。它还在 Codex 中引入了一种实验性的上下文机制,让智能体能够在不同上下文窗口之间保留笔记,而不再只依赖压缩机制;此前的上下文窗口仍可被搜索,使模型在长时间运行的编程任务中能检索早期需求、测试结果和工具输出。在 OpenAI 公布的 MRCR 评估中,该模型支持长达 100 万个令牌的长上下文,在 512K 至 1M 的上下文范围内得分达到 96.3%。OpenAI 还表示,Astra 在数据库迁移、CAD 生成、数据科学、浏览器研究和科学工作流等专业任务上也有进步。

网络安全方面的变化更值得注意。按照 OpenAI 的 Preparedness Framework,Astra 是首个被归类为“关键网络安全能力”级的模型。OpenAI 称,在未启用生产环境安全防护措施的测试中,该模型发现了两个此前未知的漏洞并加以利用,同时展示了针对经过强化防护的浏览器和操作系统开发漏洞利用程序的能力。生产版本对高级攻击任务做了限制,OpenAI 计划通过其 Daybreak 计划提供更广泛的防御能力。

在可靠性指标上,OpenAI 报告 Astra 的内部评估幻觉率为 4.2%,低于 GPT-5.6 Sol12.2%。但在测试模型是否会掩盖其推理过程时,OpenAI 发现 Astra 的书面推理比前代模型更难监控,公司表示提高可监控性仍是当前研究重点。

竞争格局方面,Astra 的对标对象包括 Anthropic Claude Fable 5.1 和谷歌的 Gemini 3.8 Flash 等模型。OpenAI 公布的评估结果显示,各模型在不同任务中表现各异:Astra 在 Terminal-Bench 4.0 以及多项计算机使用评估中领先;而在 Humanity's Last Exam 测试中,Claude Fable 5.1 得分更高;此外,Gemini 3.8 Flash 支持原生视频和音频输入,Astra 则不支持。

社区反响中,英伟达首席执行官 黄仁勋 重点提到了训练该模型的基础设施,称 GPT-6 Astra 是在 10 万多块 NVIDIA Grace Blackwell NVLink72 上完成训练,从 ChatGPT 到 o1 再到 Astra 仅用了 4 年,并表示接下来将有 40 万块 GPU 投入使用。另一位社区代表 Alex Finn 则聚焦此次发布所体现的 AGI 框架,称当前已进入 AGI 时代。

把这些信息放在一起看,Astra 的意义不只是又一轮模型能力刷新。它把智能体的执行边界从“回答问题”推向“操作软件、完成多步骤工作流”,这对企业软件、编程工具和自动化流程的想象空间是直接的;同时,首个“关键网络安全能力”分级也把模型能力与安全治理的矛盾摆上台面——能力越强,可监控性与滥用风险越需要配套机制。对关注 AI 产业的人而言,训练侧对大规模 GPU 集群的依赖、推理侧对长上下文与工具调用的支持,以及各家模型在不同评测上的此消彼长,都是后续值得跟踪的线索。