OpenAI 于 9 月 5 日宣布,其新一代模型 GPT-6 Astra 已向所有 Pro、Enterprise 和 Business Premium 用户全量开放,用户可在 ChatGPT Work 和 Codex 中直接使用,API 也同步上线。此前,OpenAI 在 9 月 3 日宣布 Astra 分阶段推出,仅两天后,付费高档用户即全部解锁。不过,Plus 和普通 Business 用户仍需等待数日才能获得访问权限。
此次发布中,OpenAI 工程师 Victor Nunez 给出的首要建议出人意料:删掉你的提示词。他建议用户趁 Astra 推出之际,回头清理 AGENTS.md 和 Skills 文件,并重新思考推理级别的使用方式。AGENTS.md 相当于写给 AI 的“员工手册”,定义其身份、职责和限制;Skills 则是教模型执行具体任务的“说明书”。过去几年,开发者应对模型局限的方式是不断堆叠规则——模型理解不了就多解释,出错就加限制,再错就补例子,如同给健忘的新员工贴满便签。
然而,Astra 的到来让这些“便签”反而成为负担。OpenAI 在 Astra 的模型指南中指出,Astra 对 skill 和 AGENTS.md 中的指令“更敏感”,以前被忽视的旧规则现在会被逐条执行。一条含糊的规则可能让模型停下来反复确认,两条冲突的规则甚至会让其陷入困惑。例如,若指令写“所有方案要经过审批”,旧模型可能视而不见,而 Astra 会真的停下来询问审批对象。因此,指南用“强烈建议”要求开发者审计模型可读的每一个 skill 文件。
此外,Astra 比前代更倾向于主动提问,在执行任务中途可能停下来确认选项,甚至在写代码前先运行测试。OpenAI 甚至提供了一段现成提示词,让 Astra 避免使用“delve”“值得注意的是”等套话,并禁止“先否定再翻转”的句式。这种“模型厂商教用户防模型套话”的做法,反映出模型行为的变化。
对普通用户和开发者而言,这意味着与 AI 交互的方式需要转变。过去,模型能力不足时,用户倾向于增加限制和要求,即“加法思维”;而 Astra 已能从上下文中推断意图,在指令有歧义时主动询问,并能记住多步任务的全局目标。因此,过时的、冗余的、冲突的提示词不仅多余,还可能阻碍模型执行。OpenAI 官方迁移指南反复强调“审计”,即删除所有不必要的指令。模型越强,用户需要写的规则反而越少。
早期访问的开发者已展示 Astra 的能力。开发者 Matt Shumer 让 Astra 在虚幻引擎中构建了一座曼哈顿,耗时一周,并发明了“管理者循环”玩法:一个 Astra 担任经理,将任务拆解为清单和阶段,另一个 Astra 作为执行者,经理每次只派一段活,执行端最多同时有 96 个子智能体 并行工作。Shumer 还发现措辞细节:让模型将每个阶段做到“极好”会顺利推进,而要求“完美”则会让模型陷入细节无法自拔。
开发者 Anshu 称 Astra 是“3D 游戏领域的超级 AGI 机器之神”,仅用 45 分钟 就完成了一个画质出色的开放游戏世界。免疫学家 Derya Unutmaz 仅输入一句话“做一个 5 分钟的 T 细胞教学视频”,Astra 便自动编写解说、用 Remotion 制作动画、用 Imagegen 生成图像,并建议用 HeyGen 配音,一次成片。这位研究 T 细胞 35 年的科学家表示自己讲不了这么好,计划制作整套免疫学视频课程。开发者 Tom Krcha 则从一张蒸汽火车旧图纸出发,让 Astra 在 Blender 中生成 3295 个可编辑对象,每个零件都能独立修改,该推文浏览量已超 75 万次。
OpenAI 官方数据也显示性能提升:在 OSWorld 2.0 基准(模拟人类操作电脑桌面)上,Astra 得分 72.6%,上一代 GPT-5.6 Sol 为 65.7%,且每任务耗时从 75 分钟 降至 40 分钟,准确率提升的同时速度加快近一倍。不过,Astra 并非全面领先。据 Artificial Analysis 的独立综合智能指数,Astra 得分为 61.2,而 Anthropic 本周发布的 Claude Fable 5.1 得分 65.7,两者竞争仍未见分晓。
此次发布标志着 AI 开发范式可能从“加法”转向“减法”。过去,模型不够聪明时靠规则弥补,规则越积越厚;如今,模型短板补齐,规则本身成为新的错误来源。OpenAI 通过模型指南悄然调整了 AI 工程的方向:从教模型每一步怎么做,转向拆除挡路的旧规则,给予模型更多自主空间。人与模型的关系也随之演变——从“教它”到“别挡它”。