OpenAI 於 9 月 5 日宣佈,其新一代模型 GPT-6 Astra 已向所有 Pro、Enterprise 和 Business Premium 使用者全量開放,使用者可在 ChatGPT WorkCodex 中直接使用,API 也同步上線。此前,OpenAI 在 9 月 3 日宣佈 Astra 分階段推出,僅兩天後,付費高檔使用者即全部解鎖。不過,Plus 和普通 Business 使用者仍需等待數日才能獲得訪問許可權。

此次釋出中,OpenAI 工程師 Victor Nunez 給出的首要建議出人意料:刪掉你的提示詞。他建議使用者趁 Astra 推出之際,回頭清理 AGENTS.mdSkills 檔案,並重新思考推理級別的使用方式。AGENTS.md 相當於寫給 AI 的“員工手冊”,定義其身份、職責和限制;Skills 則是教模型執行具體任務的“說明書”。過去幾年,開發者應對模型侷限的方式是不斷堆疊規則——模型理解不了就多解釋,出錯就加限制,再錯就補例子,如同給健忘的新員工貼滿便籤。

然而,Astra 的到來讓這些“便籤”反而成為負擔。OpenAI 在 Astra 的模型指南中指出,Astra 對 skill 和 AGENTS.md 中的指令“更敏感”,以前被忽視的舊規則現在會被逐條執行。一條含糊的規則可能讓模型停下來反覆確認,兩條衝突的規則甚至會讓其陷入困惑。例如,若指令寫“所有方案要經過審批”,舊模型可能視而不見,而 Astra 會真的停下來詢問審批物件。因此,指南用“強烈建議”要求開發者審計模型可讀的每一個 skill 檔案。

此外,Astra 比前代更傾向於主動提問,在執行任務中途可能停下來確認選項,甚至在寫程式碼前先執行測試。OpenAI 甚至提供了一段現成提示詞,讓 Astra 避免使用“delve”“值得注意的是”等套話,並禁止“先否定再翻轉”的句式。這種“模型廠商教使用者防模型套話”的做法,反映出模型行為的變化。

對普通使用者和開發者而言,這意味著與 AI 互動的方式需要轉變。過去,模型能力不足時,使用者傾向於增加限制和要求,即“加法思維”;而 Astra 已能從上下文中推斷意圖,在指令有歧義時主動詢問,並能記住多步任務的全域性目標。因此,過時的、冗餘的、衝突的提示詞不僅多餘,還可能阻礙模型執行。OpenAI 官方遷移指南反覆強調“審計”,即刪除所有不必要的指令。模型越強,使用者需要寫的規則反而越少。

早期訪問的開發者已展示 Astra 的能力。開發者 Matt Shumer 讓 Astra 在虛幻引擎中構建了一座曼哈頓,耗時一週,併發明瞭“管理者迴圈”玩法:一個 Astra 擔任經理,將任務拆解為清單和階段,另一個 Astra 作為執行者,經理每次只派一段活,執行端最多同時有 96 個子智慧體 並行工作。Shumer 還發現措辭細節:讓模型將每個階段做到“極好”會順利推進,而要求“完美”則會讓模型陷入細節無法自拔。

開發者 Anshu 稱 Astra 是“3D 遊戲領域的超級 AGI 機器之神”,僅用 45 分鐘 就完成了一個畫質出色的開放遊戲世界。免疫學家 Derya Unutmaz 僅輸入一句話“做一個 5 分鐘的 T 細胞教學影片”,Astra 便自動編寫解說、用 Remotion 製作動畫、用 Imagegen 生成影像,並建議用 HeyGen 配音,一次成片。這位研究 T 細胞 35 年的科學家表示自己講不了這麼好,計劃製作整套免疫學影片課程。開發者 Tom Krcha 則從一張蒸汽火車舊圖紙出發,讓 Astra 在 Blender 中生成 3295 個可編輯物件,每個零件都能獨立修改,該推文瀏覽量已超 75 萬次

OpenAI 官方資料也顯示效能提升:在 OSWorld 2.0 基準(模擬人類操作電腦桌面)上,Astra 得分 72.6%,上一代 GPT-5.6 Sol65.7%,且每任務耗時從 75 分鐘 降至 40 分鐘,準確率提升的同時速度加快近一倍。不過,Astra 並非全面領先。據 Artificial Analysis 的獨立綜合智慧指數,Astra 得分為 61.2,而 Anthropic 本週釋出的 Claude Fable 5.1 得分 65.7,兩者競爭仍未見分曉。

此次釋出標誌著 AI 開發範式可能從“加法”轉向“減法”。過去,模型不夠聰明時靠規則彌補,規則越積越厚;如今,模型短板補齊,規則本身成為新的錯誤來源。OpenAI 通過模型指南悄然調整了 AI 工程的方向:從教模型每一步怎麼做,轉向拆除擋路的舊規則,給予模型更多自主空間。人與模型的關係也隨之演變——從“教它”到“別擋它”。