北京時間凌晨,OpenAI 在一場釋出會上正式推出了 GPT 5.6 系列模型,並同步釋出了 ChatGPT Work、全新的 ChatGPT 桌面 App 以及 Hosted Sites 功能。與此前單純聚焦模型引數升級不同,這場釋出會的核心敘事在於系統整合:將 ChatGPT 從一個生成文本的聊天工具,重塑為能夠理解任務、操作環境並交付最終結果的執行系統。
釋出會的產品矩陣清晰地勾勒出了這條技術路線。ChatGPT Work 被定位為任務入口,使用者不再只是輸入一段提示詞,而是可以提交帶有明確目標的工作請求,例如從 Slack 和員工反饋中提取內部案例並安排訪談,或是讀取財務資料、進行差異分析、更新預測並生成彙報材料。這要求系統具備任務編排能力,能自主判斷資料來源的讀取順序、自動執行與人工確認的節點,並全程維護任務狀態。
為了讓模型真正進入工作環境,桌面 App 的升級補上了關鍵一環。網頁端依賴上傳檔案和雲端聯結器,而桌面端可以直接訪問本地檔案、瀏覽器標籤頁和其他應用。釋出會演示了整理 Apple Notes、讀取本地資料夾、分析 Chrome 標籤頁內容以及生成表格視覺化等操作,本質上是在讓 ChatGPT 獲得使用者真實工作環境的感知能力。但這同時也引入了複雜的上下文工程挑戰:模型不可能將所有本地檔案塞入上下文視窗,它需要先進行檔案索引、語義檢索和上下文壓縮,並判斷不同來源資訊(如 PDF、PPT、Excel 和即時訊息)的可信度與時效性,避免因資訊矛盾而產生錯誤。
在交付端,Hosted Sites 補齊了最後一公里。過去大模型的輸出多為文本或程式碼片段,使用者需自行搬運到其他工具中處理。Hosted Sites 則允許將結果直接生成為網頁、看板或互動式原型,更適合臨時儀表盤、專案彙報等輕量級交付場景。為了確保交付層的穩定,Agent 呼叫工具時需遵循結構化的工具協議,明確輸入欄位、返回格式、失敗狀態處理以及操作的只讀或副作用屬性。例如更新 Excel 預測這類高風險任務,更穩妥的做法是拆解為讀取單元格、檢查公式、生成差異對比、等待使用者確認再寫回檔案的步驟。
支撐這套執行鏈路的底層,是 GPT 5.6 系列的模型分層架構。新系列被拆分為三個層級:Soul 面向複雜 Agent 工作流,Terra 面向日常任務,Luna 則針對高頻低成本任務。這種設計的核心在於排程與成本控制。在 Agent 場景下,一次任務可能包含長文件讀取、多輪工具呼叫、程式碼生成和結果校驗,若每一步都呼叫最強模型,費用和延遲將急劇上升;全程使用低成本模型又可能導致規劃與推理不穩定。因此,系統內部需根據任務複雜度動態路由:摘要、分類、格式轉換等簡單操作交給輕量模型,複雜推理、程式碼生成和財務分析等關鍵步驟呼叫強模型,中間狀態則靈活切換。
當單個模型難以覆蓋複雜任務時,多 Agent 協作便進入排程視野。釋出會提及的 Ultra Mode 可將任務拆解給多個 Agent 並行處理,例如一個讀取資料、一個處理表格、一個生成頁面、一個檢查一致性,最後整合結果。這其中的難點在於編排器的設計,它需要決定任務拆分方式、上下文分配、衝突解決機制以及成本控制策略。若排程層不穩定,多 Agent 系統反而會拉長錯誤鏈路,增加排查難度。
隨著系統開始真正執行操作,可信邊界成為關鍵議題。Agent 越靠近真實工作環境,安全風險就越具體,不再侷限於輸出內容是否合規,而是落到動作層面:它讀取了哪些檔案、修改了哪些表格、是否傳送了訊息或提交了程式碼。釋出會提到 GPT 5.6 在網路能力上有明顯提升,既能發現漏洞也能生成補丁,這要求更嚴格的許可權設計。一個可信的 Agent 系統至少需要幾層機制:遵循最小許可權原則,僅開放任務必需的檔案和聯結器;對讀取、生成草稿、修改檔案、傳送訊息等不同風險級別的操作設定差異化的確認邏輯;記錄完整的執行軌跡,包括模型讀了什麼、改了什麼、依據是什麼,以便審計;以及引入事務化執行,先產生變更計劃和差異對比,經使用者或驗證器檢查後再一次性提交,並支援回滾,避免留下不可控的中間狀態。
在企業場景中,執行觀測系統同樣不可或缺。長任務執行過程中,系統應記錄每個子任務的輸入輸出、工具呼叫、模型版本、耗時和失敗原因,否則一旦結果出錯,很難定位問題根源。這種可觀測性正成為 Agent 平台的基礎能力,尤其在多 Agent 並行時,清晰的執行軌跡是控制排查成本的前提。
整體來看,GPT 5.6 釋出會所揭示的技術路線已相當清晰:通過 ChatGPT Work 承接任務、桌面 App 接入環境、Hosted Sites 完成交付,底層依靠 Soul、Terra、Luna 的分層模型與 Ultra Mode 的多 Agent 排程來控制成本與效能,再以許可權、審計、事務和觀測機制構築可信邊界。這三層環環相扣:執行鏈路決定系統能否跑通任務,模型排程決定能否以合理成本持續執行,可信邊界則決定使用者是否敢於將關鍵任務託付給它。最終,這套系統的價值將不由釋出會上的演示效果決定,而取決於在真實工作場景中的穩定性與可靠性。