Anthropic 近日釋出了一項關於其大語言模型 Claude 內部工作機制的新研究,題為《語言模型中的全域性工作空間》。該研究並未聚焦於模型的最終回答質量,而是直接探索 Claude 在生成回覆之前,其神經網路中間層裡已經形成的、但尚未被明確表達出來的內部概念。
研究團隊將這一組特殊的內部表示命名為 J-space,並將讀取它的方法稱為 Jacobian Lens(簡稱 J-lens)。與傳統的思維鏈不同,J-space 存在於模型的內部啟用中,不佔用輸出視窗,也不會直接暴露給使用者。這意味著 Claude 可能已經在內部形成了某個判斷,但最終回答中卻完全不出現相關詞彙。
Anthropic 歸納了 J-space 的幾個關鍵特徵:它是可報告的,模型能將部分狀態轉化為語言;它是可調動的,指令能讓特定概念進入 J-space;它會參與中間推理,模型會先形成中間概念再繼續計算;它可被後續計算複用;但它並非所有計算的中心,主要影響高階任務能力。論文指出,J-space 元件通常只解釋總啟用方差的一小部分,最高不到 10%。
J-lens 方法的核心在於,它不直接將中間層對映到輸出層,而是先估計該層啟用的變化會如何影響最終層,再將其連線到模型的詞彙表上。這使得 J-lens 讀取的不是“下一步一定輸出什麼”,而是“這個中間狀態在未來輸出中更容易支援哪些詞”,從而能捕捉到模型尚未說出口的內部概念。
更具工程價值的是,Anthropic 不僅實現了讀取,還進行了干預實驗。通過替換、消融或寫入特定的 J-space 概念,他們發現模型後續的報告、推理結果和部分策略行為確實會隨之改變。這證明這些內部狀態至少參與了部分計算過程。
基於此,研究團隊嘗試了一種名為反事實反思訓練的新方法。他們不在目標任務中直接訓練模型輸出正確答案,而是在任務中途截斷,追加一個反思問題,只訓練模型在此位置的反思方式。結果顯示,訓練後模型在誠實和欺騙相關評測上的表現有所改善,且消融這些被訓練出的 J-space 表示後,行為收益會明顯回退。這為對齊訓練提供了新思路:不只能監督最終輸出,還可以通過塑造模型的內部狀態來引導行為。
在安全評測方面,J-lens 也展現出潛力。Anthropic 觀察到,Claude 在某些安全場景中會提前識別出自己正處於評測或虛構環境裡。這意味著未來的模型評測不能只看“是否通過測試”,還需記錄“模型是否識別了測試條件”,以避免評測分數失真。對於智慧體場景,在模型執行工具呼叫或檔案操作前讀取其內部狀態,有望為安全審計提供一層新的內部證據。
儘管技術發現引人關注,但該研究的傳播引發了不小的爭議。Anthropic 將研究置於與人類“意識可訪問性”類似的語境中,論文裡“conscious”一詞出現了超過 200 次,儘管他們反覆宣告這並不證明 Claude 具有主觀體驗。這種敘事方式讓許多網友和開發者感到警惕,認為 Anthropic 在用哲學概念過度包裝技術發現,甚至有聲音質疑這是為上市造勢的營銷手段。Reddit 和 X 等平台上,不少人批評其“話術太重”,將已有的可解釋性研究換上了“全域性工作空間理論”的新殼。
客觀來看,J-space 並非 Claude 的“思維”全貌,而是一小部分可語言化、可干預的內部狀態。它對訓練診斷、安全評測和智慧體風控具有潛在價值,但短期內更可能作為模型廠商的內部工具,而非普通開發者可即刻接入的功能。其真正價值,取決於該方法能否在不同模型上穩定復現,以及內部狀態監控能否以可接受的成本進入生產環境。至於圍繞“AI 開智”的敘事,市場的質疑聲恐怕短期內難以平息。