Anthropic 正在測試其 AI 程式設計工具 Claude Code 能否獨立承擔公司內部軟體的日常維護工作。據 Anthropic 工程師、Claude Code 的發明者 Boris Cherny 介紹,在最近幾周內,Claude 通過自動化流程建立了 388 個拉取請求,其中 180 個在人工稽核後被合併,合併率約為 46%。Cherny 將這一結果描述為“出人意料地積極”,並認為這是自主 AI 應用維護可能實現的“早期生命跡象”。

這一實驗通過一個名為“proj-claude-maintains-apps”的專用 Slack 頻道進行,Claude 藉助 Tag 工具在 Anthropic 的所有平台(包括 iOS、Android、桌面端、Web、CLI 和 Agent SDK)上執行日常維護例程。Cherny 在 Slack 中直接用自然語言下達指令,例如要求 Claude 對 iOS、Android 和桌面應用進行崩潰模糊測試、使用真實應用而非模擬資料、觸發崩潰並建立修復拉取請求。整個過程並未涉及複雜的提示工程,而是依賴簡潔的日常指令。

Claude 運行了多達 12 種不同的維護例程,覆蓋程式碼維護的多個方面。其中,“崩潰模糊測試器”會在模擬器中開啟應用、隨機點選以觸發崩潰,分析根本原因並生成修復方案;“重複統一器”掃描程式碼庫中相似但略有不同的抽象,並建議合併;“死程式碼移除器”會移除靜態不可達的程式碼,對於可疑程式碼則先新增日誌,次日再確認是否確實未被使用。其他例程還包括簡化巢狀業務邏輯、修復複雜邏輯錯誤、移除永遠不會失敗的測試、清理已釋出功能的特性開關、修復不穩定的 CI 測試、簡化過度設計的抽象以及修復架構分層違規等。

Cherny 表示,Claude 通常能一次就正確建立拉取請求;如果失敗,團隊會調整例程,以便 AI 在次日做得更好,這種調整有時需要幾天時間。目前 Anthropic 正在研究如何加快這類機械性變更的合併流程。值得注意的是,超過一半的自動生成拉取請求未能通過稽核,這既反映了當前方法的侷限性,也展示了其潛力。

這一實驗的意義在於,它展示了 AI 在真實軟體工程維護中的自主能力,而不僅僅是輔助編碼。如果這種模式能夠成熟,可能顯著減少開發者在重複性維護任務上的時間投入,從而改變軟體開發的協作方式。不過,46% 的合併率也表明,人工稽核和干預在可預見的未來仍是不可或缺的環節。對於 AI 程式設計工具市場而言,這一案例提供了關於自主維護可行性的實證資料,可能影響企業採用此類工具的決策。