Anthropic 正在测试其 AI 编程工具 Claude Code 能否独立承担公司内部软件的日常维护工作。据 Anthropic 工程师、Claude Code 的发明者 Boris Cherny 介绍,在最近几周内,Claude 通过自动化流程创建了 388 个拉取请求,其中 180 个在人工审核后被合并,合并率约为 46%。Cherny 将这一结果描述为“出人意料地积极”,并认为这是自主 AI 应用维护可能实现的“早期生命迹象”。
这一实验通过一个名为“proj-claude-maintains-apps”的专用 Slack 频道进行,Claude 借助 Tag 工具在 Anthropic 的所有平台(包括 iOS、Android、桌面端、Web、CLI 和 Agent SDK)上运行日常维护例程。Cherny 在 Slack 中直接用自然语言下达指令,例如要求 Claude 对 iOS、Android 和桌面应用进行崩溃模糊测试、使用真实应用而非模拟数据、触发崩溃并创建修复拉取请求。整个过程并未涉及复杂的提示工程,而是依赖简洁的日常指令。
Claude 运行了多达 12 种不同的维护例程,覆盖代码维护的多个方面。其中,“崩溃模糊测试器”会在模拟器中打开应用、随机点击以触发崩溃,分析根本原因并生成修复方案;“重复统一器”扫描代码库中相似但略有不同的抽象,并建议合并;“死代码移除器”会移除静态不可达的代码,对于可疑代码则先添加日志,次日再确认是否确实未被使用。其他例程还包括简化嵌套业务逻辑、修复复杂逻辑错误、移除永远不会失败的测试、清理已发布功能的特性开关、修复不稳定的 CI 测试、简化过度设计的抽象以及修复架构分层违规等。
Cherny 表示,Claude 通常能一次就正确创建拉取请求;如果失败,团队会调整例程,以便 AI 在次日做得更好,这种调整有时需要几天时间。目前 Anthropic 正在研究如何加快这类机械性变更的合并流程。值得注意的是,超过一半的自动生成拉取请求未能通过审核,这既反映了当前方法的局限性,也展示了其潜力。
这一实验的意义在于,它展示了 AI 在真实软件工程维护中的自主能力,而不仅仅是辅助编码。如果这种模式能够成熟,可能显著减少开发者在重复性维护任务上的时间投入,从而改变软件开发的协作方式。不过,46% 的合并率也表明,人工审核和干预在可预见的未来仍是不可或缺的环节。对于 AI 编程工具市场而言,这一案例提供了关于自主维护可行性的实证数据,可能影响企业采用此类工具的决策。