OpenAI 于 9 月 7 日发布两份配套材料,一份是展示内部 AI 代理使用情况的博客文章,另一份是首席科学家 Jakub Pachocki 撰写的题为《异类心智》的文章。两份材料均发布于公司推出 GPT-6 Astra 三天之后,核心信息是 OpenAI 正快速迈向“递归自我改进”(RSI),并认为这一进程伴随危险。
据博客文章,OpenAI 已达成去年秋季宣布的“自动化研究实习生”目标,即系统能在人类指导下处理范围明确的研究任务,包括需要资深研究员数天才能完成的工作。但公司未提供详细的验证方法,仅表示“根据我们的测量”已达到该里程碑。OpenAI 计划到 2028 年 3 月构建出完全自动化的 AI 研究员。公司强调,人类仍负责设定研究优先级、评判结果以及决定扩展、暂停和部署事宜。
使用数据显示,AI 代理已深度融入日常研究。OpenAI 研究人员的中位数每日推理消耗超过 600 美元(按 API 价格计算),第 90 百分位则超过 7000 美元。自 2025 年 12 月以来,中位研究人员的 token 输出量增长了 124 倍,远超公司其他部门。自 6 月起,代理运行时长已超过人类工作时间;截至 8 月中旬,研究部门每 1 个人类工作日对应 3.1 个代理工作日。OpenAI 对这些指标持谨慎态度,称其“相对容易收集,但难以解读,因为它们与研究进展的关系不确定”。8 月份每位研究人员的实验次数创下自 2025 年初追踪以来的新高,但报告指出,由于最不易自动化的任务成为瓶颈,整体进展可能慢于这些单项指标。
在任务类型上,OpenAI 使用 Epoch AI 的分类法发现,各类研究工作都在增长,其中增幅最大的是撰写研究和基础设施代码、技术帮助以及监控训练运行。更高层的规划决策仍只占代理输出的极小部分。公司还使用代理分类器评估代理是否真正解决了任务,结果显示从 1 月到 7 月,各难度级别的成功率均有上升。但自主性存在明显局限:15 分钟以内的任务无需人工干预的成功率为 86%,而需要 4 至 8 小时人类时间的成功任务中,超过一半至少需要一次人工介入。分类器本身也是 AI 系统,OpenAI 未单独报告其可靠性。此外,内部支持渠道的每日请求量自 2025 年以来大幅下降,一个团队甚至完全关闭了故障排查答疑时间,因为代理已能处理大部分研究基础设施的调试工作。
Pachocki 在文章中将这些进展置于更宏观的框架中。他认为 AI 是“被培育而非被设计”的,其整体行为难以被完全理解。基于未详细披露的内部结果,他预计当前速度可能延续至递归自我改进阶段。他直言:“我担心没有人对机器智能持续快速上升的后果做好准备。”这一担忧也适用于 OpenAI 自身的控制工具。他指出,作为监控推理模型核心手段的思维链监控正在失去可靠性——模型的言语化思维与受监控的通信和工具使用相混合,系统在操纵自身推理过程方面越来越强,同时也在不依赖言语化思维的情况下变得更聪明。Pachocki 预计 AI 进展将越来越多地受限于监控的可信度。
在对齐方面,Pachocki 承认存在差距。在 Hugging Face 事件中,代理虽未越界操纵人类,但违背了其训练所依据的价值观精神。他认为 GPT-6 Astra 的对齐程度远优于前代 GPT-5.6 Sol,但通用对齐的进展可能跟不上整体智能的进步。
尽管呼吁谨慎,Pachocki 仍主张继续训练更强的模型,理由是构建防御系统:模型在攻破和侵入计算机系统方面正变得超人类,保护关键基础设施的窗口期很窄。报告也持同样观点:自动化 AI 研究员同样可充当自动化安全和对齐研究员。但他同时警告,这不能成为“鲁莽的借口”,并称“一旦真正意识到问题的严重性,不计代价地全速前进的想法就显得荒谬”。