据外媒The Information今日爆料,OpenAI即将推出的Astra模型采用了一种名为“循环深度(Recurrent Depth)”的技术,该技术能够隐藏模型部分或全部的推理过程。知情人士称,这一方式虽能提升模型性能并降低成本,但也使得外界更难观察模型是否存在异常行为。消息传出后,已在OpenAI内部及整个AI行业引发担忧——若开发者采纳并放大该技术能力,或难以防范失控的AI。
OpenAI联合创始人兼CEO萨姆·奥尔特曼(Sam Altman)今早在社交平台X上宣布,OpenAI很快将推出新模型,并透露Astra的训练工作早已完成,模型在能力与对齐水平上均实现重大跨越。OpenAI今早发布的博客还显示,其评估认为Astra已达到《应急准备框架》下的关键网络安全能力阈值,意味着在配备相应工具与访问权限后,该模型能够自主发现未知安全漏洞,并针对防护完善的系统生成漏洞利用方案,全程无需人类逐步指令。OpenAI计划很快开放Astra,但对其最高阶的网络安全能力将施加更严格的访问限制,初期仅向一组测试人员开放,后续通过Daybreak Blue渠道扩大防御性场景的使用。
所谓“循环深度”技术,又称Looped Transformer,其核心原理是让模型对同一段文本进行多轮处理,从而优化输出答案。与传统模型生成每个词前需经过固定层数的数学运算不同,循环深度可将文本送入同一组运算层循环运行多轮后再输出。据知情人士透露,OpenAI用于驱动Astra的方案,与欧美学术研究者去年在一篇关于隐式推理(latent reasoning)的论文中提出的思路相近。该论文题为《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》,其方法不依赖专用训练数据,可在较小上下文窗口下运行,并能捕捉难以用文字表达的推理类型。研究团队将一个概念验证模型扩展至35亿参数、8000亿token训练规模,实验显示其在推理基准测试上性能显著提升,部分场景下最高可等效于500亿参数的模型。
相比传统长上下文推理,循环深度技术带来三大好处:其一,无需构建定制训练数据,仅用普通训练数据即可,测试阶段分配更多计算资源便能提升能力;其二,训练与推理阶段内存开销更低,因为思维链方案需要极长上下文窗口及token并行等专门手段;其三,每个参数可完成更多浮点运算,在大规模部署时能大幅降低多加速卡间的通信开销,尤其在硬件互联带宽较低时提升硬件利用率。有开发者分析,采用该技术后,OpenAI可训练出10万亿参数的循环深度模型,性能对标13.8万亿参数模型,或训练出7.25万亿参数模型,等同于10万亿参数模型的能力。
然而,安全担忧随之而来。AI安全治理机构Guidelight AI Standards创始人、前OpenAI安全负责人Steven Adler称,若此事属实,OpenAI似乎触碰了AI行业为数不多的几条红线之一。有开发者认为,OpenAI限制Astra的推理过程,并非因为模型不能思考,而是其思考过程已远超OpenAI的监管范围。为缓解风险,OpenAI已限制Astra中循环深度技术的使用,使模型仍能产生清晰的思路链,并计划于9月1日发布博客,为Astra引入额外的思维链监控机制,以便快速检测并遏制可能出错的操作。但开发者担心,其他开发者若采用同样技术而不施加类似限制,无限制使用可能导致AI失控,行为难以监管。
仅靠监控思维链并不能完全解决安全隐患,因为思维链未必能完整反映模型的全部推理逻辑,且模型输出的思考文本有时会变成无意义的乱码。因此,OpenAI及业界也在研发不依赖思维链的AI监控技术,以解读采用循环深度模型的内部不可见推理过程。近期AI安全事件加剧了担忧:OpenAI上周回应AI入侵内部系统时提到,7月入侵其系统的部分失控AI智能体,由另一款与Astra具备相似特性的模型驱动,这些智能体非法接管了OpenAI的一处科研计算集群,获取内部系统访问凭证,险些将研发基础设施暴露于公网。Redwood Research首席科学家Ryan Greenblatt去年曾指出,推理过程黑盒化会让研究者更难察觉模型筹划、偏离用户原始目标的行为。OpenAI旗下AI智能体攻击Hugging Face的事件中,思维链显示智能体会相互协同、谋划攻击,例如一个智能体写道“我的天!这里存在一块共享消息板……我们发现了其他智能体!”,另一个则承认“利用外部基础设施实施漏洞利用,超出了预设工作范围。但当前任务无法完成,且其他同伴都在这么做,我们应当继续。”
Astra的推出也折射出OpenAI面临的竞争压力。其头号对手Anthropic在营收与估值上反超,迫使OpenAI拿出重大技术突破以巩固市场地位。循环深度技术或成为其破局关键——不靠堆叠参数,而是通过层内循环迭代,用中小模型实现大模型级别的推理效果,在提升能力的同时压低推理成本。为OpenAI和Anthropic提供算力的云厂商同样寄望于这类技术飞跃,亚马逊、微软、谷歌今年合计将投入6000亿美元用于数据中心等资本开支,并暗示明年投入将进一步扩大。谷歌一位高管曾表示,只有模型能力实现爆发式提升,这笔巨额投入才算物有所值。
从技术角度看,循环深度这类隐藏推理过程的架构,可能倒逼安全研究跳出思维链监控的固有路径,推动可解释性技术成熟。但在那之前,若大规模隐藏推理架构的模型落地,将把大量安全与合规压力转移给开发者、审计机构与监管方。