智谱 GLM 首席科学家唐杰在 X 平台分享了一项关于 GLM-5.3-Flash 推理系统优化的研究。他透露,该模型从首次运行在国产 AI 加速器上,到完成全部生产流量承载,仅用了两周时间,系统端到端吞吐能力提升 3.2 倍

此次部署运行在超过 10 万颗国产 AI 加速器组成的集群上。智谱团队表示,这是一次此前缺少成熟经验参考的大规模部署,需要同时解决国产芯片显存容量与互联带宽限制、新模型架构适配、100 万 token 长上下文支持以及多模态请求处理等问题。与此同时,国产 AI 加速器的软件生态仍处于发展阶段,部分 Kernel 支持不足,很多资料需要工程团队自行探索。

唐杰称,在这些限制条件下,由 GLM-5.3 驱动的 Infra Agent 参与了推理系统优化,帮助分析性能瓶颈、提出优化方案并完成部分代码修改。整个优化过程并非简单增加算力,而是在算力、内存、通信和调度之间寻找新平衡。团队采用的具体方案包括:通过 ReplaySSM 用计算换取内存空间,通过节点内张量并行降低显存压力,通过 INT8、FP8、BF16 混合精度缓存提高容量利用率,并引入 Encode-Prefill-Decode(EPD)分离式架构让不同推理阶段更灵活地调度。最终,GLM-5.3-Flash 的端到端服务性能相比初始版本提升约 3 倍,硬件利用率和单 token 成本达到接近主流 NVIDIA GPU 平台的水平。

部署完成后,该模型还进入真实使用环境测试。智谱团队介绍,GLM-5.3-Flash 曾以匿名模型名 Ox-Alpha 运行在 OpenCodeOpenRouter 平台,一周内成为两个平台使用量最高的模型之一,六天处理超过 62 万亿 token

这次实验更受关注的变化,不只是让 AI 写代码,而是让 AI 能够理解复杂系统为什么出现性能变化。唐杰提到,Infra Agent 遇到困难时,很少是因为无法编写代码,而是无法判断「为什么结果变差」。例如当系统反馈「吞吐下降 20%」时,它只能说明某个地方出现异常,却无法直接告诉 Agent 哪一层出了问题、当前假设是否错误、下一步该验证什么。对于资深工程师来说,这类判断依赖长期经验——知道什么时候查看执行时间线、什么时候运行微基准测试、应该比较哪个模块的输出。

智谱团队希望把这种工程经验转化为 AI 可以调用的反馈机制,并将其称为 dense feedback。这套机制的核心,是让 Agent 获得更接近工程判断过程的信息:当模型需要确认计算是否正确时,可以获得对应的正确性反馈;当需要分析性能下降原因时,可以查看系统运行过程中的时间消耗;当尝试新的优化方案时,可以通过实验判断该方案是否适用于当前场景。团队认为,真正有效的反馈必须足够接近具体问题、能够快速获得,同时能够通过客观实验验证,否则大量日志和指标反而可能让 Agent 难以判断下一步行动方向。

在 dense feedback 的帮助下,Infra Agent 开始参与定位推理系统中的隐藏问题。在 KDA 的上下文并行路径中,Agent 发现了一个影响长上下文计算精度的问题:由于不同上下文分片之间需要不断合并状态矩阵,TF32 计算产生的舍入误差会随序列长度增加不断累积,最终导致计算结果偏差。Agent 通过比较不同执行路径的结果,将问题定位到状态传播和合并过程中的精度处理,相关修复已合并到 Flash Linear Attention 项目 PR #1180

另一个问题出现在 KV TransferDeepEP 调度之间。测试过程中,Agent 发现 KV Transfer 没有与 DeepEP Dispatch 形成有效重叠,导致部分场景下传输开销超过 30%。随后 Agent 沿着 Python 与 C++ 调用链继续分析,发现节点内路径没有及时释放 Python GIL,使传输任务无法及时推进。完成修改后,KV Transfer 带来的额外开销从超过 30% 降低到 1% 以下。此外,Agent 还优化了一个 Decode Kernel,发现由于 Kernel 切分方式的问题,同一组归一化计算被重复执行四次;通过重新组织计算结构、减少重复计算,该 Kernel 最终获得 1.71 倍性能提升。这一优化思路来自 Agent 对 SGLang、Flash Linear Attention 和 DeepGEMM 等项目现有 Kernel 的学习,它将这些代码中的优化经验提炼成「optimization skeleton」,再结合当前系统反馈判断是否适用。

过去,类似优化经验主要依赖工程师个人积累。而在这一过程中,Agent 开始能够从已有代码中学习优化方法,再通过实验验证这些方法是否适合新的硬件和模型环境。唐杰表示,人类工程师仍然负责设定目标、搭建反馈环境以及审核高风险修改,但工程师的角色正在变化,从直接解决每一个问题的人,逐渐转向设计反馈系统的人。

智谱团队认为,建立在真实基础设施任务上的可验证反馈环境,可能也是训练下一代模型的重要基础——每一次 Agent 完成工程任务,都可能成为下一代模型学习的数据。目前,GLM-5.3-Flash 的案例距离真正意义上的递归自我改进(Recursive Self-Improvement,RSI)仍然存在距离,但唐杰认为,一个最小规模的循环已经出现:模型优化系统,而系统服务模型。