清華大學計算機系教授、智譜創始人唐傑分享了一個內部觀察到的遞迴自我改進(RSI)早期案例:由GLM-5.3驅動的Infra Agent,在超過10萬張國產晶片組成的叢集上,從零參與搭建並優化了一套生產級推理系統,GLM-5.3-Flash的全部線上推理都執行在這套系統之上。
所謂RSI,指系統能夠自主設計並訓練出自己的繼任者。唐傑團隊把這次實踐視為RSI第一次有了工程化、甚至已進入生產環境的雛形,而不只是“未來某一天AI會自己變強”的抽象討論。
從讓模型在新硬體上跑起來,到構建一套能穩定承載生產流量的高效能推理服務,本身是龐大的系統工程。此前沒有人成功部署過如此大規模的國產卡叢集,團隊面對的是晶片記憶體容量與頻寬相對受限、生態不成熟、運算元不完備、許多文件基本靠猜的局面,同時還要支援新結構模型的1M上下文視窗和多模態請求。最終完成這件事的不是一支團隊,而是GLM-5.3驅動的Infra Agent。
在最佳化過程中,Agent已能自己讀取系統反饋、提出假設、修改程式碼、跑實驗,再根據結果繼續迭代。兩個具體案例被披露:其一,它定位出KV Transfer場景中Python GIL導致的併發阻塞,把Prefill+KV Transfer相比單獨Prefill超過20%的效能損失壓到了1%以內;其二,在KDA Decode運算元上,它通過重新組織計算拿到了1.71倍的效能提升。
團隊實施了一系列激進的記憶體最佳化,包括以算力換頻寬、以通訊換視訊記憶體等定製方案,涉及線性注意力與LM Head的節點內張量並行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合精度快取量化以及Layer Split等。在此基礎上引入Encode–Prefill–Decode(EPD分離式架構),實現端到端服務效能約3倍提升,硬體利用效率與單Token成本均達到主流NVIDIA GPU的相當水平。由於Infra Agent參與的反饋閉環貫穿整個最佳化過程,GLM-5.3-Flash在不到兩週時間內完成了從模型適配到生產可用的跨越。
唐傑團隊強調,決定Infra Agent工程效果的,不只是模型自身的程式碼生成與推理能力,更取決於系統能否持續提供有效、可歸因的反饋。程式碼庫只能提供靜態上下文,而推理系統中的精度異常、效能退化往往來自運算元實現、並行策略、通訊行為、記憶體管理與服務排程的動態互動。如果一次修改後得到的反饋只是“精度測試未通過”或“吞吐下降20%”,Agent仍難以判斷問題出在哪一層。因此他們把正確性測試、執行日誌、執行Trace、執行時事件、微基準測試和端到端指標納入Agent迭代流程,把系統最佳化拆分為可區域性觀測和驗證的環節,形成由工程師、Infra Agent和實驗環境共同組成的最佳化閉環:工程師定義目標與系統邊界,Agent負責分析、假設和修改,實驗環境提供分層、及時且可驗證的反饋。
這一路徑也帶來更廣的產業含義。對關注AI基礎設施的投資者而言,它指向兩個方向:一是國產晶片叢集在大規模推理場景下的工程可行性正在被驗證,硬體利用效率與單Token成本被拿來與主流NVIDIA GPU對標;二是模型開始參與最佳化承載自身推理的系統,每一次上線積累的經驗會降低下一次最佳化所需的工程師投入,這可能改變基礎設施團隊的人力結構與迭代節奏。
唐傑還提到GLM研發過程中的另一面:模型時常湧現出令團隊驚喜甚至不安的能力,安全能力是程式碼能力的自然延伸,不到一年,安全夥伴使用GLM在真實程式碼庫中發現了數千個漏洞。他坦言,在GLM-4.7之前,內部用GLM寫程式碼多少帶著被迫的成分,那時Coding的PMF還未到來;今天GLM-5.3已成為團隊每天離不開的Coding夥伴。GLM-5.3-Flash還以匿名模型Ox-Alpha在OpenCode與OpenRouter上接受真實呼叫檢驗。
團隊表示,他們看到模型完成了一項過去需要一支資深Infra團隊數週才能完成的基礎設施工作,並意識到這項工作將直接改變下一代模型的訓練方式。