面壁智慧(OpenBMB)在 Hugging Face 上正式開源了 UltraX-0.6B-Preview 模型,這是一個面向大規模預訓練資料精煉的輕量級框架。與此前業界普遍採用的端到端文本重寫方案不同,UltraX 的核心思路是“預測編輯操作、再確定性執行”——模型先分析原始文本,輸出一系列結構化的函式呼叫指令(如 keep_all、remove_lines、replace_str、add_line 等),再由程式按指令精準修改文本,從而完成資料清洗與最佳化。
這一設計帶來了兩個直接優勢。一是成本大幅降低:UltraX 本身是一個僅 0.6B 引數的標準監督微調(SFT)模型,訓練時使用 8 塊 GPU、最大序列長度 20,480 tokens,相比呼叫大語言模型逐段重寫海量預訓練語料,計算開銷顯著減少。二是編輯過程可解釋、可控制:每一處增刪改都有明確記錄,避免了端到端重寫可能引入的語義漂移或事實錯誤。
UltraX 的技術管線包含兩個關鍵元件。LAM(Line Alignment and Mapping) 負責在行級別對齊原始文本與精煉後文本,確保編輯操作能精準定位;DCR(Dynamic Context Replacement) 則將字元級修改轉化為帶有唯一上下文錨點的 replace_str 操作,提升替換的可靠性。模型訓練採用了編輯加權取樣策略,預設配置下會基於系統指令引導編輯方向;團隊同時開源了兩個消融變體——UltraX-No-Instruction(無指令訓練)和 UltraX-Preservation-Weighted(保留加權取樣,其中 keep_all 操作佔訓練資料的 60%),供研究者在編輯激程序度與內容保留之間做權衡。
在 FineWeb 資料集(20B tokens)上的評估顯示,UltraX 在 1B 引數 MiniCPM 模型、10 個零樣本基準上的平均下游效能優於原始資料基線。無指令變體的平均得分從原始資料的 45.08 提升至 45.73,而帶指令的預設模型進一步達到 46.14,表明程式化精煉本身就能帶來增益,指令引導則放大了這一效果。保留加權變體在 ARC-C、ARC-E、OBQA、SciQ 等特定任務上表現更強,反映出資料清洗中“去噪”與“保真”之間的經典權衡。
UltraX 的釋出時機值得關注。當前預訓練資料規模持續膨脹,但網際網路爬取語料中充斥著重複內容、錯誤頁面、登入牆等低質量文本,資料篩選與清洗已成為模型訓練鏈條上最消耗人力和算力的環節之一。面壁智慧此次將精煉過程模型化、程式化,相當於在 “資料預處理”這一上游環節引入了一個可複用的專用工具,而非每次都依賴通用大模型進行昂貴的一次性重寫。這對於需要頻繁更新訓練資料、或希望在固定算力預算內提升資料質量的 AI 團隊而言,提供了一條新的工程路徑。
此次釋出同步公開了完整程式碼、精煉後的資料集以及技術報告(arXiv: 2607.08646),模型採用 Apache 2.0 協議開源。面壁智慧在致謝中提到,UltraX 的訓練基於 ms-swift 框架,並借鑑了 ProX 與 RefineX 等前序工作的思路。隨著資料工程在 AI 產業中的權重持續上升,這類輕量、可規模化的資料精煉工具或將成為模型訓練基礎設施中的標準組件。