德國研究聯盟近日釋出了開源語言模型Soofi S,該模型擁有316億引數,但採用混合專家(MoE)架構,每生成一個token僅啟用約32億引數,計算成本接近30億引數模型。其混合Mamba-Transformer架構使其在處理極長上下文時仍能保持吞吐量,而傳統密集模型如Apertus 70B和Qwen3 32B在此類任務中效能會急劇下降。

Soofi S完全在德國電信位於慕尼黑的工業AI雲基礎設施上訓練,訓練資料中德語內容佔比較高。根據預訓練報告,該模型在英語和德語基準測試中,在完全開源模型類別裡取得了最高分,超越了之前的領先者OLMo 3 32BApertus 70B

然而,模型釋出後引發爭議。社群在檢查公開的訓練資料時發現,科學基準GPQA(包括其高難度變體GPQA Diamond)的測試題意外混入了訓練資料。聯盟在7月24日釋出的3.0版技術報告中承認了這一資料汙染事件。報告指出,問題源於GPQA在Hugging Face平台上沒有獨立的訓練集,所有測試材料預設標為“train”,導致資料管道將測試題與練習題混在一起。後續審計還發現了另外三個存在相同問題的基準(TruthfulQA、BLiMP和Inverse Scaling),但這些基準並未用於Soofi S的評估。

作為回應,聯盟將GPQA從評估中完全移除,並重新計算了所有16個對比模型的整體結果。據作者稱,排名順序未發生變化。值得注意的是,訓練過程中並未發現該問題——模型在受影響的GPQA任務上得分從32.3穩步提升至43.4,但這一提升幅度屬於正常範圍,與其他測試的進展無異,沒有出現異常突增。為防止類似事件,團隊現在會自動將訓練資料與所有測試題進行交叉核對,而非依賴常具誤導性的標籤。

專案參與者如弗勞恩霍夫IAIS的Nicolas Flores Herr指出,這一事件恰恰證明了開源方法的優勢——正是因為資料公開,社群才能發現問題。團隊表示已提供約15.2萬個單獨結果供驗證。聯盟合作伙伴Ellamind使用其獨立保留的、模型訓練期間未見的測試資料進行的評估,也確認了結果。聯盟稱受影響部分僅佔總語料庫的極小比例。

此外,模型還面臨“過度訓練”的批評。按照經典的Chinchilla縮放定律,模型引數與訓練資料的理想比例約為每個引數20個token。而Soofi S使用了約27萬億token訓練300億引數,比例達到數百比一;若僅按每token啟用的32億引數計算,比例更是高達數千比一。專案技術負責人Michael Fromm反駁稱,這些舊縮放定律不適用於MoE架構,因為MoE模型中各個專家會從重複資料中受益,且輝達也曾用多達25萬億token訓練自己的模型。

目前,Soofi S的指令微調和推理變體正在beta測試中,預計將在未來幾周內以寬鬆許可證釋出。更大的Soofi L模型已在訓練中。