德国研究联盟近日发布了开源语言模型Soofi S,该模型拥有316亿参数,但采用混合专家(MoE)架构,每生成一个token仅激活约32亿参数,计算成本接近30亿参数模型。其混合Mamba-Transformer架构使其在处理极长上下文时仍能保持吞吐量,而传统密集模型如Apertus 70B和Qwen3 32B在此类任务中性能会急剧下降。
Soofi S完全在德国电信位于慕尼黑的工业AI云基础设施上训练,训练数据中德语内容占比较高。根据预训练报告,该模型在英语和德语基准测试中,在完全开源模型类别里取得了最高分,超越了之前的领先者OLMo 3 32B和Apertus 70B。
然而,模型发布后引发争议。社区在检查公开的训练数据时发现,科学基准GPQA(包括其高难度变体GPQA Diamond)的测试题意外混入了训练数据。联盟在7月24日发布的3.0版技术报告中承认了这一数据污染事件。报告指出,问题源于GPQA在Hugging Face平台上没有独立的训练集,所有测试材料默认标为“train”,导致数据管道将测试题与练习题混在一起。后续审计还发现了另外三个存在相同问题的基准(TruthfulQA、BLiMP和Inverse Scaling),但这些基准并未用于Soofi S的评估。
作为回应,联盟将GPQA从评估中完全移除,并重新计算了所有16个对比模型的整体结果。据作者称,排名顺序未发生变化。值得注意的是,训练过程中并未发现该问题——模型在受影响的GPQA任务上得分从32.3稳步提升至43.4,但这一提升幅度属于正常范围,与其他测试的进展无异,没有出现异常突增。为防止类似事件,团队现在会自动将训练数据与所有测试题进行交叉核对,而非依赖常具误导性的标签。
项目参与者如弗劳恩霍夫IAIS的Nicolas Flores Herr指出,这一事件恰恰证明了开源方法的优势——正是因为数据公开,社区才能发现问题。团队表示已提供约15.2万个单独结果供验证。联盟合作伙伴Ellamind使用其独立保留的、模型训练期间未见的测试数据进行的评估,也确认了结果。联盟称受影响部分仅占总语料库的极小比例。
此外,模型还面临“过度训练”的批评。按照经典的Chinchilla缩放定律,模型参数与训练数据的理想比例约为每个参数20个token。而Soofi S使用了约27万亿token训练300亿参数,比例达到数百比一;若仅按每token激活的32亿参数计算,比例更是高达数千比一。项目技术负责人Michael Fromm反驳称,这些旧缩放定律不适用于MoE架构,因为MoE模型中各个专家会从重复数据中受益,且英伟达也曾用多达25万亿token训练自己的模型。
目前,Soofi S的指令微调和推理变体正在beta测试中,预计将在未来几周内以宽松许可证发布。更大的Soofi L模型已在训练中。