汤森路透(Thomson Reuters)近日宣布推出其首个自研法律领域AI语言模型“Thomson”,该模型基于阿里巴巴的开源Qwen系列构建。据公司披露,该项目在两年多时间内投入约4000万美元,主要用于人员与算力成本。值得注意的是,此前流传的45万美元数字仅覆盖当前版本的最终训练环节,并未包含全部研发开销。
Thomson的研发路径颇具特色:公司首先与帝国理工学院合作,对Qwen模型进行安全、伦理及政治中立性方面的再训练,形成名为“Snowdon”的中间版本。随后,团队利用公司自有内容进行预训练,并借助领域专家进行后训练,同时在内部工具环境中实施智能体强化学习。据透露,目前用于训练的内容尚不足公司可用内容的10%。
在性能测试中,Thomson的表现呈现分化态势。在斯坦福大学LegalBench基准上,Thomson得分0.823,落后于Gemini 3.1 Pro和GPT-5.5;在Harvey法律智能体基准上,略逊于Opus 4.8。不过,它在指令遵循和PrBench Legal等测试中领先。值得注意的是,当模型能够访问公司自有内容(如Westlaw)时,其事实准确性达到0.83,超越GPT-5.4的0.82;而仅凭网络访问时,Thomson得分为0.53,低于GPT-5.4的0.65。评估负责人Andrew Bean承认,Thomson在通用能力上“尚未领先”,但强调“利用自有工具进行训练和实践带来了巨大提升”。
汤森路透首席技术官Joel Hron将自研模型与租用第三方模型比作“买房与租房”:自研意味着长期积累“权益”,而第三方模型的价值会随使用消散。公司认为,自研而非微调前沿模型的原因有三:一是标准微调技术易损害通用能力,且受制于供应商的推理成本与路线图;二是性能提升的关键在于接入自有数据,公司不愿将这一优势拱手让人;三是复合效应——每次产品更新中的专家评审都会成为训练数据,形成持续积累。
首批应用场景是CoCounsel Legal中的表格分析功能,该功能对成本敏感,小型自研模型更具经济性。产品仍保持多模型架构,管理员可切换。公司强调,客户数据不会用于训练。此外,一个小型版本将以非商业许可的形式发布到Hugging Face,并附带技术报告和开发者门户。
这一案例表明,对于拥有独家数据、领域专家团队和可量化质量评估流程的企业,自研垂直模型可能是一条可行路径。Hron认为,AI领域的下一个竞争优势“将来自知道如何编排智能,以及知道哪种智能值得拥有”。不过,对于缺乏专有数据或大规模评估能力的企业,自研模型可能只是徒增维护成本。