湯森路透(Thomson Reuters)近日宣佈推出其首個自研法律領域AI語言模型“Thomson”,該模型基於阿里巴巴的開源Qwen系列構建。據公司披露,該專案在兩年多時間內投入約4000萬美元,主要用於人員與算力成本。值得注意的是,此前流傳的45萬美元數字僅覆蓋當前版本的最終訓練環節,並未包含全部研發開銷。

Thomson的研發路徑頗具特色:公司首先與帝國理工學院合作,對Qwen模型進行安全、倫理及政治中立性方面的再訓練,形成名為“Snowdon”的中間版本。隨後,團隊利用公司自有內容進行預訓練,並藉助領域專家進行後訓練,同時在內部工具環境中實施智慧體強化學習。據透露,目前用於訓練的內容尚不足公司可用內容的10%

在效能測試中,Thomson的表現呈現分化態勢。在斯坦福大學LegalBench基準上,Thomson得分0.823,落後於Gemini 3.1 Pro和GPT-5.5;在Harvey法律智慧體基準上,略遜於Opus 4.8。不過,它在指令遵循和PrBench Legal等測試中領先。值得注意的是,當模型能夠訪問公司自有內容(如Westlaw)時,其事實準確性達到0.83,超越GPT-5.4的0.82;而僅憑網路訪問時,Thomson得分為0.53,低於GPT-5.4的0.65。評估負責人Andrew Bean承認,Thomson在通用能力上“尚未領先”,但強調“利用自有工具進行訓練和實踐帶來了巨大提升”。

湯森路透技術長Joel Hron將自研模型與租用第三方模型比作“買房與租房”:自研意味著長期積累“權益”,而第三方模型的價值會隨使用消散。公司認為,自研而非微調前沿模型的原因有三:一是標準微調技術易損害通用能力,且受制於供應商的推理成本與路線圖;二是效能提升的關鍵在於接入自有資料,公司不願將這一優勢拱手讓人;三是複合效應——每次產品更新中的專家評審都會成為訓練資料,形成持續積累。

首批應用場景是CoCounsel Legal中的表格分析功能,該功能對成本敏感,小型自研模型更具經濟性。產品仍保持多模型架構,管理員可切換。公司強調,客戶資料不會用於訓練。此外,一個小型版本將以非商業許可的形式釋出到Hugging Face,並附帶技術報告和開發者門戶。

這一案例表明,對於擁有獨家資料、領域專家團隊和可量化質量評估流程的企業,自研垂直模型可能是一條可行路徑。Hron認為,AI領域的下一個競爭優勢“將來自知道如何編排智慧,以及知道哪種智慧值得擁有”。不過,對於缺乏專有資料或大規模評估能力的企業,自研模型可能只是徒增維護成本。