上海人工智慧實驗室釋出了新一代智慧體模型 Atria Dawn 的預覽版本,模型卡資訊顯示其基於 744B 引數的 MoE(混合專家)基座模型訓練,定位為面向科研與工程場景的智慧體模型,強調持續的環境理解、工具呼叫與多步任務完成能力。該預覽版以 MIT 許可開放程式碼與模型權重,並提供 FP8 量化版本 Atria-Dawn-Preview-FP8。
從官方描述看,Atria Dawn 的目標是幫助使用者把開放式問題推進到可執行、可驗證、可復現的結果。它結合任務目標與環境反饋,支援問題分析、方案設計、工具使用、程式碼實現、實驗執行、結果分析以及失敗恢復等環節。官方將其智慧體能力歸納為四個維度:發現(檢索與整理證據、開展深度研究、把研究問題轉化為可執行的實驗計劃)、創造(構建軟體、互動應用、遊戲、資料視覺化與機器學習系統)、交付(把文件、資料和設計需求轉化為報告、演示等結構化成果),以及網路安全(在授權環境中分析安全問題、驗證漏洞、應用修復並複驗)。
官方同時公佈了覆蓋多個基準的評測結果。在 AutomationBench 上,Atria Dawn Preview 得分為 53.8,高於對比表中的 DeepSeek V4 Pro 0813(41.7)、KIMI K3(45.9)、Qwen 3.8 Max(49.7)、GLM 5.3(49.2)、GPT 5.6 sol(45.7)與 Claude Opus 5(49.4)。在 BFCL v4 上得分為 77.0,高於 DeepSeek V4 Pro 0813 的 71.4、KIMI K3 的 69.1 與 GLM 5.3 的 74.1。
在 CyberGym 上,Atria Dawn Preview 得分為 86.5,高於 DeepSeek V4 Pro 0813(83.3)、KIMI K3(78.7)、Qwen 3.8 Max(73.8)、GLM 5.3(84.5)與 GPT 5.6 sol(83.6)。DeepSearchQA 上得分為 96.0,略高於 KIMI K3 的 95.9、GLM 5.3 的 94.7 與 GPT 5.6 sol 的 93.2。BrowseComp 得分為 92.5,高於 DeepSeek V4 Pro 0813(83.4)、KIMI K3(91.2)、GPT 5.6 sol(92.2)與 Claude Opus 5(90.8)。SkillsBench 得分為 66.4,略高於 DeepSeek V4 Pro 0813 的 65.0 與 Qwen 3.8 Max 的 66.7 接近,高於 GLM 5.3(63.3)、GPT 5.6 sol(62.5)與 Claude Opus 5(63.7)。
不過,評測表也顯示 Atria Dawn Preview 並非在所有專案上領先。Workspace-Bench-Lite 得分為 68.2,低於 Claude Opus 5 的 70.1;Workspace-Bench 得分為 65.0,與 Claude Opus 5 的 65.8 接近;MLE-bench Lite 得分為 86.2,低於 GPT 5.6 sol 的 88.9 與 Claude Opus 5 的 88.0;WideSearch 得分為 81.9,低於 GLM 5.3 的 82.7 與 GPT 5.6 sol 的 83.3;DeepResearch Bench II 得分為 51.1,低於 GLM 5.3 的 52.7 與 Claude Opus 5 的 54.1;τ³-Bench Banking 得分為 41.2,低於 Qwen 3.8 Max 的 55.2、Claude Opus 5 的 48.7 與 GPT 5.6 sol 的 46.9;Terminal-Bench 2.1 得分為 78.3,低於 Qwen 3.8 Max 的 89.3、GPT 5.6 sol 的 85.4 與 Claude Opus 5 的 90.2;GDPval 得分為 1583,低於 Qwen 3.8 Max 的 1722、Claude Opus 5 的 1768 與 GPT 5.6 sol 的 1682;SWE-bench Pro 得分為 59.6,低於 Qwen 3.8 Max 的 65.1 與 Claude Opus 5 的 74.7;JobBench 得分為 50.3,低於 Qwen 3.8 Max 的 58.2 與 Claude Opus 5 的 68.0。
整體來看,這份評測呈現出一種「長板突出、短板並存」的格局:Atria Dawn Preview 在自動化、工具呼叫、網路安全、深度搜索與瀏覽類任務上表現較強,但在終端操作、軟體工程、金融場景智慧體以及部分辦公與科研交付類基準上,與 Qwen 3.8 Max、Claude Opus 5 等模型仍有差距。對關注 AI 產業的讀者而言,這類智慧體模型的迭代值得留意,因為它直接關係到模型從「對話工具」向「可執行任務的數字勞動力」演進的進度,也牽動科研自動化、辦公自動化與安全運維等應用場景的落地節奏。模型以 MIT 許可開放權重,也意味著後續會有更多基於該基座的微調與行業適配出現。