上海人工智能实验室发布了新一代智能体模型 Atria Dawn 的预览版本,模型卡信息显示其基于 744B 参数的 MoE(混合专家)基座模型训练,定位为面向科研与工程场景的智能体模型,强调持续的环境理解、工具调用与多步任务完成能力。该预览版以 MIT 许可开放代码与模型权重,并提供 FP8 量化版本 Atria-Dawn-Preview-FP8。
从官方描述看,Atria Dawn 的目标是帮助用户把开放式问题推进到可执行、可验证、可复现的结果。它结合任务目标与环境反馈,支持问题分析、方案设计、工具使用、代码实现、实验执行、结果分析以及失败恢复等环节。官方将其智能体能力归纳为四个维度:发现(检索与整理证据、开展深度研究、把研究问题转化为可执行的实验计划)、创造(构建软件、交互应用、游戏、数据可视化与机器学习系统)、交付(把文档、数据和设计需求转化为报告、演示等结构化成果),以及网络安全(在授权环境中分析安全问题、验证漏洞、应用修复并复验)。
官方同时公布了覆盖多个基准的评测结果。在 AutomationBench 上,Atria Dawn Preview 得分为 53.8,高于对比表中的 DeepSeek V4 Pro 0813(41.7)、KIMI K3(45.9)、Qwen 3.8 Max(49.7)、GLM 5.3(49.2)、GPT 5.6 sol(45.7)与 Claude Opus 5(49.4)。在 BFCL v4 上得分为 77.0,高于 DeepSeek V4 Pro 0813 的 71.4、KIMI K3 的 69.1 与 GLM 5.3 的 74.1。
在 CyberGym 上,Atria Dawn Preview 得分为 86.5,高于 DeepSeek V4 Pro 0813(83.3)、KIMI K3(78.7)、Qwen 3.8 Max(73.8)、GLM 5.3(84.5)与 GPT 5.6 sol(83.6)。DeepSearchQA 上得分为 96.0,略高于 KIMI K3 的 95.9、GLM 5.3 的 94.7 与 GPT 5.6 sol 的 93.2。BrowseComp 得分为 92.5,高于 DeepSeek V4 Pro 0813(83.4)、KIMI K3(91.2)、GPT 5.6 sol(92.2)与 Claude Opus 5(90.8)。SkillsBench 得分为 66.4,略高于 DeepSeek V4 Pro 0813 的 65.0 与 Qwen 3.8 Max 的 66.7 接近,高于 GLM 5.3(63.3)、GPT 5.6 sol(62.5)与 Claude Opus 5(63.7)。
不过,评测表也显示 Atria Dawn Preview 并非在所有项目上领先。Workspace-Bench-Lite 得分为 68.2,低于 Claude Opus 5 的 70.1;Workspace-Bench 得分为 65.0,与 Claude Opus 5 的 65.8 接近;MLE-bench Lite 得分为 86.2,低于 GPT 5.6 sol 的 88.9 与 Claude Opus 5 的 88.0;WideSearch 得分为 81.9,低于 GLM 5.3 的 82.7 与 GPT 5.6 sol 的 83.3;DeepResearch Bench II 得分为 51.1,低于 GLM 5.3 的 52.7 与 Claude Opus 5 的 54.1;τ³-Bench Banking 得分为 41.2,低于 Qwen 3.8 Max 的 55.2、Claude Opus 5 的 48.7 与 GPT 5.6 sol 的 46.9;Terminal-Bench 2.1 得分为 78.3,低于 Qwen 3.8 Max 的 89.3、GPT 5.6 sol 的 85.4 与 Claude Opus 5 的 90.2;GDPval 得分为 1583,低于 Qwen 3.8 Max 的 1722、Claude Opus 5 的 1768 与 GPT 5.6 sol 的 1682;SWE-bench Pro 得分为 59.6,低于 Qwen 3.8 Max 的 65.1 与 Claude Opus 5 的 74.7;JobBench 得分为 50.3,低于 Qwen 3.8 Max 的 58.2 与 Claude Opus 5 的 68.0。
整体来看,这份评测呈现出一种「长板突出、短板并存」的格局:Atria Dawn Preview 在自动化、工具调用、网络安全、深度搜索与浏览类任务上表现较强,但在终端操作、软件工程、金融场景智能体以及部分办公与科研交付类基准上,与 Qwen 3.8 Max、Claude Opus 5 等模型仍有差距。对关注 AI 产业的读者而言,这类智能体模型的迭代值得留意,因为它直接关系到模型从「对话工具」向「可执行任务的数字劳动力」演进的进度,也牵动科研自动化、办公自动化与安全运维等应用场景的落地节奏。模型以 MIT 许可开放权重,也意味着后续会有更多基于该基座的微调与行业适配出现。