7月底至8月中旬,开源大模型迎来一波密集发布潮:国内Kimi K3、Qwen3.8-Max先后放出权重,DeepSeek V4 Pro正式版上线;沉寂一年多的美国开源阵营也强势回归,Meta推出Muse Glimmer,英伟达带来Nemotron 3.5 Lightning。面对如此盛况,硅星GenAI(作者周一笑)将五款模型接入同一测试环境,进行了一场全面横评,涵盖逻辑推理、代码画图、Agent任务、Blender脚本生成和写作改写等维度,所有结果由脚本加真人盲评打分。
测试设计上,每道题设置了统一的输出上限,思考与作答共用额度,超限即视为未交卷;同时,超限任务会放开上限单独完整跑一遍作为对照。最终成绩显示,Kimi K3表现最全面,十项测试中六项拿到满分,DeepSeek V4 Pro紧随其后位居第二。值得注意的是,部分0分源于模型思考过长被截断,而非能力缺失。
在逻辑推理环节,24点与五位数密码锁题目暴露了大小模型的差距。K3和Qwen在密码锁上全对,而Muse Glimmer和Nemotron 3.5 Lightning两个小模型因思考过长撞上输出上限,直接交了白卷——托管平台给它们的单次输出额度分别只有16K和24K token。放开上限补跑后,Muse密码锁两次全对,Nemotron烧掉六万token仍给出错误答案,DeepSeek则全对。加时赛中,每个模型有30美分预算,可重试至花完。DeepSeek一轮全对,五题全解仅花4美分,比靠重试磨出结果的Muse便宜四倍;K3一次认真思考就要35美分,Qwen也需近20美分。
代码画图环节,测试要求模型用SVG代码绘制“白头鹰骑车、熊猫撑伞”的画面。多模态模型K3和Qwen表现最佳,能一眼认出剧情;Nemotron和Muse的作品则“需要观众自带想象力”。第二道题要求用虚构城市的地铁数据(四条线26个站)编写单文件网页,实现线路图绘制、路线计算与换乘动画。K3两次满分,Muse画图但路线算错,Nemotron功能缺失大半,Qwen在上限内未写完但放开后补交完成度很高的版本,DeepSeek排第二。第三道题让模型为自己的成绩单制作可视化网页,DeepSeek两次都在上限内完成并拿下最高分,Muse两次完成居第二。
Agent能力测试中,模型需自主读文件、跑命令、改代码。修bug任务(埋三个bug、十二个测试全绿)五家全部完成,但成本差异显著:两个30B模型一次不到1美分,万亿参数模型贵数倍,DeepSeek仅0.3美分。账单清洗任务中,K3、Qwen、DeepSeek满分,Muse十五轮全耗在编码问题上,Nemotron仅获部分分数。首次测试时托管商不支持Nemotron原生工具调用,后补测仍未能通过账单题。
Blender脚本测试要求从零构建一座中式庭院,K3两份脚本一次跑通并渲染出图,Qwen放开上限后出图,Muse脚本报错,Nemotron先被截断后写错接口名,DeepSeek一份出图、另一份因废弃参数失败。写作环节的四道改写题中,简单题差距不大,难题(涨价说明、年终盘点)没有模型摸到4分,K3是唯一在两道难题中都拿到3分的模型。
综合来看,大模型与小模型的差距依然存在,但各自优势明显。K3在冲能力上限,可与最前沿闭源模型比肩,但相对贵且慢;Qwen稳而全能,给足时间大多能完成;DeepSeek则是最让人意外的——能力不弱、价格极低,加时赛五题全对仅花4美分,与两个小参数模型同属低成本梯队,其性价比优势可能进一步拉低市场对“强模型合理价格”的预期。小模型在简单任务上快而便宜,但面对长时间推理、复杂代码或连续工具调用时仍显吃力。
此次横评也折射出开源生态的活跃:Meta预告旗舰Muse Spark 1.2权重未来几周放出,阿里已将Qwen3.8大杯权重上传Hugging Face。半个月内如此多开源模型集中出现,一年前难以想象。对模型使用者而言,更多选择无疑是好事。需要说明的是,本次测试通过OpenRouter接入各家托管商,花费按托管商标价结算,与官方API价目不完全一致。