月之暗面最新旗舰模型 Kimi K3 的投研能力在第三方测评中表现抢眼。熵简科技旗下 AlphaEngine 团队基于自建的 IRB(Investment Research Benchmark) 投研基准对其进行了系统测评,结果显示 K3 在时效判断、证据边界控制、前提纠错等维度上表现突出,多项得分超过 GPT-5.5 与 OPUS-4.8,整体投研推理能力已进入第一梯队。
K3 的核心参数方面,参数量达 2.8 万亿,上下文窗口为 百万 token,采用 MoE(混合专家)架构,可在 896 个专家中高效激活 16 个,扩展效率较上一代模型提升 2.5 倍。月之暗面已宣布 K3 的完整权重将在 7 月 27 日之前开源。
IRB 是熵简科技持续维护的投研能力评测体系,题源来自真实投研工作中的高难度案例,覆盖财务建模、时序归因、口径核验、情景推演等核心领域,采用多裁判双盲评分机制。本次测评中,K3 与 GPT-5.5、OPUS-4.8、Claude Fable 5、DeepSeek V4 等模型同题作答,统一评分。
从分数分布看,K3 的优势集中在四个方向:时效纪律、证据边界、前提纠错、策略整合,这四项对 GPT-5.5 和 OPUS-4.8 均形成 15 分以上的领先;在长上下文建模和历史复盘上,K3 与 Fable 5 处于同一水平线。
测评团队通过四道代表性题目展示了 K3 的差异化能力。在天孚通信盘中大跌归因题中,K3 主动承认“没有看到实锤个股利空”,再用间接证据搭建归因框架,避免了其他模型常见的编造事实问题。在三季度债市资金面时效判断题中,K3 抓住 DR001 从极端低位回升至 1.35%-1.40% 区间这一最新数据,明确区分“资金面边际收敛”和“流动性全面收紧”的差异,不被旧的低利率数据拉偏结论。在东阳光药净利润率前提纠错题中,K3 没有顺着用户给出的“0.76% 净利润率”直接编原因,而是先回溯半年报原始数据,发现归母净利润实际为亏损,纠正口径后才解释经营状况。在 A 股牛市阶段与配置框架题中,K3 将牛市阶段压缩为“估值修复→资金正反馈→盈利兑现”三段框架,并清晰标注当前市场所处阶段的判断依据,将抽象判断落到具体的配置动作。
测评团队总结认为,K3 的核心差异化能力在于两点:一是推理纪律,新旧证据冲突时选择对的而非选择多的;二是证据边界意识,敢于说“证据不足”。在投研场景中,比“说错”更危险的是“编对了格式但事实不存在”,K3 在这方面的表现优于多数竞品。
同时,测评也指出了 K3 仍有提升空间的领域。在 Wynn Macau Q4 业绩点评题中,K3 得分 95.7 分,在所有参评模型中最高,但相比 Fable 5,差距体现在“二阶跟踪框架”上——K3 更像一份优秀的当季业绩回顾,而 Fable 5 还多做了前瞻性跟踪链条。在东山精密分部估值题中,K3 成功搭建 SOTP(分部估值) 框架,得分 90.3 分,但与顶尖表现对比,差距体现在“市值隐含预期的逆向验证”上——K3 是正向搭建模型,而 Fable 5 还做了逆向验证。
测评团队认为,K3 在纪律性维度上已达到全球第一梯队,在建模深度和前瞻性框架上仍有向顶尖模型学习的空间,提升路径清晰。目前,AlphaEngine 用户已可在桌面端切换至 Kimi K3 模型进行体验。