月之暗面最新旗艦模型 Kimi K3 的投研能力在第三方測評中表現搶眼。熵簡科技旗下 AlphaEngine 團隊基於自建的 IRB(Investment Research Benchmark) 投研基準對其進行了系統測評,結果顯示 K3 在時效判斷、證據邊界控制、前提糾錯等維度上表現突出,多項得分超過 GPT-5.5 與 OPUS-4.8,整體投研推理能力已進入第一梯隊。
K3 的核心引數方面,引數量達 2.8 萬億,上下文視窗為 百萬 token,採用 MoE(混合專家)架構,可在 896 個專家中高效啟用 16 個,擴充套件效率較上一代模型提升 2.5 倍。月之暗面已宣佈 K3 的完整權重將在 7 月 27 日之前開源。
IRB 是熵簡科技持續維護的投研能力評測體系,題源來自真實投研工作中的高難度案例,覆蓋財務建模、時序歸因、口徑核驗、情景推演等核心領域,採用多裁判雙盲評分機制。本次測評中,K3 與 GPT-5.5、OPUS-4.8、Claude Fable 5、DeepSeek V4 等模型同題作答,統一評分。
從分數分佈看,K3 的優勢集中在四個方向:時效紀律、證據邊界、前提糾錯、策略整合,這四項對 GPT-5.5 和 OPUS-4.8 均形成 15 分以上的領先;在長上下文建模和歷史覆盤上,K3 與 Fable 5 處於同一水平線。
測評團隊通過四道代表性題目展示了 K3 的差異化能力。在天孚通訊盤中大跌歸因題中,K3 主動承認“沒有看到實錘個股利空”,再用間接證據搭建歸因框架,避免了其他模型常見的編造事實問題。在三季度債市資金面時效判斷題中,K3 抓住 DR001 從極端低位回升至 1.35%-1.40% 區間這一最新資料,明確區分“資金面邊際收斂”和“流動性全面收緊”的差異,不被舊的低利率資料拉偏結論。在東陽光藥淨利潤率前提糾錯題中,K3 沒有順著使用者給出的“0.76% 淨利潤率”直接編原因,而是先回溯半年報原始資料,發現歸母淨利潤實際為虧損,糾正口徑後才解釋經營狀況。在 A 股牛市階段與配置框架題中,K3 將牛市階段壓縮為“估值修復→資金正反饋→盈利兌現”三段框架,並清晰標註當前市場所處階段的判斷依據,將抽象判斷落到具體的配置動作。
測評團隊總結認為,K3 的核心差異化能力在於兩點:一是推理紀律,新舊證據衝突時選擇對的而非選擇多的;二是證據邊界意識,敢於說“證據不足”。在投研場景中,比“說錯”更危險的是“編對了格式但事實不存在”,K3 在這方面的表現優於多數競品。
同時,測評也指出了 K3 仍有提升空間的領域。在 Wynn Macau Q4 業績點評題中,K3 得分 95.7 分,在所有參評模型中最高,但相比 Fable 5,差距體現在“二階跟蹤框架”上——K3 更像一份優秀的當季業績回顧,而 Fable 5 還多做了前瞻性跟蹤鏈條。在東山精密分部估值題中,K3 成功搭建 SOTP(分部估值) 框架,得分 90.3 分,但與頂尖表現對比,差距體現在“市值隱含預期的逆向驗證”上——K3 是正向搭建模型,而 Fable 5 還做了逆向驗證。
測評團隊認為,K3 在紀律性維度上已達到全球第一梯隊,在建模深度和前瞻性框架上仍有向頂尖模型學習的空間,提升路徑清晰。目前,AlphaEngine 使用者已可在桌面端切換至 Kimi K3 模型進行體驗。