階躍星辰釋出旗艦基座模型 Step 5 Preview,在 Artificial Analysis 智慧指數上取得 44 分,位列全球開源前二,重新進入頂尖旗艦模型的比較區間。這一成績說明,階躍在押注終端與 Agent 的同時,前沿基座模型的能力上限並未掉隊。
回顧階躍的路徑,兩年前它憑藉 Step 1 在基模圈公開亮相,同年接連發布 Step 1V 和萬億引數基座模型 Step 2,當時行業仍普遍相信模型越大能力越強。但過去一年,階躍的曝光更多集中在多模態模型、手機、汽車、端側模型和 Agent 上,那個需要與 Qwen、Kimi、GLM 正面比較的旗艦基模反而不再是討論中心。Step 5 Preview 改變了這一局面。
對 Agent 而言,進入榜單只是拿到入場券。真正的考驗是模型離開 Benchmark 後,能否在幾十甚至上百步操作裡把一件事從頭做到尾。為此,測試者把任務放進專業軟體鏈路:以 Claude Code CLI 作為 Agent 工作台,Blender 負責 3D 資產和關卡,Three.js/Vite 負責網頁遊戲呈現,要求 Step 5 Preview 製作一款可執行的 3D 迷你網頁遊戲《星躍島:能量快遞》。
測試並未替模型寫程式碼或操作 Blender,而是把大任務拆成四個階段:先完成原創蘑菇頭角色「菇嚕」,再搭建浮空島關卡,隨後匯出 GLB 資產,最後進入網頁遊戲工程。每個階段內部的程式碼編寫、Blender 操作、檔案生成和除錯仍由模型完成。拆分後任務穩定推進:模型先完成角色與關卡資產,再把 Blender 生成的模型接入 Three.js/Vite 專案,繼續處理移動、碰撞、能量球收集和終點判定。中間雖有修改和除錯,但最終沒有推倒工程,而是在已有結果上繼續執行,直到專案可以執行。
最終成品可以正常遊玩:玩家控制「菇嚕」在 6 個浮空平台之間移動,收集 5 個能量球並抵達終點信標。角色、場景、碰撞、基礎互動和網頁工程都已接通,雖然部分視覺和操作細節仍顯粗糙,但它已不是一組靜態資產,而是可實際遊玩的完整 Demo。這輪測試真正考驗的,是模型在跨越 Blender、檔案系統和網頁工程的長任務裡,能否保持目標、使用工具、根據中間結果繼續執行並最終交付。
據階躍官方披露,Step 5 Preview 的 Coding 能力不侷限於傳統程式碼任務,可做複雜軟體工程(含長程規劃)、前端和視覺開發,也能進入可程式設計硬體場景;當任務持續數小時、需要不斷根據結果調整時,模型也能繼續推進。在內部和外部專家參與的評測中,約 70% 的評測者認為它可以自主完成中高複雜度的 Coding 任務。此外,在 Agents' Last Exam 的 CLI 子集 ALE-CLI、金融投資研究評測 FrontierFinance 以及跨領域深度研究評測 DRACO 上,該模型僅次於 GPT-6 Astra 或 Claude Opus 5,領先其他參評開源模型。
從 AA 榜單模型頁看,Step 5 Preview 輸出速度為 99.8 tokens/s,單個 Intelligence Index 任務成本為 0.71 美元;輸入價格 1.00 美元/百萬 token,輸出價格 2.70 美元/百萬 token,緩存摺扣 95%。頁面還顯示其支援文本和影像輸入、文本輸出,上下文視窗為 1M token,引數規模 600B。這是一套「智慧、速度、成本、上下文視窗」的組合。
該指數覆蓋知識工作、Agent 工作流、終端使用、程式設計、長上下文、文件推理等多類任務,對一個面向 Agentic 任務的模型來說,比單看某個問答榜單更接近真實使用場景。更關鍵的是任務成本:Agent 不是一次性回答問題,而是反覆讀上下文、呼叫工具、生成程式碼、執行測試、根據報錯繼續修改。任務一旦變長,token 單價和快取策略就會直接影響使用者是否願意讓模型多試幾輪,這也是決定模型能否被開發者和企業使用者選擇、真正實現規模化商用的關鍵。從截圖看,Step 5 Preview 憑藉 0.71 美元的單任務成本在 654 個模型中位於第 4 位,相當於 Kimi K3 的 35%,把模型能力、效率與成本最優平衡的帕累託前沿向外推進。
Step 5 Preview 進入 AA 榜單全球前沿梯隊,是重新衡量階躍的標誌性節點。它正把前沿基座模型、全模態模型矩陣和終端量產能力擰成一股繩。過去一個季度,階躍先後釋出 Step Edge、StepAudio 3 系列,再到 Step 5 Preview,模型矩陣已覆蓋從雲端旗艦、Flash 高效模型、端側模型,到語音、視覺、生成、GUI 等專項能力的完整全模態矩陣。據官方資訊,StepAudio 3 Realtime 在 Artificial Analysis Conversational Dynamics 榜單中以 98.9% 位列第一,Speech Reasoning 準確率為 99.7%;StepAudio 3 ASR 在非流式語音識別準確性榜單中詞錯誤率為 1.7%,並列第一。
終端側,據官方公開資料,階躍模型已進入手機、汽車等真實裝置場景量產落地;截至 2025 年底,其手機側模型裝機量超過 4200 萬台,日均服務近 2000 萬人次,並覆蓋國內超 50% 頭部手機品牌。與純 API 模型公司相比,終端入口的價值在於高頻、真實、複雜:低延遲、低算力、噪聲環境、隱私約束和使用者習慣,都會持續反向檢驗模型。
從行業格局看,基模公司的競爭已不再只是單一模型能力比拼,而是全棧技術能力與商業化落地的系統較量。DeepSeek 的優勢在全球開發者影響力,阿里千問背靠雲和生態,智譜深耕企業交付,Kimi 更有 C 端產品心智,而階躍的獨特位置是「AI+終端」:前沿模型負責複雜推理,全模態模型負責感知和表達,端側模型負責低延遲和高頻入口。這條路線並不輕鬆——終端生態裡有手機廠商、車企、作業系統和應用許可權;Agent 真正落地還要解決安全、隱私、跨應用執行和使用者信任。Step 5 Preview 讓階躍重新進入第一梯隊前沿模型的競技場,結合已有的全模態矩陣與終端量產能力,將其送上國產 AI 牌桌的中心。大模型市場終局未定,頭部廠商的領先優勢不會一成不變,模型能力、成本結構、終端入口和工作台體驗都可能重新洗牌;接下來真正要看的,是模型能否在更多真實工作流裡把任務一次次交到終點。