阶跃星辰发布旗舰基座模型 Step 5 Preview,在 Artificial Analysis 智能指数上取得 44 分,位列全球开源前二,重新进入顶尖旗舰模型的比较区间。这一成绩说明,阶跃在押注终端与 Agent 的同时,前沿基座模型的能力上限并未掉队。
回顾阶跃的路径,两年前它凭借 Step 1 在基模圈公开亮相,同年接连发布 Step 1V 和万亿参数基座模型 Step 2,当时行业仍普遍相信模型越大能力越强。但过去一年,阶跃的曝光更多集中在多模态模型、手机、汽车、端侧模型和 Agent 上,那个需要与 Qwen、Kimi、GLM 正面比较的旗舰基模反而不再是讨论中心。Step 5 Preview 改变了这一局面。
对 Agent 而言,进入榜单只是拿到入场券。真正的考验是模型离开 Benchmark 后,能否在几十甚至上百步操作里把一件事从头做到尾。为此,测试者把任务放进专业软件链路:以 Claude Code CLI 作为 Agent 工作台,Blender 负责 3D 资产和关卡,Three.js/Vite 负责网页游戏呈现,要求 Step 5 Preview 制作一款可运行的 3D 迷你网页游戏《星跃岛:能量快递》。
测试并未替模型写代码或操作 Blender,而是把大任务拆成四个阶段:先完成原创蘑菇头角色「菇噜」,再搭建浮空岛关卡,随后导出 GLB 资产,最后进入网页游戏工程。每个阶段内部的代码编写、Blender 操作、文件生成和调试仍由模型完成。拆分后任务稳定推进:模型先完成角色与关卡资产,再把 Blender 生成的模型接入 Three.js/Vite 项目,继续处理移动、碰撞、能量球收集和终点判定。中间虽有修改和调试,但最终没有推倒工程,而是在已有结果上继续执行,直到项目可以运行。
最终成品可以正常游玩:玩家控制「菇噜」在 6 个浮空平台之间移动,收集 5 个能量球并抵达终点信标。角色、场景、碰撞、基础交互和网页工程都已接通,虽然部分视觉和操作细节仍显粗糙,但它已不是一组静态资产,而是可实际游玩的完整 Demo。这轮测试真正考验的,是模型在跨越 Blender、文件系统和网页工程的长任务里,能否保持目标、使用工具、根据中间结果继续执行并最终交付。
据阶跃官方披露,Step 5 Preview 的 Coding 能力不局限于传统代码任务,可做复杂软件工程(含长程规划)、前端和视觉开发,也能进入可编程硬件场景;当任务持续数小时、需要不断根据结果调整时,模型也能继续推进。在内部和外部专家参与的评测中,约 70% 的评测者认为它可以自主完成中高复杂度的 Coding 任务。此外,在 Agents' Last Exam 的 CLI 子集 ALE-CLI、金融投资研究评测 FrontierFinance 以及跨领域深度研究评测 DRACO 上,该模型仅次于 GPT-6 Astra 或 Claude Opus 5,领先其他参评开源模型。
从 AA 榜单模型页看,Step 5 Preview 输出速度为 99.8 tokens/s,单个 Intelligence Index 任务成本为 0.71 美元;输入价格 1.00 美元/百万 token,输出价格 2.70 美元/百万 token,缓存折扣 95%。页面还显示其支持文本和图像输入、文本输出,上下文窗口为 1M token,参数规模 600B。这是一套「智能、速度、成本、上下文窗口」的组合。
该指数覆盖知识工作、Agent 工作流、终端使用、编程、长上下文、文档推理等多类任务,对一个面向 Agentic 任务的模型来说,比单看某个问答榜单更接近真实使用场景。更关键的是任务成本:Agent 不是一次性回答问题,而是反复读上下文、调用工具、生成代码、运行测试、根据报错继续修改。任务一旦变长,token 单价和缓存策略就会直接影响用户是否愿意让模型多试几轮,这也是决定模型能否被开发者和企业用户选择、真正实现规模化商用的关键。从截图看,Step 5 Preview 凭借 0.71 美元的单任务成本在 654 个模型中位于第 4 位,相当于 Kimi K3 的 35%,把模型能力、效率与成本最优平衡的帕累托前沿向外推进。
Step 5 Preview 进入 AA 榜单全球前沿梯队,是重新衡量阶跃的标志性节点。它正把前沿基座模型、全模态模型矩阵和终端量产能力拧成一股绳。过去一个季度,阶跃先后发布 Step Edge、StepAudio 3 系列,再到 Step 5 Preview,模型矩阵已覆盖从云端旗舰、Flash 高效模型、端侧模型,到语音、视觉、生成、GUI 等专项能力的完整全模态矩阵。据官方信息,StepAudio 3 Realtime 在 Artificial Analysis Conversational Dynamics 榜单中以 98.9% 位列第一,Speech Reasoning 准确率为 99.7%;StepAudio 3 ASR 在非流式语音识别准确性榜单中词错误率为 1.7%,并列第一。
终端侧,据官方公开数据,阶跃模型已进入手机、汽车等真实设备场景量产落地;截至 2025 年底,其手机侧模型装机量超过 4200 万台,日均服务近 2000 万人次,并覆盖国内超 50% 头部手机品牌。与纯 API 模型公司相比,终端入口的价值在于高频、真实、复杂:低延迟、低算力、噪声环境、隐私约束和用户习惯,都会持续反向检验模型。
从行业格局看,基模公司的竞争已不再只是单一模型能力比拼,而是全栈技术能力与商业化落地的系统较量。DeepSeek 的优势在全球开发者影响力,阿里千问背靠云和生态,智谱深耕企业交付,Kimi 更有 C 端产品心智,而阶跃的独特位置是「AI+终端」:前沿模型负责复杂推理,全模态模型负责感知和表达,端侧模型负责低延迟和高频入口。这条路线并不轻松——终端生态里有手机厂商、车企、操作系统和应用权限;Agent 真正落地还要解决安全、隐私、跨应用执行和用户信任。Step 5 Preview 让阶跃重新进入第一梯队前沿模型的竞技场,结合已有的全模态矩阵与终端量产能力,将其送上国产 AI 牌桌的中心。大模型市场终局未定,头部厂商的领先优势不会一成不变,模型能力、成本结构、终端入口和工作台体验都可能重新洗牌;接下来真正要看的,是模型能否在更多真实工作流里把任务一次次交到终点。