马斯克旗下SpaceXAI今日宣布推出新一代语音模型Grok Voice Think Fast 2.0,这是该公司迄今能力最强的语音到语音(speech-to-speech)模型。马斯克连发两条推文,第一条宣布“Grok Voice现在在智能体性能方面排名第一”,第二条则直接喊话网友“试试新的Grok Voice”。
在权威评测机构Artificial Analysis的语音到语音指数(Speech to Speech Index)中,Grok Voice Think Fast 2.0高推理能力版本以82.9%的得分位列第二,仅次于阿里千问的Qwen Audio 3.0 Realtime Plus(84.1%);而在衡量智能体性能的Tau Voice基准测试中,该模型以56.5%的得分排名第一,击败了OpenAI、Google、阿里千问等厂商的语音模型。
更值得关注的是,该模型平均首音频响应时间仅0.70秒,是榜单前五名中唯一低于1秒的模型,较前代Grok Voice Think Fast 1.0的1.25秒大幅提升。定价方面,Grok Voice Think Fast 2.0每分钟0.08美元(约合每小时输入音频4.80美元),较前代3.00美元有所上涨,但比GPT-Realtime-2.1 High(10.75美元/小时)便宜约2.2倍。
多位开发者实测后给出好评。AI公司Helionova AI的CEO Nick White在X上分享体验称,已在旗下产品Tradecraft上完成了面向grok-voice-think-fast-2.0的全栈语音实时升级,“绝对是一次飞跃式的进步”。在实测音频中,他让模型扮演一名因维修人员爽约而愤怒投诉的客户,自己扮演客服接线员,整个过程中模型几乎没有明显停顿,能够根据对话内容持续推进情节。另一位开发者则把Think Fast 2.0集成进终端工具GrokTerm,展示其对话速度:测试者连续发出“将应用主题切换为赛博朋克风格”“切回原主题”“切到另一边屏幕”“再切回赛博朋克”等指令,模型均快速响应并完成操作。
SpaceXAI软件工程师Parker Conrad发文称:“整个语音团队为此倾注了大量的努力、思考和热爱。模型的智能水平、准确性和能力几乎让人感觉不真实。语音领域仍然充满摩擦,Think Fast 2.0向着‘开箱即用’的目标迈进了一大步。”
Grok Think Fast 2.0的升级重点集中在模型能力、响应速度与推理效率三方面。根据Artificial Analysis数据,Think Fast 2.0综合得分达到82.9%,相比上一代75.7%提升7.2个百分点。其中,在Big Bench Audio语音推理测试中获得97.2%;衡量多人实时语音交互体验的Full Duplex Bench达到95.1%,相比上一代77.8%提升明显;Tau Voice语音智能体测试则达到56.5%,成为目前该榜单第一。
除了速度,Grok Think Fast 2.0还重点优化了语音识别。在覆盖24种语言、数千条短语的测试中,Think Fast 2.0整体转写准确率相比Think Fast 1.0提升约1.4倍,相比Deepgram Nova 3和ElevenLabs Scribe v2提升约1.5至2倍。而在背景噪声较大、电话压缩等真实场景下,这一优势进一步扩大,识别误差可降低约10倍。
另一个关键变化来自推理效率。不同于许多语音模型需要先完成推理再生成语音,Think Fast系列支持一边说话一边完成推理,因此能够在保持低延迟的同时处理复杂任务。Think Fast 2.0进一步优化了推理Token利用效率,中位数推理Token消耗仅为上一代约40%,意味着工具调用通常能够在模型第一句话结束前便开始执行,从而进一步缩短整体响应时间。
对话方式也进行了调整。研发团队利用大量强化学习数据,让模型更接近真实的人类交流方式。相比此前版本,新模型会更多使用短句表达,一次只提出一个问题,并尽量避免冗长、重复的表达。从用户角度来看,整个交流过程会更加自然,即使模型背后正在完成复杂流程规划,用户也不会明显感受到等待。
过去一年,OpenAI、Google与阿里千问等厂商持续升级实时语音模型,竞争重点逐渐从语音识别、语音合成转向复杂任务处理、多轮对话以及工具调用能力。从此次发布来看,SpaceXAI延续了这一方向。一方面,Think Fast 2.0进一步提升了语音推理、实时交互和语音识别能力;另一方面,通过“边说边推理”、更低的推理Token消耗以及更快的工具调用速度,其希望让语音智能体能够真正承担客服、电话助手、销售等真实业务场景。
从Artificial Analysis最新榜单来看,Think Fast 2.0已经在语音智能体能力(Tau Voice)上取得第一,并跻身Speech-to-Speech综合榜单前列。随着8月5日默认模型完成升级,其实际表现也将在更多开发者和企业应用中接受进一步验证。