馬斯克旗下SpaceXAI今日宣佈推出新一代語音模型Grok Voice Think Fast 2.0,這是該公司迄今能力最強的語音到語音(speech-to-speech)模型。馬斯克連發兩條推文,第一條宣佈“Grok Voice現在在智慧體效能方面排名第一”,第二條則直接喊話網友“試試新的Grok Voice”。
在權威評測機構Artificial Analysis的語音到語音指數(Speech to Speech Index)中,Grok Voice Think Fast 2.0高推理能力版本以82.9%的得分位列第二,僅次於阿里千問的Qwen Audio 3.0 Realtime Plus(84.1%);而在衡量智慧體效能的Tau Voice基準測試中,該模型以56.5%的得分排名第一,擊敗了OpenAI、Google、阿里千問等廠商的語音模型。
更值得關注的是,該模型平均首音訊響應時間僅0.70秒,是榜單前五名中唯一低於1秒的模型,較前代Grok Voice Think Fast 1.0的1.25秒大幅提升。定價方面,Grok Voice Think Fast 2.0每分鐘0.08美元(約合每小時輸入音訊4.80美元),較前代3.00美元有所上漲,但比GPT-Realtime-2.1 High(10.75美元/小時)便宜約2.2倍。
多位開發者實測後給出好評。AI公司Helionova AI的CEO Nick White在X上分享體驗稱,已在旗下產品Tradecraft上完成了面向grok-voice-think-fast-2.0的全棧語音即時升級,“絕對是一次飛躍式的進步”。在實測音訊中,他讓模型扮演一名因維修人員爽約而憤怒投訴的客戶,自己扮演客服接線員,整個過程中模型幾乎沒有明顯停頓,能夠根據對話內容持續推進情節。另一位開發者則把Think Fast 2.0整合進終端工具GrokTerm,展示其對話速度:測試者連續發出“將應用主題切換為賽博朋克風格”“切回原主題”“切到另一邊螢幕”“再切回賽博朋克”等指令,模型均快速響應並完成操作。
SpaceXAI軟體工程師Parker Conrad發文稱:“整個語音團隊為此傾注了大量的努力、思考和熱愛。模型的智慧水平、準確性和能力幾乎讓人感覺不真實。語音領域仍然充滿摩擦,Think Fast 2.0向著‘開箱即用’的目標邁進了一大步。”
Grok Think Fast 2.0的升級重點集中在模型能力、響應速度與推理效率三方面。根據Artificial Analysis資料,Think Fast 2.0綜合得分達到82.9%,相比上一代75.7%提升7.2個百分點。其中,在Big Bench Audio語音推理測試中獲得97.2%;衡量多人即時語音互動體驗的Full Duplex Bench達到95.1%,相比上一代77.8%提升明顯;Tau Voice語音智慧體測試則達到56.5%,成為目前該榜單第一。
除了速度,Grok Think Fast 2.0還重點優化了語音識別。在覆蓋24種語言、數千條短語的測試中,Think Fast 2.0整體轉寫準確率相比Think Fast 1.0提升約1.4倍,相比Deepgram Nova 3和ElevenLabs Scribe v2提升約1.5至2倍。而在背景噪聲較大、電話壓縮等真實場景下,這一優勢進一步擴大,識別誤差可降低約10倍。
另一個關鍵變化來自推理效率。不同於許多語音模型需要先完成推理再生成語音,Think Fast系列支援一邊說話一邊完成推理,因此能夠在保持低延遲的同時處理複雜任務。Think Fast 2.0進一步優化了推理Token利用效率,中位數推理Token消耗僅為上一代約40%,意味著工具呼叫通常能夠在模型第一句話結束前便開始執行,從而進一步縮短整體響應時間。
對話方式也進行了調整。研發團隊利用大量強化學習資料,讓模型更接近真實的人類交流方式。相比此前版本,新模型會更多使用短句表達,一次只提出一個問題,並儘量避免冗長、重複的表達。從使用者角度來看,整個交流過程會更加自然,即使模型背後正在完成複雜流程規劃,使用者也不會明顯感受到等待。
過去一年,OpenAI、Google與阿里千問等廠商持續升級即時語音模型,競爭重點逐漸從語音識別、語音合成轉向複雜任務處理、多輪對話以及工具呼叫能力。從此次釋出來看,SpaceXAI延續了這一方向。一方面,Think Fast 2.0進一步提升了語音推理、即時互動和語音識別能力;另一方面,通過“邊說邊推理”、更低的推理Token消耗以及更快的工具呼叫速度,其希望讓語音智慧體能夠真正承擔客服、電話助手、銷售等真實業務場景。
從Artificial Analysis最新榜單來看,Think Fast 2.0已經在語音智慧體能力(Tau Voice)上取得第一,並躋身Speech-to-Speech綜合榜單前列。隨著8月5日預設模型完成升級,其實際表現也將在更多開發者和企業應用中接受進一步驗證。