在2026年世界人工智慧大會(WAIC)現場,一個數字引發了廣泛討論:AI伺服器交付後,實際被有效利用的算力可能不到規格表上數字的30%。多家晶片企業不約而同地將話題從“算力有多大”轉向“算力用得好不好”,標誌著AI產業已跨過“能不能”的第一道門檻,進入追求“好用”的新階段。

產業核心矛盾正從晶片本身向上遷移。2026年,推理對算力的呼叫量已經超過訓練,這不再是預測,而是既成事實。訓練晶片追求“學得更好”,推理晶片則追求“用得更省”。曦望智慧商業產品與解決方案高階總監付慶平指出,推理排程的粒度正在從任務級細化到運算元級,越細粒度越高效,每高效一分,token成本就降一分。這意味著推理晶片的競爭已深入到模型層的排程效率,軟體層面的最佳化正成為晶片產品的核心賣點。

從影片處理視角看,推理需求的爆發更為直觀。VPU廠商判斷未來80%的影片將由AI生成,而影片生成的token消耗是文字生成的1000倍。通過將影片相關計算從GPU剝離給專用晶片,VPU+GPU協同有望將影片生成成本降低8成。後摩智慧戰略生態VP楊大衛表示:“訓練決定模型能力上限,推理決定AI能不能大範圍落地。”當推理成為產業主軸,晶片需求結構隨之改變:雲端需要規模化推理晶片,影片場景需要VPU,端側快思考需要NPU,低功耗端側推理需要存算一體架構。通用GPU不再是唯一答案,專用化正從理論討論變成商業現實

算力經濟學成為行業共識。鎔銘微電子聯合創始人兼CEO朱照遠認為,算力成本降低的根本原因是效率提升,而非單純“省”。資料中心客戶評估晶片方案時關注至少六個維度:穩定性、效能、延時、功耗、畫質和TCO。當AI從實驗室進入生產環境,評價標準不再是考試分數,而是工作結果。推理晶片通過硬體裁剪掉訓練相關冗餘功能來降低成本,體現了從通用到專用的趨勢。從CPU到GPU再到DPU、VPU,每一次專用化都對應著計算需求從通用平台剝離。現階段國產晶片選GPU路線是市場選擇,但未來各種算力晶片會向細分領域發展,在區域性形成獨角獸。

端側推理的三大剛需是隱私、成本和物理世界互動的延時,這決定了端側晶片設計邏輯與雲端不同。愛芯元智聯合創始人劉建偉指出,雲端先看體驗再降成本,端邊先看成本再提體驗。端側AI商業模式也在變化,當用戶發現訂閱費可能比硬體本身還貴時,從訂閱制轉向一次性買斷的訴求開始出現。

具身智慧被多家企業提及為下一個爆發點。WAIC現場機器人展區顯示,不同於往年表演型機器人,今年已有機器人能長時間連續完成細緻性工作,從展台秀進入工廠產線。但產業形態遠未收斂,有觀點主張廣義機器人(如掃地機、割草機),也有觀點傾向人形路線。有存算一體企業給出尖銳對比:PC離開AI還是PC,汽車離開AI還是汽車,但機器人離開AI就是一塊鐵。機器人對端側AI的剛需最為迫切,體現在隱私、Token成本和物理互動即時性三個維度,存算一體架構可將功耗能效比提升一到兩個數量級。

軟體生態成為比晶片更厚的壁壘。回到開篇提到的紙面算力與實際產出的巨大差距,根源在於模型選型、微調、知識庫建設、中底層軟體棧最佳化和機房配置等環節。交付一台AI伺服器和實施一個AI專案,就像買了一口鍋和炒出一盤菜,中間還有大量工作。晶片的生態壁壘核心不僅是技術問題,更是開發者習慣問題。存算一體等新架構面臨的核心挑戰不是晶片做不出來,而是軟體生態跟不上。有觀點指出,中底層軟體棧可以把同樣硬體的算力輸出提高2到5倍,但這次WAIC上深入討論這個方向的並不多。

當被問及國產AI晶片最需要發展的是效能還是生態時,一家推理晶片企業的回答是:兩者都不構成當前瓶頸,最缺的是產業協同。從存算一體到端側NPU,從VPU到全棧整合,不同技術路線的企業全部指向軟體生態而非硬體效能。行業人士指出,國產生態普及率已經非常高,高校直接在國產生態上教學,關鍵領域客戶選用國產生態,這種自上而下的生態建設路徑是中國獨有的優勢。更進一步的判斷是:國產AI晶片在效能和生態上都不構成當前瓶頸,差距不在“能不能”,而在“好不好”。從AI推理晶片到真正落地,需要解決方案合作、使用者場景合作、超節點網絡合作等大量產業協作。

從客戶側看,資料中心晶片從接觸到大規模上線通常需要6到24個月,測試周期長、匯入門檻高。即使晶片技術達標,商業化落地仍需要漫長驗證週期。2026年的AI晶片行業正在經歷微妙轉向:競爭的主陣地從晶圓廠和流片車間,遷移到了編譯器、工具鏈和系統排程層。當多家企業從不同技術路線出發卻不約而同指向同一道鴻溝時,這已不再是某一個人的判斷,而是一種行業集體認知。