是什麼
AI 推理晶片(Inference Chip)是專為大模型 推理 環節最佳化的晶片。所謂推理,指模型訓練完成、上線後,對使用者的每一次提問即時生成回答的過程——與「造模型」的訓練相對,是「用模型」。推理對硬體的訴求和訓練不同:訓練追求峰值算力與視訊記憶體頻寬,推理則更看重 低時延、低成本與能效。同一塊高階 GPU 兩件事都能做,但由於推理規模會隨使用者量不斷放大,業界催生出一批專為推理最佳化的晶片與架構。
為什麼重要
隨著大模型從「訓練競賽」轉向「大規模落地」,推理的總算力需求預計將超過訓練——因為每天有海量使用者在呼叫模型服務。誰能把推理做得更便宜、更快、更省電,誰就掌握了 AI 商業化的成本命門。這也解釋了為何在輝達 GPU 主導訓練市場之外,推理側湧現出眾多挑戰者:從 AMD 的加速卡、博通與邁威爾的定製 ASIC,到 Cerebras、Groq 等主打極低時延的專用架構,再到雲廠商自研的推理晶片。推理晶片因此成為晶片層競爭格局最可能被改寫的一塊。
在 AI 產業鏈中的位置
AI 推理晶片處在 AI 產業鏈的 晶片 層,與 定製 AI 晶片 高度相關——很多推理晶片正是以 ASIC 形式為特定場景定製的。它向下消耗 能源 與製造產能,向上直接決定 模型 層對外服務的單位成本。可以說,訓練晶片決定「模型能有多強」,推理晶片決定「模型用起來有多貴」。