是什麼
多模態(Multimodal)指模型能夠處理不止一種「模態」的資料。文本只是一種模態,影像、音訊、影片、檔案都是不同模態。多模態模型通過把不同型別的輸入編碼到同一套表示空間,讓模型可以「看圖說話」、根據截圖回答問題、或為圖片生成描述。今天主流的旗艦大模型大多已是原生多模態模型,文本與影像是標配。
為什麼重要
現實世界的資訊天然是多模態的——一份合同裡有文字也有表格圖,一次客服對話可能附帶照片。能同時理解圖文的模型,把 AI 的可用場景從「純文字問答」擴充套件到文件處理、介面理解、視覺檢索、輔助創作等大量真實任務,是 AI 從「聊天」走向「幹活」的關鍵能力之一。
在 AI 產業鏈中的位置
多模態是模型層的能力升級,它對基礎設施層提出更高要求——影像、影片比文本佔用更多 token 與視訊記憶體,推理成本更高。向上,它極大拓寬了應用層的邊界,讓文件解析、視覺問答、設計輔助等圖文結合的產品成為可能。
2026 年的最新進展
2026 年多模態從旗艦賣點下沉成了整條產品線的底座。2026 年 2 月 19 日 Google 釋出 Gemini 3.1 Pro,可在同一模型裡處理文本、音訊、影像、影片乃至整個程式碼庫,該系列輸入上下文上限 100 萬 token、輸出 6.4 萬 token。此後迭代極快,從 3.5 Flash(2026 年 5 月 19 日)到 3.8 Flash(9 月 2 日)幾乎一月一版。OpenAI 同為原生多模態的 GPT-5.6 則在 2026 年 7 月 9 日公開發布,分 Luna、Terra、Sol 三檔。