本地跑大模型,顯示卡怎麼選
按視訊記憶體檔位看:這一檔有哪些卡、能跑哪些模型、跑不了什麼、適合誰。視訊記憶體需求是本站估算 (視訊記憶體需求(估算 GB)= 模型包大小(GB)× 1.2 + 1.5),模型包大小取自 Ollama 各模型 tags 頁;實際佔用還受上下文長度與併發影響,上下文拉長會明顯超出。 價格為 2026-09 大陸電商成交區間參考、會變。反過來查「我這張卡能跑哪個」用 /ollama 的視訊記憶體對照表。
8 GB 檔
適合誰:只想先把 Ollama 跑起來、用 8B 模型做翻譯摘要問答,不打算碰 14B 以上的入門使用者。
| 顯示卡 / 裝置 | 廠商 | 參考價(元) | 備註 |
|---|---|---|---|
| GeForce RTX 5060 8GB | NVIDIA | 約 2,400~3,000 | 指導價 2,499 元。2026 年視訊記憶體漲價週期內實際成交普遍高於指導價,別按指導價做預算。 |
| GeForce RTX 5060 Ti 8GB | NVIDIA | 約 2,900~3,600 | 指導價 3,199 元。和 16GB 版遊戲效能幾乎一樣、差別全在視訊記憶體——衝著跑模型買就別選這個 8GB 版。 |
| GeForce RTX 5060 Laptop GPU 8GB | NVIDIA | — | 2026 年主流遊戲本的標配獨顯,隨整機賣、無單卡價格。筆記本散熱受限,長對話會掉速。 |
✅ 能跑(估算視訊記憶體)
- qwen3:8b(估算 7.7 GB)
- deepseek-r1:8b(估算 7.7 GB)
- deepseek-r1:7b(估算 7.1 GB)
- llama3.1:8b(估算 7.4 GB)
- qwen3.5:4b(估算 5.6 GB)
- gemma3:4b(估算 5.5 GB)
- qwen3:4b(估算 4.5 GB)
- llama3.2:3b(估算 3.9 GB)
- bge-m3:567m、nomic-embed-text(向量模型,估算 2.9 / 1.9 GB)
⛔ 跑不了 / 會掉速
- 14B 級(deepseek-r1:14b 估算 12.3 GB、qwen3:14b 12.7 GB、phi4:14b 12.4 GB)裝不下,會溢位到記憶體、速度從幾十 token/s 掉到個位數
- qwen3.5:9b(估算 9.4 GB)、qwen3-vl:8b(估算 8.8 GB)也超了——同是「8B 級」,多模態和新架構的包更大
- 8B 模型雖能裝下,但把上下文從預設拉到幾萬 token 後 KV 快取會頂爆 8 GB
12 GB 檔
適合誰:預算卡在五六千、以遊戲為主兼顧跑模型的人。想跑 14B 的話這一檔是「差一點」,直接上 16 GB 更省心。
| 顯示卡 / 裝置 | 廠商 | 參考價(元) | 備註 |
|---|---|---|---|
| GeForce RTX 5070 12GB | NVIDIA | 約 5,100~6,300 | 2026-09 大陸渠道普遍高於 6,000 元,搶到原價屬運氣。 |
| Intel 銳炫 Arc B580 12GB | Intel | 約 2,000~2,600 | 公版國行首發 2,049 元,是最便宜的 12GB 新卡。Ollama 在 Windows/Linux 上通過 Vulkan 後端支援 Intel 顯示卡,但成熟度與生態遠不如 CUDA,遇到問題能搜到的答案少。 |
| GeForce RTX 3060 12GB(二手) | NVIDIA | — | 上一代的經典入門 AI 卡,12GB 視訊記憶體配 192-bit 頻寬,跑 8B 夠用。二手價 2026 年隨大盤上漲、無穩定行情,且無保修。 |
✅ 能跑(估算視訊記憶體)
- qwen3.5:9b(估算 9.4 GB)
- qwen3-vl:8b(估算 8.8 GB,看圖/文件識別)
- gemma3:12b(估算 11.2 GB)
- gemma4:12b(估算 10.6 GB)
- gemma4:e2b(估算 10.1 GB)
- 8 GB 檔能跑的全部模型,且上下文可以開得更長
⛔ 跑不了 / 會掉速
- 14B 級仍然差一口氣:deepseek-r1:14b 估算 12.3 GB、phi4:14b 12.4 GB、qwen3:14b 12.7 GB、gemma4:e4b 13.0 GB,全部略超 12 GB
- 27B/30B 級(估算 21.9~24.3 GB)完全裝不下
16 GB 檔
適合誰:認真要把本地模型用起來的人。16 GB 是「能穩跑 14B」的最低門檻,也是消費卡里價效比最好的一檔。
| 顯示卡 / 裝置 | 廠商 | 參考價(元) | 備註 |
|---|---|---|---|
| GeForce RTX 5060 Ti 16GB | NVIDIA | 約 3,600~5,100 | 指導價 3,599 元,單位視訊記憶體最便宜的新卡,也因此被 AI 需求推高——2026-08 有非公型號一度報到 5,999 元。跑模型的首選甜點位。 |
| GeForce RTX 5070 Ti 16GB | NVIDIA | 約 6,800~8,500 | 指導價 6,299 元。視訊記憶體和 5060 Ti 16GB 一樣,多花的錢買的是頻寬和算力(出字更快),不是能跑更大的模型。 |
| GeForce RTX 5080 16GB | NVIDIA | 約 10,000~13,000 | 指導價 8,299 元,2026-07 渠道起售價已到 12,000 元、溢價超 40%。視訊記憶體容量仍是 16GB——只為跑模型買它不划算。 |
| Radeon RX 9060 XT 16GB | AMD | — | 同價位少見的 16GB A 卡,但 Ollama 官方 Windows 下的 ROCm 支援列表以 RX 7000 系(7900/7800/7700/7600)與 PRO W 係為主,RDNA4 新卡上手前務必先確認後端可用;Linux + ROCm v7 覆蓋更廣。 |
✅ 能跑(估算視訊記憶體)
- deepseek-r1:14b(估算 12.3 GB)
- qwen3:14b(估算 12.7 GB)
- phi4:14b(估算 12.4 GB)
- gemma4:e4b(估算 13.0 GB)
- 12 GB 檔能跑的全部模型,且 8B 模型可以開很長的上下文
⛔ 跑不了 / 會掉速
- gpt-oss:20b(估算 18.3 GB)超了約 2 GB
- 27B 級(gemma3:27b、qwen3.5:27b 估算均 21.9 GB)和 30B 級 MoE(估算 24.3 GB)都裝不下
24 GB 檔
適合誰:要跑 27B 級、或者想讓 14B 模型帶超長上下文的人。新卡這一檔在大陸已被政策堵死,現實選擇基本是二手 3090。
| 顯示卡 / 裝置 | 廠商 | 參考價(元) | 備註 |
|---|---|---|---|
| GeForce RTX 3090 24GB(二手) | NVIDIA | 約 6,000~8,000 | 本地跑模型最經典的二手卡:24GB 視訊記憶體+936 GB/s 頻寬,單位視訊記憶體成本遠低於新卡。代價是 350W 功耗、無保修、礦卡風險。 |
| GeForce RTX 4090 24GB(二手) | NVIDIA | 約 18,000~26,000 | 2026 年因 AI 需求二手價反超首發價,海外二手報價已到 2,500~3,700 美元。效能強,但按「每 GB 視訊記憶體多少錢」算極不划算。 |
| GeForce RTX 5090 D v2 24GB | NVIDIA | — | 中國特供型號,指導價 16,499 元、24GB GDDR7、1,344 GB/s。但 2026-05 起大陸海關不再放行該卡進口,市面只剩存量與非正規渠道貨,沒有穩定行情,故價格記 null。 |
| RTX PRO 4000 Blackwell 24GB | NVIDIA | — | 工作站卡,24GB GDDR7、單槽低功耗,適合塞進小機箱長期掛著。海外參考價約 2,000 美元,大陸渠道價未核到。 |
✅ 能跑(估算視訊記憶體)
- gpt-oss:20b(估算 18.3 GB)
- qwen3.5:27b(估算 21.9 GB)
- gemma3:27b(估算 21.9 GB)
- qwen3.6:27b、qwen3.6:27b-coding(估算均 23.1 GB)
- 16 GB 檔能跑的全部模型,14B 可以開長上下文
⛔ 跑不了 / 會掉速
- 30B 級 MoE 卡在線上:qwen3:30b、qwen3-coder:30b、glm-4.7-flash:latest、gemma4:26b 估算均 24.3 GB,差 0.3 GB——必須壓短上下文才勉強全塞進視訊記憶體,穩妥做法是上 32 GB
- 32B 級(deepseek-r1:32b、qwen3:32b 估算 25.5 GB)裝不下
- 70B 級(估算 53.1 GB)想都別想,得雙卡或走統一記憶體
32 GB 檔
適合誰:要跑 32B/35B 級模型、或者拿本地模型當主力生產力工具的人。大陸能走正規渠道買到 32GB 單卡的選項很少,雙 16GB 反而更現實。
| 顯示卡 / 裝置 | 廠商 | 參考價(元) | 備註 |
|---|---|---|---|
| RTX 5060 Ti 16GB ×2(雙卡) | NVIDIA | 約 7,200~10,200 | Ollama 支援把一個模型拆到多張卡上跑,兩張 16GB 甜點卡是這一檔最省錢的路線。前提:主機板有兩條 ×8 以上插槽、機箱放得下、電源 750W 以上;多卡通訊走 PCIe,出字速度不如單張大視訊記憶體卡。 |
| GeForce RTX 5090 32GB(非國行) | NVIDIA | — | 32GB GDDR7 的完整版從未在大陸正式引進(國行只有被削到 24GB 的 D v2,且已被擋在海關外)。2026-09 海外均價已到 4,600~5,700 美元,國內只有非正規渠道,無行情可寫。 |
| RTX PRO 4500 Blackwell 32GB | NVIDIA | — | 工作站卡,32GB 視訊記憶體、165W、單槽,是「正經渠道能買到 32GB」的少數選項。海外參考價約 3,300 美元,大陸渠道價未核到。 |
✅ 能跑(估算視訊記憶體)
- qwen3:30b、qwen3-coder:30b(MoE,估算均 24.3 GB)
- glm-4.7-flash:latest(估算 24.3 GB)
- gemma4:26b(估算 24.3 GB)、gemma4:31b(估算 25.5 GB)
- deepseek-r1:32b、qwen3:32b(估算均 25.5 GB)
- qwen3-vl:30b(估算 25.5 GB)、qwen3-vl:32b(估算 26.7 GB)
- qwen3.6:35b(MoE,估算 29.1 GB)、qwen3.5:35b(MoE,估算 30.3 GB)
⛔ 跑不了 / 會掉速
- glm-4.7-flash:q8_0(估算 39.9 GB)這類高精度量化版裝不下
- 70B 級(deepseek-r1:70b、llama3.1:70b 估算均 53.1 GB)裝不下
- gpt-oss:120b(估算 79.5 GB)、qwen3.5:122b(估算 98.7 GB)裝不下
統一記憶體(Mac M 系列)
適合誰:要跑 30B 以上、又不想折騰多卡和電源的人;以及本來就用 Mac 辦公的人。買大記憶體比買顯示卡省心,代價是同容量下更貴、出字更慢。
| 顯示卡 / 裝置 | 廠商 | 參考價(元) | 備註 |
|---|---|---|---|
| Mac mini(M6,最高 32GB 統一記憶體) | Apple | 6,999 元起 | 12 核 CPU+12 核 GPU,記憶體可選 16/24/32GB。最便宜的「能跑 27B 級」的整機路線,功耗只有幾十瓦。 |
| Mac mini(M5 Pro,最高 64GB 統一記憶體) | Apple | 12,999 元起 | 起售配置為 15 核 CPU+16 核 GPU/24GB;頂配 18 核 CPU+20 核 GPU/64GB。想在 Mac 上碰 70B 級模型的起步機型。 |
| MacBook Pro 14/16 英寸(M5 Pro,48/64GB) | Apple | 22,999 元起(14 英寸 48GB/1TB) | 16 英寸同配 24,999 元起;64GB/1TB 為 24,499(14 英寸)/26,499 元(16 英寸)。筆記本形態裡少見的大記憶體。 |
| MacBook Pro 16 英寸(M5 Max,128GB) | Apple | 37,499 元(128GB/2TB) | M5 Max 統一記憶體最高 128GB、頻寬 614 GB/s。這是移動形態能拿到的最大「視訊記憶體」。 |
| Mac Studio(M5 Max/M5 Ultra,最高 512GB) | Apple | — | M5 Ultra 起步 96GB、頻寬 1.2 TB/s,可選到 512GB(512GB 配置 2026-10 下旬才供貨)。海外起售 5,499 美元,大陸定價未核到。 |
✅ 能跑(估算視訊記憶體)
- 16GB 機型:系統預設只把約三分之二的統一記憶體讓給 GPU,實際可用約 10~11 GB,對應 qwen3:8b(估算 7.7 GB)、gemma4:12b(估算 10.6 GB)
- 32GB 機型:可用約 24 GB,對應 qwen3.5:27b、gemma3:27b(估算均 21.9 GB)、qwen3.6:27b(估算 23.1 GB)
- 64GB 機型:可用約 48 GB,對應 qwen3:32b、deepseek-r1:32b(估算 25.5 GB)、qwen3.5:35b(估算 30.3 GB)、glm-4.7-flash:q8_0(估算 39.9 GB)
- 128GB 機型:可用約 96 GB,對應 deepseek-r1:70b、llama3.1:70b(估算均 53.1 GB)、gpt-oss:120b(估算 79.5 GB)
- 256GB 以上(Mac Studio M5 Ultra):可用約 192 GB 起,對應 qwen3:235b(MoE,估算 171.9 GB)
⛔ 跑不了 / 會掉速
- macOS 預設不允許 GPU 吃掉全部統一記憶體(普遍是 65%~75%),標稱容量不等於可用「視訊記憶體」,卡線的模型要手動調高上限才裝得下——64GB 跑 70B(估算 53.1 GB)、128GB 跑 qwen3.5:122b(估算 98.7 GB)都屬於這種情況
- 統一記憶體頻寬比獨顯視訊記憶體低一截(M5 Max 614 GB/s vs RTX 5090 D v2 的 1,344 GB/s),同樣的模型,Mac 能裝下但出字更慢
- deepseek-r1:671b(估算 486.3 GB)即使 512GB 的 Mac Studio 也塞不進可用記憶體
國產卡與國產 AI 裝置
適合誰:有國產化要求、或者想用更低的每 GB 成本換視訊記憶體的人。圖省事、只想「裝完就能跑」的,還是 NVIDIA 卡或 Mac 更順。
| 顯示卡 / 裝置 | 廠商 | 參考價(元) | 備註 |
|---|---|---|---|
| 摩爾線程 MTT S80 16GB | 摩爾線程 | 約 1,200~3,000 | 官方指導價 2,999 元、促銷曾到 1,199 元。16GB GDDR6、448 GB/s、PCIe 5.0 ×16、255W。廠商官方部落格發過「在 MTT S80 上用 Ollama 跑 DeepSeek-R1 蒸餾版」的教程,走自研 MUSA 棧(不是 CUDA),S80/S3000/S4000 也支援 llama.cpp。 |
| 摩爾線程 MTT AICUBE 家庭 AI 中樞 | 摩爾線程 | 9,999 元(16GB)/10,999 元(32GB) | 自研「長江」SoC,CPU+GPU+雙核 NPU 異構算力 50 TOPS,LPDDR5X 16/32GB、內建 1TB SSD、雙 M.2 插槽。官方稱可在本地執行 30B 引數大模型,系統為自研 MTT AIOS、內建智慧體「小麥」。不是顯示卡,是整機。 |
| 礪算 LX 7G100 12GB | 礪算科技 | 2,688 元(零售版)/3,299 元(創始版) | 國內首款全自研架構(TrueGPU 天圖)消費級顯示卡,6nm、12GB GDDR6。官方宣傳支援本地大模型與 Agent 應用,但未查到官方對 Ollama 的支援說明,上手前建議先確認後端。 |
| 華為 Atlas 300I Duo 96GB | 華為 | — | 昇騰 310P ×2、96GB LPDDR4X、頻寬 408 GB/s、150W,靠大容量而非高頻寬取勝。走 CANN+MindIE 棧,不是 CUDA,Ollama 不原生支援,llama.cpp 也無官方昇騰後端,屬於「願意折騰生態換容量」的方案。 |
✅ 能跑(估算視訊記憶體)
- MTT S80(16GB):對標 16 GB 檔,可跑 deepseek-r1:14b(估算 12.3 GB)、qwen3:14b(估算 12.7 GB)、qwen3:8b(估算 7.7 GB)
- 礪算 LX 7G100(12GB):對標 12 GB 檔,可跑 qwen3.5:9b(估算 9.4 GB)、gemma3:12b(估算 11.2 GB)
- MTT AICUBE(32GB):廠商稱可本地跑 30B 級模型,對應 qwen3:30b、qwen3-coder:30b(估算均 24.3 GB)
- Atlas 300I Duo(96GB):容量上夠放 gpt-oss:120b(估算 79.5 GB),但受限於軟體棧與頻寬,實際能不能跑、跑多快要看 CANN 生態
⛔ 跑不了 / 會掉速
- 國產卡的通用短板是軟體生態:CUDA 之外的後端遇到問題能搜到的解決方案少,新模型適配也慢半拍
- 昇騰這類 NPU 路線跑不了標準 Ollama,得換整套推理框架(MindIE),對個人使用者門檻偏高
- 有實測反饋 Atlas 300I Duo 單路大模型推理速度只有 RTX 3090 的三分之一左右——買它是買容量,不是買速度
常見問題
視訊記憶體不夠會怎樣?有什麼辦法救?
Ollama 裝不下時會把放不下的層挪到記憶體、交給 CPU 算,模型仍然能跑,但速度會從每秒幾十個字掉到個位數,長回答會等到人急。四條救法,按推薦順序:① 換更小的尺寸標籤(14b 換 8b);② 換更激進的量化(同一模型的 q4 包比 q8 小一半以上);③ 把上下文長度調小——KV 快取吃的視訊記憶體和上下文長度成正比,這一條最常被忽略;④ 加記憶體(不是視訊記憶體)讓溢位部分跑得沒那麼慘,屬於兜底而非解決。
量化是什麼?為什麼同一個模型有好幾個包?
量化就是把模型權重的精度降下來:原始權重多是 16 位浮點,壓到 8 位、4 位後體積成倍縮小,視訊記憶體需求跟著降,代價是回答質量有損耗。Ollama 預設拉的基本都是 4 位量化(q4_K_M 一類),這是體積與質量的通行折中。以 GLM-4.7-Flash 為例,同一個 30B 級模型,q4 包 19 GB(本站估算需 24.3 GB 視訊記憶體)、q8 包 32 GB(估算 39.9 GB)、bf16 包 60 GB(估算 73.5 GB)——差三倍多。一般用途選預設的 4 位版本就夠,追求還原度再上 q8。
兩張小視訊記憶體卡能不能頂一張大視訊記憶體卡?
能裝下,但不等於一樣好用。Ollama 支援把一個模型拆到多張卡上跑,兩張 16GB 確實能裝下單張 16GB 裝不下的 32B 模型,而且往往比買一張 32GB 的卡便宜得多。代價有三個:卡間通訊走 PCIe,比單卡內部訪問慢,出字速度打折;要主機板有兩條 ×8 以上插槽、機箱放得下、電源 750W 以上;驅動和散熱的折騰量翻倍。結論:預算緊、視訊記憶體是硬瓶頸就上雙卡;圖省心就單卡大視訊記憶體。
Mac 能跑本地大模型嗎?和顯示卡比怎麼選?
能,而且在大記憶體這一段很有優勢。Mac 的統一記憶體是 CPU/GPU 共享同一塊記憶體池,GPU 可以把其中大部分當視訊記憶體用,所以一台 128GB 的 MacBook Pro 能裝下 70B 級模型,而消費級顯示卡最大也就 32GB。兩個必須知道的前提:① macOS 預設只讓 GPU 用掉約三分之二到四分之三的統一記憶體,標稱容量不等於可用「視訊記憶體」;② 統一記憶體頻寬低於獨顯視訊記憶體(M5 Max 614 GB/s,對比 RTX 5090 D v2 的 1,344 GB/s),Mac 裝得下但出字更慢。一句話:跑 30B 以內看顯示卡,跑 70B 以上看 Mac。
國產顯示卡能跑 Ollama 嗎?
分兩類,結論不一樣。摩爾線程走的是自研 MUSA 棧,官方部落格給過在 MTT S80 上用 Ollama 跑 DeepSeek-R1 蒸餾版的完整教程,S80/S3000/S4000 也支援 llama.cpp,屬於「能跑,但要按廠商文件來」。華為昇騰(Atlas 300I Duo 等)走的是 CANN+MindIE,Ollama 和 llama.cpp 都沒有官方昇騰後端,等於要換整套推理框架,個人使用者門檻明顯更高。礪算 LX 7G100 官方宣傳支援本地大模型應用,但沒有查到對 Ollama 的明確支援說明,上手前請先確認。共同的短板是生態:出了問題能搜到的答案比 CUDA 少一個數量級。
AI PC 的 NPU 能給 Ollama 加速嗎?
截至 2026-09,不能。Copilot+ PC 的門檻是 NPU 40 TOPS 以上,新一代晶片普遍到 50~80 TOPS,但 Ollama 官方文件裡的加速後端只有 CUDA(N 卡)、ROCm/Vulkan(A 卡與部分 Intel 卡)、Metal(Mac)和 CPU,沒有 NPU 這一項。實際現象就是:在 AI PC 上跑 Ollama,NPU 使用率基本是零,幹活的還是 CPU 和 GPU。GitHub 上要求支援高通/Intel/AMD NPU 的 issue 掛了很久,官方沒有給時間表。社群有實驗性的 NPU 後端分支,不是官方方案。所以:為了跑 Ollama 配機器,錢該花在視訊記憶體上,不是 NPU 上。
相關新聞
- 智譜釋出 GLM-OCR:0.9B 引數,OmniDocBench 得分 94.62 居首2026-09-11
- 面壁智慧釋出MiniCPM5-2B-GPTQ模型,支援長上下文與工具呼叫2026-09-07
- 科大訊飛釋出星火X2.5大模型,強化程式碼與智慧體能力2026-09-07
- 騰訊開源 Ex-Omni 11B:文本語音輸入生成 3D 面部動畫2026-09-05
- 智譜釋出GLM-5.3-Flash:320B引數原生多模態模型2026-09-04
← Ollama 本地部署與視訊記憶體對照表 · AI 眼鏡 / 手機 / PC 盤點 · 量化(為什麼 Q4 就夠用)