讀懂AI時代 Read AI Time 讀懂AI時代 Read AI Time 简体

8 GB 檔

適合誰:只想先把 Ollama 跑起來、用 8B 模型做翻譯摘要問答,不打算碰 14B 以上的入門使用者。

顯示卡 / 裝置廠商參考價(元)備註
GeForce RTX 5060 8GBNVIDIA約 2,400~3,000指導價 2,499 元。2026 年視訊記憶體漲價週期內實際成交普遍高於指導價,別按指導價做預算。
GeForce RTX 5060 Ti 8GBNVIDIA約 2,900~3,600指導價 3,199 元。和 16GB 版遊戲效能幾乎一樣、差別全在視訊記憶體——衝著跑模型買就別選這個 8GB 版。
GeForce RTX 5060 Laptop GPU 8GBNVIDIA2026 年主流遊戲本的標配獨顯,隨整機賣、無單卡價格。筆記本散熱受限,長對話會掉速。

✅ 能跑(估算視訊記憶體)

  • qwen3:8b(估算 7.7 GB)
  • deepseek-r1:8b(估算 7.7 GB)
  • deepseek-r1:7b(估算 7.1 GB)
  • llama3.1:8b(估算 7.4 GB)
  • qwen3.5:4b(估算 5.6 GB)
  • gemma3:4b(估算 5.5 GB)
  • qwen3:4b(估算 4.5 GB)
  • llama3.2:3b(估算 3.9 GB)
  • bge-m3:567m、nomic-embed-text(向量模型,估算 2.9 / 1.9 GB)

⛔ 跑不了 / 會掉速

  • 14B 級(deepseek-r1:14b 估算 12.3 GB、qwen3:14b 12.7 GB、phi4:14b 12.4 GB)裝不下,會溢位到記憶體、速度從幾十 token/s 掉到個位數
  • qwen3.5:9b(估算 9.4 GB)、qwen3-vl:8b(估算 8.8 GB)也超了——同是「8B 級」,多模態和新架構的包更大
  • 8B 模型雖能裝下,但把上下文從預設拉到幾萬 token 後 KV 快取會頂爆 8 GB

12 GB 檔

適合誰:預算卡在五六千、以遊戲為主兼顧跑模型的人。想跑 14B 的話這一檔是「差一點」,直接上 16 GB 更省心。

顯示卡 / 裝置廠商參考價(元)備註
GeForce RTX 5070 12GBNVIDIA約 5,100~6,3002026-09 大陸渠道普遍高於 6,000 元,搶到原價屬運氣。
Intel 銳炫 Arc B580 12GBIntel約 2,000~2,600公版國行首發 2,049 元,是最便宜的 12GB 新卡。Ollama 在 Windows/Linux 上通過 Vulkan 後端支援 Intel 顯示卡,但成熟度與生態遠不如 CUDA,遇到問題能搜到的答案少。
GeForce RTX 3060 12GB(二手)NVIDIA上一代的經典入門 AI 卡,12GB 視訊記憶體配 192-bit 頻寬,跑 8B 夠用。二手價 2026 年隨大盤上漲、無穩定行情,且無保修。

✅ 能跑(估算視訊記憶體)

  • qwen3.5:9b(估算 9.4 GB)
  • qwen3-vl:8b(估算 8.8 GB,看圖/文件識別)
  • gemma3:12b(估算 11.2 GB)
  • gemma4:12b(估算 10.6 GB)
  • gemma4:e2b(估算 10.1 GB)
  • 8 GB 檔能跑的全部模型,且上下文可以開得更長

⛔ 跑不了 / 會掉速

  • 14B 級仍然差一口氣:deepseek-r1:14b 估算 12.3 GB、phi4:14b 12.4 GB、qwen3:14b 12.7 GB、gemma4:e4b 13.0 GB,全部略超 12 GB
  • 27B/30B 級(估算 21.9~24.3 GB)完全裝不下

16 GB 檔

適合誰:認真要把本地模型用起來的人。16 GB 是「能穩跑 14B」的最低門檻,也是消費卡里價效比最好的一檔。

顯示卡 / 裝置廠商參考價(元)備註
GeForce RTX 5060 Ti 16GBNVIDIA約 3,600~5,100指導價 3,599 元,單位視訊記憶體最便宜的新卡,也因此被 AI 需求推高——2026-08 有非公型號一度報到 5,999 元。跑模型的首選甜點位。
GeForce RTX 5070 Ti 16GBNVIDIA約 6,800~8,500指導價 6,299 元。視訊記憶體和 5060 Ti 16GB 一樣,多花的錢買的是頻寬和算力(出字更快),不是能跑更大的模型。
GeForce RTX 5080 16GBNVIDIA約 10,000~13,000指導價 8,299 元,2026-07 渠道起售價已到 12,000 元、溢價超 40%。視訊記憶體容量仍是 16GB——只為跑模型買它不划算。
Radeon RX 9060 XT 16GBAMD同價位少見的 16GB A 卡,但 Ollama 官方 Windows 下的 ROCm 支援列表以 RX 7000 系(7900/7800/7700/7600)與 PRO W 係為主,RDNA4 新卡上手前務必先確認後端可用;Linux + ROCm v7 覆蓋更廣。

✅ 能跑(估算視訊記憶體)

  • deepseek-r1:14b(估算 12.3 GB)
  • qwen3:14b(估算 12.7 GB)
  • phi4:14b(估算 12.4 GB)
  • gemma4:e4b(估算 13.0 GB)
  • 12 GB 檔能跑的全部模型,且 8B 模型可以開很長的上下文

⛔ 跑不了 / 會掉速

  • gpt-oss:20b(估算 18.3 GB)超了約 2 GB
  • 27B 級(gemma3:27b、qwen3.5:27b 估算均 21.9 GB)和 30B 級 MoE(估算 24.3 GB)都裝不下

24 GB 檔

適合誰:要跑 27B 級、或者想讓 14B 模型帶超長上下文的人。新卡這一檔在大陸已被政策堵死,現實選擇基本是二手 3090。

顯示卡 / 裝置廠商參考價(元)備註
GeForce RTX 3090 24GB(二手)NVIDIA約 6,000~8,000本地跑模型最經典的二手卡:24GB 視訊記憶體+936 GB/s 頻寬,單位視訊記憶體成本遠低於新卡。代價是 350W 功耗、無保修、礦卡風險。
GeForce RTX 4090 24GB(二手)NVIDIA約 18,000~26,0002026 年因 AI 需求二手價反超首發價,海外二手報價已到 2,500~3,700 美元。效能強,但按「每 GB 視訊記憶體多少錢」算極不划算。
GeForce RTX 5090 D v2 24GBNVIDIA中國特供型號,指導價 16,499 元、24GB GDDR7、1,344 GB/s。但 2026-05 起大陸海關不再放行該卡進口,市面只剩存量與非正規渠道貨,沒有穩定行情,故價格記 null。
RTX PRO 4000 Blackwell 24GBNVIDIA工作站卡,24GB GDDR7、單槽低功耗,適合塞進小機箱長期掛著。海外參考價約 2,000 美元,大陸渠道價未核到。

✅ 能跑(估算視訊記憶體)

  • gpt-oss:20b(估算 18.3 GB)
  • qwen3.5:27b(估算 21.9 GB)
  • gemma3:27b(估算 21.9 GB)
  • qwen3.6:27b、qwen3.6:27b-coding(估算均 23.1 GB)
  • 16 GB 檔能跑的全部模型,14B 可以開長上下文

⛔ 跑不了 / 會掉速

  • 30B 級 MoE 卡在線上:qwen3:30b、qwen3-coder:30b、glm-4.7-flash:latest、gemma4:26b 估算均 24.3 GB,差 0.3 GB——必須壓短上下文才勉強全塞進視訊記憶體,穩妥做法是上 32 GB
  • 32B 級(deepseek-r1:32b、qwen3:32b 估算 25.5 GB)裝不下
  • 70B 級(估算 53.1 GB)想都別想,得雙卡或走統一記憶體

32 GB 檔

適合誰:要跑 32B/35B 級模型、或者拿本地模型當主力生產力工具的人。大陸能走正規渠道買到 32GB 單卡的選項很少,雙 16GB 反而更現實。

顯示卡 / 裝置廠商參考價(元)備註
RTX 5060 Ti 16GB ×2(雙卡)NVIDIA約 7,200~10,200Ollama 支援把一個模型拆到多張卡上跑,兩張 16GB 甜點卡是這一檔最省錢的路線。前提:主機板有兩條 ×8 以上插槽、機箱放得下、電源 750W 以上;多卡通訊走 PCIe,出字速度不如單張大視訊記憶體卡。
GeForce RTX 5090 32GB(非國行)NVIDIA32GB GDDR7 的完整版從未在大陸正式引進(國行只有被削到 24GB 的 D v2,且已被擋在海關外)。2026-09 海外均價已到 4,600~5,700 美元,國內只有非正規渠道,無行情可寫。
RTX PRO 4500 Blackwell 32GBNVIDIA工作站卡,32GB 視訊記憶體、165W、單槽,是「正經渠道能買到 32GB」的少數選項。海外參考價約 3,300 美元,大陸渠道價未核到。

✅ 能跑(估算視訊記憶體)

  • qwen3:30b、qwen3-coder:30b(MoE,估算均 24.3 GB)
  • glm-4.7-flash:latest(估算 24.3 GB)
  • gemma4:26b(估算 24.3 GB)、gemma4:31b(估算 25.5 GB)
  • deepseek-r1:32b、qwen3:32b(估算均 25.5 GB)
  • qwen3-vl:30b(估算 25.5 GB)、qwen3-vl:32b(估算 26.7 GB)
  • qwen3.6:35b(MoE,估算 29.1 GB)、qwen3.5:35b(MoE,估算 30.3 GB)

⛔ 跑不了 / 會掉速

  • glm-4.7-flash:q8_0(估算 39.9 GB)這類高精度量化版裝不下
  • 70B 級(deepseek-r1:70b、llama3.1:70b 估算均 53.1 GB)裝不下
  • gpt-oss:120b(估算 79.5 GB)、qwen3.5:122b(估算 98.7 GB)裝不下

統一記憶體(Mac M 系列)

適合誰:要跑 30B 以上、又不想折騰多卡和電源的人;以及本來就用 Mac 辦公的人。買大記憶體比買顯示卡省心,代價是同容量下更貴、出字更慢。

顯示卡 / 裝置廠商參考價(元)備註
Mac mini(M6,最高 32GB 統一記憶體)Apple6,999 元起12 核 CPU+12 核 GPU,記憶體可選 16/24/32GB。最便宜的「能跑 27B 級」的整機路線,功耗只有幾十瓦。
Mac mini(M5 Pro,最高 64GB 統一記憶體)Apple12,999 元起起售配置為 15 核 CPU+16 核 GPU/24GB;頂配 18 核 CPU+20 核 GPU/64GB。想在 Mac 上碰 70B 級模型的起步機型。
MacBook Pro 14/16 英寸(M5 Pro,48/64GB)Apple22,999 元起(14 英寸 48GB/1TB)16 英寸同配 24,999 元起;64GB/1TB 為 24,499(14 英寸)/26,499 元(16 英寸)。筆記本形態裡少見的大記憶體。
MacBook Pro 16 英寸(M5 Max,128GB)Apple37,499 元(128GB/2TB)M5 Max 統一記憶體最高 128GB、頻寬 614 GB/s。這是移動形態能拿到的最大「視訊記憶體」。
Mac Studio(M5 Max/M5 Ultra,最高 512GB)AppleM5 Ultra 起步 96GB、頻寬 1.2 TB/s,可選到 512GB(512GB 配置 2026-10 下旬才供貨)。海外起售 5,499 美元,大陸定價未核到。

✅ 能跑(估算視訊記憶體)

  • 16GB 機型:系統預設只把約三分之二的統一記憶體讓給 GPU,實際可用約 10~11 GB,對應 qwen3:8b(估算 7.7 GB)、gemma4:12b(估算 10.6 GB)
  • 32GB 機型:可用約 24 GB,對應 qwen3.5:27b、gemma3:27b(估算均 21.9 GB)、qwen3.6:27b(估算 23.1 GB)
  • 64GB 機型:可用約 48 GB,對應 qwen3:32b、deepseek-r1:32b(估算 25.5 GB)、qwen3.5:35b(估算 30.3 GB)、glm-4.7-flash:q8_0(估算 39.9 GB)
  • 128GB 機型:可用約 96 GB,對應 deepseek-r1:70b、llama3.1:70b(估算均 53.1 GB)、gpt-oss:120b(估算 79.5 GB)
  • 256GB 以上(Mac Studio M5 Ultra):可用約 192 GB 起,對應 qwen3:235b(MoE,估算 171.9 GB)

⛔ 跑不了 / 會掉速

  • macOS 預設不允許 GPU 吃掉全部統一記憶體(普遍是 65%~75%),標稱容量不等於可用「視訊記憶體」,卡線的模型要手動調高上限才裝得下——64GB 跑 70B(估算 53.1 GB)、128GB 跑 qwen3.5:122b(估算 98.7 GB)都屬於這種情況
  • 統一記憶體頻寬比獨顯視訊記憶體低一截(M5 Max 614 GB/s vs RTX 5090 D v2 的 1,344 GB/s),同樣的模型,Mac 能裝下但出字更慢
  • deepseek-r1:671b(估算 486.3 GB)即使 512GB 的 Mac Studio 也塞不進可用記憶體

國產卡與國產 AI 裝置

適合誰:有國產化要求、或者想用更低的每 GB 成本換視訊記憶體的人。圖省事、只想「裝完就能跑」的,還是 NVIDIA 卡或 Mac 更順。

顯示卡 / 裝置廠商參考價(元)備註
摩爾線程 MTT S80 16GB摩爾線程約 1,200~3,000官方指導價 2,999 元、促銷曾到 1,199 元。16GB GDDR6、448 GB/s、PCIe 5.0 ×16、255W。廠商官方部落格發過「在 MTT S80 上用 Ollama 跑 DeepSeek-R1 蒸餾版」的教程,走自研 MUSA 棧(不是 CUDA),S80/S3000/S4000 也支援 llama.cpp。
摩爾線程 MTT AICUBE 家庭 AI 中樞摩爾線程9,999 元(16GB)/10,999 元(32GB)自研「長江」SoC,CPU+GPU+雙核 NPU 異構算力 50 TOPS,LPDDR5X 16/32GB、內建 1TB SSD、雙 M.2 插槽。官方稱可在本地執行 30B 引數大模型,系統為自研 MTT AIOS、內建智慧體「小麥」。不是顯示卡,是整機。
礪算 LX 7G100 12GB礪算科技2,688 元(零售版)/3,299 元(創始版)國內首款全自研架構(TrueGPU 天圖)消費級顯示卡,6nm、12GB GDDR6。官方宣傳支援本地大模型與 Agent 應用,但未查到官方對 Ollama 的支援說明,上手前建議先確認後端。
華為 Atlas 300I Duo 96GB華為昇騰 310P ×2、96GB LPDDR4X、頻寬 408 GB/s、150W,靠大容量而非高頻寬取勝。走 CANN+MindIE 棧,不是 CUDA,Ollama 不原生支援,llama.cpp 也無官方昇騰後端,屬於「願意折騰生態換容量」的方案。

✅ 能跑(估算視訊記憶體)

  • MTT S80(16GB):對標 16 GB 檔,可跑 deepseek-r1:14b(估算 12.3 GB)、qwen3:14b(估算 12.7 GB)、qwen3:8b(估算 7.7 GB)
  • 礪算 LX 7G100(12GB):對標 12 GB 檔,可跑 qwen3.5:9b(估算 9.4 GB)、gemma3:12b(估算 11.2 GB)
  • MTT AICUBE(32GB):廠商稱可本地跑 30B 級模型,對應 qwen3:30b、qwen3-coder:30b(估算均 24.3 GB)
  • Atlas 300I Duo(96GB):容量上夠放 gpt-oss:120b(估算 79.5 GB),但受限於軟體棧與頻寬,實際能不能跑、跑多快要看 CANN 生態

⛔ 跑不了 / 會掉速

  • 國產卡的通用短板是軟體生態:CUDA 之外的後端遇到問題能搜到的解決方案少,新模型適配也慢半拍
  • 昇騰這類 NPU 路線跑不了標準 Ollama,得換整套推理框架(MindIE),對個人使用者門檻偏高
  • 有實測反饋 Atlas 300I Duo 單路大模型推理速度只有 RTX 3090 的三分之一左右——買它是買容量,不是買速度

常見問題

視訊記憶體不夠會怎樣?有什麼辦法救?
Ollama 裝不下時會把放不下的層挪到記憶體、交給 CPU 算,模型仍然能跑,但速度會從每秒幾十個字掉到個位數,長回答會等到人急。四條救法,按推薦順序:① 換更小的尺寸標籤(14b 換 8b);② 換更激進的量化(同一模型的 q4 包比 q8 小一半以上);③ 把上下文長度調小——KV 快取吃的視訊記憶體和上下文長度成正比,這一條最常被忽略;④ 加記憶體(不是視訊記憶體)讓溢位部分跑得沒那麼慘,屬於兜底而非解決。
量化是什麼?為什麼同一個模型有好幾個包?
量化就是把模型權重的精度降下來:原始權重多是 16 位浮點,壓到 8 位、4 位後體積成倍縮小,視訊記憶體需求跟著降,代價是回答質量有損耗。Ollama 預設拉的基本都是 4 位量化(q4_K_M 一類),這是體積與質量的通行折中。以 GLM-4.7-Flash 為例,同一個 30B 級模型,q4 包 19 GB(本站估算需 24.3 GB 視訊記憶體)、q8 包 32 GB(估算 39.9 GB)、bf16 包 60 GB(估算 73.5 GB)——差三倍多。一般用途選預設的 4 位版本就夠,追求還原度再上 q8。
兩張小視訊記憶體卡能不能頂一張大視訊記憶體卡?
能裝下,但不等於一樣好用。Ollama 支援把一個模型拆到多張卡上跑,兩張 16GB 確實能裝下單張 16GB 裝不下的 32B 模型,而且往往比買一張 32GB 的卡便宜得多。代價有三個:卡間通訊走 PCIe,比單卡內部訪問慢,出字速度打折;要主機板有兩條 ×8 以上插槽、機箱放得下、電源 750W 以上;驅動和散熱的折騰量翻倍。結論:預算緊、視訊記憶體是硬瓶頸就上雙卡;圖省心就單卡大視訊記憶體。
Mac 能跑本地大模型嗎?和顯示卡比怎麼選?
能,而且在大記憶體這一段很有優勢。Mac 的統一記憶體是 CPU/GPU 共享同一塊記憶體池,GPU 可以把其中大部分當視訊記憶體用,所以一台 128GB 的 MacBook Pro 能裝下 70B 級模型,而消費級顯示卡最大也就 32GB。兩個必須知道的前提:① macOS 預設只讓 GPU 用掉約三分之二到四分之三的統一記憶體,標稱容量不等於可用「視訊記憶體」;② 統一記憶體頻寬低於獨顯視訊記憶體(M5 Max 614 GB/s,對比 RTX 5090 D v2 的 1,344 GB/s),Mac 裝得下但出字更慢。一句話:跑 30B 以內看顯示卡,跑 70B 以上看 Mac。
國產顯示卡能跑 Ollama 嗎?
分兩類,結論不一樣。摩爾線程走的是自研 MUSA 棧,官方部落格給過在 MTT S80 上用 Ollama 跑 DeepSeek-R1 蒸餾版的完整教程,S80/S3000/S4000 也支援 llama.cpp,屬於「能跑,但要按廠商文件來」。華為昇騰(Atlas 300I Duo 等)走的是 CANN+MindIE,Ollama 和 llama.cpp 都沒有官方昇騰後端,等於要換整套推理框架,個人使用者門檻明顯更高。礪算 LX 7G100 官方宣傳支援本地大模型應用,但沒有查到對 Ollama 的明確支援說明,上手前請先確認。共同的短板是生態:出了問題能搜到的答案比 CUDA 少一個數量級。
AI PC 的 NPU 能給 Ollama 加速嗎?
截至 2026-09,不能。Copilot+ PC 的門檻是 NPU 40 TOPS 以上,新一代晶片普遍到 50~80 TOPS,但 Ollama 官方文件裡的加速後端只有 CUDA(N 卡)、ROCm/Vulkan(A 卡與部分 Intel 卡)、Metal(Mac)和 CPU,沒有 NPU 這一項。實際現象就是:在 AI PC 上跑 Ollama,NPU 使用率基本是零,幹活的還是 CPU 和 GPU。GitHub 上要求支援高通/Intel/AMD NPU 的 issue 掛了很久,官方沒有給時間表。社群有實驗性的 NPU 後端分支,不是官方方案。所以:為了跑 Ollama 配機器,錢該花在視訊記憶體上,不是 NPU 上。

相關新聞