读懂AI时代 Read AI Time 读懂AI时代 Read AI Time 繁體

8 GB 档

适合谁:只想先把 Ollama 跑起来、用 8B 模型做翻译摘要问答,不打算碰 14B 以上的入门用户。

显卡 / 设备厂商参考价(元)备注
GeForce RTX 5060 8GBNVIDIA约 2,400~3,000指导价 2,499 元。2026 年显存涨价周期内实际成交普遍高于指导价,别按指导价做预算。
GeForce RTX 5060 Ti 8GBNVIDIA约 2,900~3,600指导价 3,199 元。和 16GB 版游戏性能几乎一样、差别全在显存——冲着跑模型买就别选这个 8GB 版。
GeForce RTX 5060 Laptop GPU 8GBNVIDIA2026 年主流游戏本的标配独显,随整机卖、无单卡价格。笔记本散热受限,长对话会掉速。

✅ 能跑(估算显存)

  • qwen3:8b(估算 7.7 GB)
  • deepseek-r1:8b(估算 7.7 GB)
  • deepseek-r1:7b(估算 7.1 GB)
  • llama3.1:8b(估算 7.4 GB)
  • qwen3.5:4b(估算 5.6 GB)
  • gemma3:4b(估算 5.5 GB)
  • qwen3:4b(估算 4.5 GB)
  • llama3.2:3b(估算 3.9 GB)
  • bge-m3:567m、nomic-embed-text(向量模型,估算 2.9 / 1.9 GB)

⛔ 跑不了 / 会掉速

  • 14B 级(deepseek-r1:14b 估算 12.3 GB、qwen3:14b 12.7 GB、phi4:14b 12.4 GB)装不下,会溢出到内存、速度从几十 token/s 掉到个位数
  • qwen3.5:9b(估算 9.4 GB)、qwen3-vl:8b(估算 8.8 GB)也超了——同是「8B 级」,多模态和新架构的包更大
  • 8B 模型虽能装下,但把上下文从默认拉到几万 token 后 KV 缓存会顶爆 8 GB

12 GB 档

适合谁:预算卡在五六千、以游戏为主兼顾跑模型的人。想跑 14B 的话这一档是「差一点」,直接上 16 GB 更省心。

显卡 / 设备厂商参考价(元)备注
GeForce RTX 5070 12GBNVIDIA约 5,100~6,3002026-09 大陆渠道普遍高于 6,000 元,抢到原价属运气。
Intel 锐炫 Arc B580 12GBIntel约 2,000~2,600公版国行首发 2,049 元,是最便宜的 12GB 新卡。Ollama 在 Windows/Linux 上通过 Vulkan 后端支持 Intel 显卡,但成熟度与生态远不如 CUDA,遇到问题能搜到的答案少。
GeForce RTX 3060 12GB(二手)NVIDIA上一代的经典入门 AI 卡,12GB 显存配 192-bit 带宽,跑 8B 够用。二手价 2026 年随大盘上涨、无稳定行情,且无保修。

✅ 能跑(估算显存)

  • qwen3.5:9b(估算 9.4 GB)
  • qwen3-vl:8b(估算 8.8 GB,看图/文档识别)
  • gemma3:12b(估算 11.2 GB)
  • gemma4:12b(估算 10.6 GB)
  • gemma4:e2b(估算 10.1 GB)
  • 8 GB 档能跑的全部模型,且上下文可以开得更长

⛔ 跑不了 / 会掉速

  • 14B 级仍然差一口气:deepseek-r1:14b 估算 12.3 GB、phi4:14b 12.4 GB、qwen3:14b 12.7 GB、gemma4:e4b 13.0 GB,全部略超 12 GB
  • 27B/30B 级(估算 21.9~24.3 GB)完全装不下

16 GB 档

适合谁:认真要把本地模型用起来的人。16 GB 是「能稳跑 14B」的最低门槛,也是消费卡里性价比最好的一档。

显卡 / 设备厂商参考价(元)备注
GeForce RTX 5060 Ti 16GBNVIDIA约 3,600~5,100指导价 3,599 元,单位显存最便宜的新卡,也因此被 AI 需求推高——2026-08 有非公型号一度报到 5,999 元。跑模型的首选甜点位。
GeForce RTX 5070 Ti 16GBNVIDIA约 6,800~8,500指导价 6,299 元。显存和 5060 Ti 16GB 一样,多花的钱买的是带宽和算力(出字更快),不是能跑更大的模型。
GeForce RTX 5080 16GBNVIDIA约 10,000~13,000指导价 8,299 元,2026-07 渠道起售价已到 12,000 元、溢价超 40%。显存容量仍是 16GB——只为跑模型买它不划算。
Radeon RX 9060 XT 16GBAMD同价位少见的 16GB A 卡,但 Ollama 官方 Windows 下的 ROCm 支持列表以 RX 7000 系(7900/7800/7700/7600)与 PRO W 系为主,RDNA4 新卡上手前务必先确认后端可用;Linux + ROCm v7 覆盖更广。

✅ 能跑(估算显存)

  • deepseek-r1:14b(估算 12.3 GB)
  • qwen3:14b(估算 12.7 GB)
  • phi4:14b(估算 12.4 GB)
  • gemma4:e4b(估算 13.0 GB)
  • 12 GB 档能跑的全部模型,且 8B 模型可以开很长的上下文

⛔ 跑不了 / 会掉速

  • gpt-oss:20b(估算 18.3 GB)超了约 2 GB
  • 27B 级(gemma3:27b、qwen3.5:27b 估算均 21.9 GB)和 30B 级 MoE(估算 24.3 GB)都装不下

24 GB 档

适合谁:要跑 27B 级、或者想让 14B 模型带超长上下文的人。新卡这一档在大陆已被政策堵死,现实选择基本是二手 3090。

显卡 / 设备厂商参考价(元)备注
GeForce RTX 3090 24GB(二手)NVIDIA约 6,000~8,000本地跑模型最经典的二手卡:24GB 显存+936 GB/s 带宽,单位显存成本远低于新卡。代价是 350W 功耗、无保修、矿卡风险。
GeForce RTX 4090 24GB(二手)NVIDIA约 18,000~26,0002026 年因 AI 需求二手价反超首发价,海外二手报价已到 2,500~3,700 美元。性能强,但按「每 GB 显存多少钱」算极不划算。
GeForce RTX 5090 D v2 24GBNVIDIA中国特供型号,指导价 16,499 元、24GB GDDR7、1,344 GB/s。但 2026-05 起大陆海关不再放行该卡进口,市面只剩存量与非正规渠道货,没有稳定行情,故价格记 null。
RTX PRO 4000 Blackwell 24GBNVIDIA工作站卡,24GB GDDR7、单槽低功耗,适合塞进小机箱长期挂着。海外参考价约 2,000 美元,大陆渠道价未核到。

✅ 能跑(估算显存)

  • gpt-oss:20b(估算 18.3 GB)
  • qwen3.5:27b(估算 21.9 GB)
  • gemma3:27b(估算 21.9 GB)
  • qwen3.6:27b、qwen3.6:27b-coding(估算均 23.1 GB)
  • 16 GB 档能跑的全部模型,14B 可以开长上下文

⛔ 跑不了 / 会掉速

  • 30B 级 MoE 卡在线上:qwen3:30b、qwen3-coder:30b、glm-4.7-flash:latest、gemma4:26b 估算均 24.3 GB,差 0.3 GB——必须压短上下文才勉强全塞进显存,稳妥做法是上 32 GB
  • 32B 级(deepseek-r1:32b、qwen3:32b 估算 25.5 GB)装不下
  • 70B 级(估算 53.1 GB)想都别想,得双卡或走统一内存

32 GB 档

适合谁:要跑 32B/35B 级模型、或者拿本地模型当主力生产力工具的人。大陆能走正规渠道买到 32GB 单卡的选项很少,双 16GB 反而更现实。

显卡 / 设备厂商参考价(元)备注
RTX 5060 Ti 16GB ×2(双卡)NVIDIA约 7,200~10,200Ollama 支持把一个模型拆到多张卡上跑,两张 16GB 甜点卡是这一档最省钱的路线。前提:主板有两条 ×8 以上插槽、机箱放得下、电源 750W 以上;多卡通信走 PCIe,出字速度不如单张大显存卡。
GeForce RTX 5090 32GB(非国行)NVIDIA32GB GDDR7 的完整版从未在大陆正式引进(国行只有被削到 24GB 的 D v2,且已被挡在海关外)。2026-09 海外均价已到 4,600~5,700 美元,国内只有非正规渠道,无行情可写。
RTX PRO 4500 Blackwell 32GBNVIDIA工作站卡,32GB 显存、165W、单槽,是「正经渠道能买到 32GB」的少数选项。海外参考价约 3,300 美元,大陆渠道价未核到。

✅ 能跑(估算显存)

  • qwen3:30b、qwen3-coder:30b(MoE,估算均 24.3 GB)
  • glm-4.7-flash:latest(估算 24.3 GB)
  • gemma4:26b(估算 24.3 GB)、gemma4:31b(估算 25.5 GB)
  • deepseek-r1:32b、qwen3:32b(估算均 25.5 GB)
  • qwen3-vl:30b(估算 25.5 GB)、qwen3-vl:32b(估算 26.7 GB)
  • qwen3.6:35b(MoE,估算 29.1 GB)、qwen3.5:35b(MoE,估算 30.3 GB)

⛔ 跑不了 / 会掉速

  • glm-4.7-flash:q8_0(估算 39.9 GB)这类高精度量化版装不下
  • 70B 级(deepseek-r1:70b、llama3.1:70b 估算均 53.1 GB)装不下
  • gpt-oss:120b(估算 79.5 GB)、qwen3.5:122b(估算 98.7 GB)装不下

统一内存(Mac M 系列)

适合谁:要跑 30B 以上、又不想折腾多卡和电源的人;以及本来就用 Mac 办公的人。买大内存比买显卡省心,代价是同容量下更贵、出字更慢。

显卡 / 设备厂商参考价(元)备注
Mac mini(M6,最高 32GB 统一内存)Apple6,999 元起12 核 CPU+12 核 GPU,内存可选 16/24/32GB。最便宜的「能跑 27B 级」的整机路线,功耗只有几十瓦。
Mac mini(M5 Pro,最高 64GB 统一内存)Apple12,999 元起起售配置为 15 核 CPU+16 核 GPU/24GB;顶配 18 核 CPU+20 核 GPU/64GB。想在 Mac 上碰 70B 级模型的起步机型。
MacBook Pro 14/16 英寸(M5 Pro,48/64GB)Apple22,999 元起(14 英寸 48GB/1TB)16 英寸同配 24,999 元起;64GB/1TB 为 24,499(14 英寸)/26,499 元(16 英寸)。笔记本形态里少见的大内存。
MacBook Pro 16 英寸(M5 Max,128GB)Apple37,499 元(128GB/2TB)M5 Max 统一内存最高 128GB、带宽 614 GB/s。这是移动形态能拿到的最大「显存」。
Mac Studio(M5 Max/M5 Ultra,最高 512GB)AppleM5 Ultra 起步 96GB、带宽 1.2 TB/s,可选到 512GB(512GB 配置 2026-10 下旬才供货)。海外起售 5,499 美元,大陆定价未核到。

✅ 能跑(估算显存)

  • 16GB 机型:系统默认只把约三分之二的统一内存让给 GPU,实际可用约 10~11 GB,对应 qwen3:8b(估算 7.7 GB)、gemma4:12b(估算 10.6 GB)
  • 32GB 机型:可用约 24 GB,对应 qwen3.5:27b、gemma3:27b(估算均 21.9 GB)、qwen3.6:27b(估算 23.1 GB)
  • 64GB 机型:可用约 48 GB,对应 qwen3:32b、deepseek-r1:32b(估算 25.5 GB)、qwen3.5:35b(估算 30.3 GB)、glm-4.7-flash:q8_0(估算 39.9 GB)
  • 128GB 机型:可用约 96 GB,对应 deepseek-r1:70b、llama3.1:70b(估算均 53.1 GB)、gpt-oss:120b(估算 79.5 GB)
  • 256GB 以上(Mac Studio M5 Ultra):可用约 192 GB 起,对应 qwen3:235b(MoE,估算 171.9 GB)

⛔ 跑不了 / 会掉速

  • macOS 默认不允许 GPU 吃掉全部统一内存(普遍是 65%~75%),标称容量不等于可用「显存」,卡线的模型要手动调高上限才装得下——64GB 跑 70B(估算 53.1 GB)、128GB 跑 qwen3.5:122b(估算 98.7 GB)都属于这种情况
  • 统一内存带宽比独显显存低一截(M5 Max 614 GB/s vs RTX 5090 D v2 的 1,344 GB/s),同样的模型,Mac 能装下但出字更慢
  • deepseek-r1:671b(估算 486.3 GB)即使 512GB 的 Mac Studio 也塞不进可用内存

国产卡与国产 AI 设备

适合谁:有国产化要求、或者想用更低的每 GB 成本换显存的人。图省事、只想「装完就能跑」的,还是 NVIDIA 卡或 Mac 更顺。

显卡 / 设备厂商参考价(元)备注
摩尔线程 MTT S80 16GB摩尔线程约 1,200~3,000官方指导价 2,999 元、促销曾到 1,199 元。16GB GDDR6、448 GB/s、PCIe 5.0 ×16、255W。厂商官方博客发过「在 MTT S80 上用 Ollama 跑 DeepSeek-R1 蒸馏版」的教程,走自研 MUSA 栈(不是 CUDA),S80/S3000/S4000 也支持 llama.cpp。
摩尔线程 MTT AICUBE 家庭 AI 中枢摩尔线程9,999 元(16GB)/10,999 元(32GB)自研「长江」SoC,CPU+GPU+双核 NPU 异构算力 50 TOPS,LPDDR5X 16/32GB、内置 1TB SSD、双 M.2 插槽。官方称可在本地运行 30B 参数大模型,系统为自研 MTT AIOS、内置智能体「小麦」。不是显卡,是整机。
砺算 LX 7G100 12GB砺算科技2,688 元(零售版)/3,299 元(创始版)国内首款全自研架构(TrueGPU 天图)消费级显卡,6nm、12GB GDDR6。官方宣传支持本地大模型与 Agent 应用,但未查到官方对 Ollama 的支持说明,上手前建议先确认后端。
华为 Atlas 300I Duo 96GB华为昇腾 310P ×2、96GB LPDDR4X、带宽 408 GB/s、150W,靠大容量而非高带宽取胜。走 CANN+MindIE 栈,不是 CUDA,Ollama 不原生支持,llama.cpp 也无官方昇腾后端,属于「愿意折腾生态换容量」的方案。

✅ 能跑(估算显存)

  • MTT S80(16GB):对标 16 GB 档,可跑 deepseek-r1:14b(估算 12.3 GB)、qwen3:14b(估算 12.7 GB)、qwen3:8b(估算 7.7 GB)
  • 砺算 LX 7G100(12GB):对标 12 GB 档,可跑 qwen3.5:9b(估算 9.4 GB)、gemma3:12b(估算 11.2 GB)
  • MTT AICUBE(32GB):厂商称可本地跑 30B 级模型,对应 qwen3:30b、qwen3-coder:30b(估算均 24.3 GB)
  • Atlas 300I Duo(96GB):容量上够放 gpt-oss:120b(估算 79.5 GB),但受限于软件栈与带宽,实际能不能跑、跑多快要看 CANN 生态

⛔ 跑不了 / 会掉速

  • 国产卡的通用短板是软件生态:CUDA 之外的后端遇到问题能搜到的解决方案少,新模型适配也慢半拍
  • 昇腾这类 NPU 路线跑不了标准 Ollama,得换整套推理框架(MindIE),对个人用户门槛偏高
  • 有实测反馈 Atlas 300I Duo 单路大模型推理速度只有 RTX 3090 的三分之一左右——买它是买容量,不是买速度

常见问题

显存不够会怎样?有什么办法救?
Ollama 装不下时会把放不下的层挪到内存、交给 CPU 算,模型仍然能跑,但速度会从每秒几十个字掉到个位数,长回答会等到人急。四条救法,按推荐顺序:① 换更小的尺寸标签(14b 换 8b);② 换更激进的量化(同一模型的 q4 包比 q8 小一半以上);③ 把上下文长度调小——KV 缓存吃的显存和上下文长度成正比,这一条最常被忽略;④ 加内存(不是显存)让溢出部分跑得没那么惨,属于兜底而非解决。
量化是什么?为什么同一个模型有好几个包?
量化就是把模型权重的精度降下来:原始权重多是 16 位浮点,压到 8 位、4 位后体积成倍缩小,显存需求跟着降,代价是回答质量有损耗。Ollama 默认拉的基本都是 4 位量化(q4_K_M 一类),这是体积与质量的通行折中。以 GLM-4.7-Flash 为例,同一个 30B 级模型,q4 包 19 GB(本站估算需 24.3 GB 显存)、q8 包 32 GB(估算 39.9 GB)、bf16 包 60 GB(估算 73.5 GB)——差三倍多。一般用途选默认的 4 位版本就够,追求还原度再上 q8。
两张小显存卡能不能顶一张大显存卡?
能装下,但不等于一样好用。Ollama 支持把一个模型拆到多张卡上跑,两张 16GB 确实能装下单张 16GB 装不下的 32B 模型,而且往往比买一张 32GB 的卡便宜得多。代价有三个:卡间通信走 PCIe,比单卡内部访问慢,出字速度打折;要主板有两条 ×8 以上插槽、机箱放得下、电源 750W 以上;驱动和散热的折腾量翻倍。结论:预算紧、显存是硬瓶颈就上双卡;图省心就单卡大显存。
Mac 能跑本地大模型吗?和显卡比怎么选?
能,而且在大内存这一段很有优势。Mac 的统一内存是 CPU/GPU 共享同一块内存池,GPU 可以把其中大部分当显存用,所以一台 128GB 的 MacBook Pro 能装下 70B 级模型,而消费级显卡最大也就 32GB。两个必须知道的前提:① macOS 默认只让 GPU 用掉约三分之二到四分之三的统一内存,标称容量不等于可用「显存」;② 统一内存带宽低于独显显存(M5 Max 614 GB/s,对比 RTX 5090 D v2 的 1,344 GB/s),Mac 装得下但出字更慢。一句话:跑 30B 以内看显卡,跑 70B 以上看 Mac。
国产显卡能跑 Ollama 吗?
分两类,结论不一样。摩尔线程走的是自研 MUSA 栈,官方博客给过在 MTT S80 上用 Ollama 跑 DeepSeek-R1 蒸馏版的完整教程,S80/S3000/S4000 也支持 llama.cpp,属于「能跑,但要按厂商文档来」。华为昇腾(Atlas 300I Duo 等)走的是 CANN+MindIE,Ollama 和 llama.cpp 都没有官方昇腾后端,等于要换整套推理框架,个人用户门槛明显更高。砺算 LX 7G100 官方宣传支持本地大模型应用,但没有查到对 Ollama 的明确支持说明,上手前请先确认。共同的短板是生态:出了问题能搜到的答案比 CUDA 少一个数量级。
AI PC 的 NPU 能给 Ollama 加速吗?
截至 2026-09,不能。Copilot+ PC 的门槛是 NPU 40 TOPS 以上,新一代芯片普遍到 50~80 TOPS,但 Ollama 官方文档里的加速后端只有 CUDA(N 卡)、ROCm/Vulkan(A 卡与部分 Intel 卡)、Metal(Mac)和 CPU,没有 NPU 这一项。实际现象就是:在 AI PC 上跑 Ollama,NPU 使用率基本是零,干活的还是 CPU 和 GPU。GitHub 上要求支持高通/Intel/AMD NPU 的 issue 挂了很久,官方没有给时间表。社区有实验性的 NPU 后端分支,不是官方方案。所以:为了跑 Ollama 配机器,钱该花在显存上,不是 NPU 上。

相关新闻