先说结论:Ollama 是把开源大模型装到自己电脑上离线跑的工具,官网 ollama.com,三个系统各一行命令装完,ollama run 加模型名就能用;真正的门槛不在安装、在显存——同一个模型的 4 位量化版比原版小三四倍,本页下面那张表按文件大小折算了「建议显存」,先对表再拉模型,能省下几个 GB 的白下载。

:三个系统各有两条路。macOS 和 Linux 都是同一行命令 curl -fsSL https://ollama.com/install.sh | sh;macOS 也可以直接下 Ollama.dmg 安装包(要求 macOS 14 Sonoma 或更高)。Windows 在 PowerShell 里跑 irm https://ollama.com/install.ps1 | iex,或者直接下 OllamaSetup.exe 双击安装(要求 Windows 10 或更高)。

:装完打开终端,敲 ollama run 加模型名就行,比如 ollama run deepseek-r1——它会自动下载权重并进入对话,换模型只要换名字。模型名后面可以跟冒号加尺寸标签来指定版本,具体有哪些尺寸看模型库页面上每个模型的标签列表。首次运行要下载几个 GB 的权重,之后就完全离线可用。

跑什么:模型库 ollama.com/library 收录数百个模型,按拉取量排在前面的有 llama3.1(Meta,8B/70B/405B)、deepseek-r1(DeepSeek 的开源推理模型系列)、nomic-embed-text(向量模型)、llama3.2(1B/3B 小尺寸)、gemma3(主打单卡可跑)等,Qwen、GLM、gpt-oss(20B/120B)等系列也都在。选型的关键是显存:参数量越大越吃硬件,同一个模型的低比特量化版本能显著降低门槛,但会损失一些精度。本地实在带不动的大模型,可以用官方的 Cloud 订阅跑。

选哪个模型:对着显存看

8 GB 显存(RTX 3060/4060 一类、或 16 GB 内存的 Mac)能稳跑 7B~9B 的 4 位量化版:deepseek-r1:8b(5.2 GB)、qwen3.5:9b(6.6 GB)、gemma3:4b(3.3 GB)都在这一档;12~16 GB 上到 14B(deepseek-r1:14b 9.0 GB、phi4 9.1 GB)和 gpt-oss:20b(14 GB);24 GB(RTX 3090/4090)能跑 27B~32B 一档(qwen3.5:27b 17 GB、gemma3:27b 17 GB、qwen3-coder:30b 19 GB);再往上 70B 级要 43 GB、只能多卡或大内存 Mac。MoE 模型(如 qwen3.5:35b、gemma4:26b)文件不小但只激活一小部分参数,速度比同体积稠密模型快得多。上面「我的显卡能跑哪个」表可以按显存筛,数字全部来自模型库各标签页,建议显存是本站估算(文件大小 × 1.2 + 1.5 GB 余量)。

中文任务优先看千问系:qwen3.5 / qwen3.6 是 2026 年 9 月上旬刚更新的一代,带看图与工具调用;DeepSeek-R1 的小尺寸(1.5b~70b)是基于 Qwen/Llama 的蒸馏版、不是 671B 原版,推理题强、闲聊一般;要做本地知识库还得再拉一个向量模型(nomic-embed-text 274 MB 或中文更友好的 bge-m3 1.2 GB)。