先說結論:Ollama 是把開源大模型裝到自己電腦上離線跑的工具,官網 ollama.com,三個系統各一行命令裝完,ollama run 加模型名就能用;真正的門檻不在安裝、在視訊記憶體——同一個模型的 4 位量化版比原版小三四倍,本頁下面那張表按檔案大小折算了「建議視訊記憶體」,先對錶再拉模型,能省下幾個 GB 的白下載。

:三個系統各有兩條路。macOS 和 Linux 都是同一行命令 curl -fsSL https://ollama.com/install.sh | sh;macOS 也可以直接下 Ollama.dmg 安裝包(要求 macOS 14 Sonoma 或更高)。Windows 在 PowerShell 裡跑 irm https://ollama.com/install.ps1 | iex,或者直接下 OllamaSetup.exe 雙擊安裝(要求 Windows 10 或更高)。

:裝完開啟終端,敲 ollama run 加模型名就行,比如 ollama run deepseek-r1——它會自動下載權重並進入對話,換模型只要換名字。模型名後面可以跟冒號加尺寸標籤來指定版本,具體有哪些尺寸看模型庫頁面上每個模型的標籤列表。首次執行要下載幾個 GB 的權重,之後就完全離線可用。

跑什麼:模型庫 ollama.com/library 收錄數百個模型,按拉取量排在前面的有 llama3.1(Meta,8B/70B/405B)、deepseek-r1(DeepSeek 的開源推理模型系列)、nomic-embed-text(向量模型)、llama3.2(1B/3B 小尺寸)、gemma3(主打單卡可跑)等,Qwen、GLM、gpt-oss(20B/120B)等系列也都在。選型的關鍵是視訊記憶體:引數量越大越吃硬體,同一個模型的低位元量化版本能顯著降低門檻,但會損失一些精度。本地實在帶不動的大模型,可以用官方的 Cloud 訂閱跑。

選哪個模型:對著視訊記憶體看

8 GB 視訊記憶體(RTX 3060/4060 一類、或 16 GB 記憶體的 Mac)能穩跑 7B~9B 的 4 位量化版:deepseek-r1:8b(5.2 GB)、qwen3.5:9b(6.6 GB)、gemma3:4b(3.3 GB)都在這一檔;12~16 GB 上到 14B(deepseek-r1:14b 9.0 GB、phi4 9.1 GB)和 gpt-oss:20b(14 GB);24 GB(RTX 3090/4090)能跑 27B~32B 一檔(qwen3.5:27b 17 GB、gemma3:27b 17 GB、qwen3-coder:30b 19 GB);再往上 70B 級要 43 GB、只能多卡或大記憶體 Mac。MoE 模型(如 qwen3.5:35b、gemma4:26b)檔案不小但只啟用一小部分引數,速度比同體積稠密模型快得多。上面「我的顯示卡能跑哪個」表可以按視訊記憶體篩,數字全部來自模型庫各標籤頁,建議視訊記憶體是本站估算(檔案大小 × 1.2 + 1.5 GB 餘量)。

中文任務優先看千問系:qwen3.5 / qwen3.6 是 2026 年 9 月上旬剛更新的一代,帶看圖與工具呼叫;DeepSeek-R1 的小尺寸(1.5b~70b)是基於 Qwen/Llama 的蒸餾版、不是 671B 原版,推理題強、閒聊一般;要做本地知識庫還得再拉一個向量模型(nomic-embed-text 274 MB 或中文更友好的 bge-m3 1.2 GB)。