8月17日,阿里釋出的Qwen3.8-27B成為Hugging Face上排名第一的熱門模型,這一訊息迅速點燃了海外AI社群。儘管27B引數在今天動輒千億、萬億引數的旗艦模型面前顯得“小”,但正是這個“小”字,讓它具備了前所未有的吸引力:經過4bit量化後,模型權重約17.1GB,一張RTX 4090或3090就能完整裝下,意味著前沿的Coding和Agent能力首次以個人裝置可承受的尺寸出現。
Qwen3.8-27B於2026年8月14日正式開源。在Qwen官方公佈的成績中,它已在部分Coding和Agent測試中與Claude Opus 4.6 Max這樣的前沿閉源模型並列比較。具體來看,在SWE-bench Pro(真實GitHub issue修復)上,Qwen3.8-27B達到61.7,而Claude Opus 4.6 Max為53.4;OSWorld-Verified(電腦操作)為84.3對72.7;AndroidWorld(手機操作)為81.9對62.0;CoWorkBench(長週期辦公任務)為70.7對68.2;LiveCodeBench v6(程式碼生成)也達到90.3。這些數字讓社群開始用“接近Opus”來描述實際體驗。
該模型的設計明顯服務於本地部署目標。它共有64層,其中48層採用Gated DeltaNet,16層保留完整Attention。DeltaNet使用固定規模的迴圈狀態,降低了長文本帶來的視訊記憶體壓力,使模型原生支援262K上下文,並可擴充套件至100萬Token。這種架構讓長上下文任務在個人硬體上成為可能。
社群反應熱烈。獨立開發者Simon Willison直接評價其“excellent”,Reddit的LocalLLaMA板塊有人稱其為“遊戲規則改變者”。開發者們用相同Prompt對比Qwen3.8-27B與上一代Qwen3.6-27B生成voxel pagoda,在相同DGX Spark和量化設定下,3.8版本明顯更成熟;與同體量的Glimmer-30B對比Three.js場景,使用者也將優勢判給Qwen。更有使用者直接拿它與Claude Opus做前端生成對比,儘管單個Demo不能證明整體水平,但這種比較本身已說明問題。
然而,榜單之外,圍繞它的爭議同樣集中。最突出的問題是“過度思考”:模型預設使用最高的xhigh推理強度,導致響應極慢且消耗大量Token。Simon Willison測試生成一張“騎腳踏車的鵜鶘”SVG,模型花了21分鐘,產生22,276個推理Token,最終輸出僅3,223 Token;關閉深度思考後,同一任務縮短到137秒。社群中有人讓它寫簡單遊戲,模型先思考半小時;接進Coding Agent時,一次任務思維鏈跑掉數萬Token。這種高推理強度在雲端旗艦模型上只是價格和等待時間問題,但在3090、4090上直接變成速度、視訊記憶體和使用體驗的瓶頸,部分抵消了“本地可跑”的優勢。
另一個需要降溫的是“超Opus”的說法。儘管在標準化Benchmark上表現亮眼,但在更復雜的真實Agent任務中,27B的優勢並不絕對。例如在WildClawBench的60項真實Agent任務中,Qwen3.8-27B雖然明顯超過前代,但仍落後於一些更大的託管模型。真實Agent任務可能持續數小時,需要反覆呼叫工具、修改程式碼、處理異常,這些變數是標準化測試無法完全覆蓋的。因此,更準確的位置或許是:它已證明27B開源模型有資格進入頂級閉源Agent的比較範圍,但尚未證明能全面替代它們。
從產業視角看,Qwen3.8-27B的意義超越了單個模型。過去本地部署往往意味著能力妥協,使用者獲得隱私、可控和低成本,卻要接受複雜Coding和Agent任務的短板。Qwen3.8-27B第一次讓“本地執行”和“前沿Agent能力”可以同時追求,這被社群視為一種結構性變化:前沿能力正在從雲端下放到個人電腦。這種“下放”一旦發生,就不會縮回去,可能迫使開發者工作流、企業部署策略乃至個人GPU採購邏輯重新思考。正如文章所言,如果未來所有27B級別模型都具備這種Agent能力,整個AI產業鏈的本地化部署格局都將被重塑。