8月20日,DeepSeek Harness迎來公測後的首次重要更新,v0.1.0-rc.8版本正式上線。此次更新共帶來14項調整,覆蓋多模態輸入、子代理協作、終端體驗、工具呼叫和開發者支援等多個方向,其中多模態能力成為重頭戲,補齊了Agent處理圖片等任務的能力。

新版DeepSeek Harness支援原生圖片請求和圖文混合輸入,/goal、/plan等命令也可以直接接收圖片。同時,輸入框中的@選單新增檔案和會話引用,使用者可以將本地檔案、已有會話等內容拉入當前任務。這意味著,過去主要圍繞文本、程式碼和工具呼叫展開的Agent工作流,現在可以進一步將截圖、圖片等視覺資訊納入任務上下文。

在子代理體系方面,新版支援將Claude CodeCodex作為Profile Bundle按需安裝。其中,Codex支援非互動許可權模式以及多個命名例項,方便在同一任務中配置不同子代理。Windows使用者也得到重點照顧,PTY終端加入持久PowerShell會話,並在極簡模式預設中預設開啟,減少命令執行過程中頻繁重建終端環境的問題。

除了新能力,這次更新還集中修復了一批公測後暴露的問題。例如,當單張圖片尺寸過大或歷史會話中累積圖片過多時,可能導致模型請求失敗,新版對此進行了處理。取消一次流式生成後,已顯示的回覆字首此前可能不會被帶入下一輪提問或分叉會話,這一問題也已修正。對於使用自定義OpenAI相容閘道器的開發者,新版修復了部分閘道器因請求格式差異而無法呼叫,以及推理內容回傳缺失的問題。

一個有意思的細節是,開發者發現DeepSeek Harness在處理圖片時,若所呼叫模型本身不支援影像輸入,它會退化到另一套工具鏈:先進行OCR文字識別,再統計圖片中的顏色比例、掃描部分畫素行,同時讀取圖片尺寸、色彩模式等元資訊。這些結構化結果會被重新交給文本大模型,讓模型根據OCR文本、顏色佔比、畫素位置等證據“腦補”出整張圖的大致內容。這種能力與視覺大模型直接理解圖片有明顯區別,對於PPT截圖、流程圖、介面截圖等結構相對明確的圖片,它可以藉助OCR和畫素特徵得到不少有效資訊;面對真實照片、複雜空間關係等內容,恢復的資訊則受到明顯限制。

事實上,在官方加強多模態支援之前,DeepSeek Harness社群已經圍繞視覺能力出現了一批外掛,包括dsh-vision、dsh-vision-toolkit、modlens、dsh-auto-vision、dsh-subagent-vision以及通過pi2dsh橋接的pi-vision等。其中一些方案就是通過OCR、畫素分析、結構化證據或獨立視覺子代理,讓純文本模型間接處理圖片;也有開發者通過自定義路由,為本身支援視覺的模型配置input: [text, image],直接接收圖片。rc.8上線後,原生多模態模型和這類工具層視覺方案可以進一步配合使用。

DeepSeek Harness於8月13日正式開啟v0.1版本公測並同步開源。公測當晚,智東西曾第一時間拉取原始碼進行實測,用它完成88頁論文翻譯、貪吃蛇遊戲開發等任務。僅過去不到一週,這套Agent Harness就把多模態補上了。公測時團隊強調,其核心設計思路是“一切皆外掛”:模型、工具、技能、會話、沙箱、儲存、迴圈、排程和UI等Agent能力,都可以由不同外掛組合和替換。當Agent Harness擁有越來越豐富的工具和子代理後,一些原本依賴單個模型能力的任務,也可以通過工具編排被重新拆解和實現。

此次rc.8繼續強化了這種外掛化思路:視覺模型可以原生接收圖片,純文本模型也能借助視覺工具獲得部分影像資訊;Claude Code和Codex則可以作為子代理按需裝進同一套Harness中。除了這些核心變化,rc.8還加入了web_search併發查詢、子代理reportDelivery及時喚醒父任務、本地執行dsh web自動開啟瀏覽器等最佳化,並提升了大型歷史會話分叉以及SQLite後端的讀寫效能。

從8月14日開放公測,到如今把多模態和更多子代理能力裝進來,DeepSeek Harness仍處於快速迭代階段。接下來值得期待的,是這套外掛化Harness能否繼續把更多模型、工具和Agent裝進同一個體系,並跑出更復雜、更穩定的任務流程。