8月1日,DeepSeek的Agent Harness團隊負責人崔添翼在社交平台發文,公開招募DeepSeek Harness內測人員,要求申請者參與過開源Agent專案的建立和維護,並提交GitHub倉庫作為代表作品。這條看似普通的內測招募帖,迅速演變成一場Agent開源生態的“大摸底”,大量開發者帶著自己的專案湧入評論區,從個人Harness、Coding Agent,到記憶系統、安全工具、評測框架,幾乎覆蓋了當前Agent基礎設施探索的各個方向。

據開發者統計,截至8月3日上午11:30,共有769位報名者、去重後712個開源倉庫,合計超過120萬Stars,跨越18個賽道,評論區秒變“開源Agent路演”。這一資料由開發者自發統計,統計倉庫地址為 https://github.com/Octo-o-o-o/deepseek-harness-applicants 。

從目前公開資訊看,DeepSeek已經在內部使用Harness完成DeepSeek-V4-Flash正式版的基準測試。社群開始猜測,DeepSeek未來可能會打造一款面向軟體工程場景的AI Coding Agent。按照社群流傳的說法,這款產品或將具備自主規劃、工具呼叫、程式碼執行等能力,並圍繞長週期Agent工作流加入Memory、專案倉庫感知(Repo Awareness)等機制,定位上可能會對標Claude CodeCodex等現有Coding Agent產品。這些資訊目前尚未得到DeepSeek官方確認。

不過,從此前公佈的Harness基準成績來看,DeepSeek測試的重點本身就集中在終端操作、多工具呼叫、全棧開發等長流程任務場景。業內一直有“Model+Harness=Agent”的說法:模型負責理解需求、推理和生成方案,Harness負責把這些能力落到真實環境中——呼叫工具、操作終端、讀寫檔案、管理上下文、處理執行過程中的錯誤,最終完成一個完整任務閉環。DeepSeek Harness的定位逐漸清晰:它並不是一個單純的程式碼生成工具,而是在模型和真實軟體工程環境之間增加一層“執行系統”。

這一點在DeepSeek-V4-Flash成績單中的五組基準裡有所體現:Terminal Bench測試終端環境操作,Cybergym測試安全攻防能力,Toolathlon測試多工具呼叫,DSBench-FullStackDSBench-Hard則聚焦全棧開發任務。這些測試的共同特點是任務鏈條長、步驟多,需要Agent持續呼叫工具並根據反饋調整策略。DeepSeek選擇測試的方向,更接近一個能夠自主執行軟體工程任務的Agent,這與社群流傳的對標Claude Code、Codex等產品的目標一致。

除了基準之外,DeepSeek的生態動作也透露出類似訊號。目前公開資訊顯示,DeepSeek-V4-Flash已支援Responses API,並適配Codex,走向標準化工具呼叫協議;識圖模式正在灰度,用於補充程式碼Agent在理解架構圖、報錯截圖等視覺資訊上的能力。這些動作共同指向一個趨勢:未來Coding Agent的競爭,不只取決於模型能力,也取決於模型之外的工程基礎設施。

769份報名記錄裡,開發者關注的是一個非常現實的問題:當Agent需要獨立完成一個真實工程任務時,哪些方面還需要最佳化?首先是長任務執行能力,這是Agent從Demo走向生產的第一道門檻。DeepSeek公佈的五組基準,本質上都在測試Agent是否具備持續執行復雜任務的能力。從報名專案來看,智慧體框架和程式設計智慧體是最大的兩個方向,合計242個,佔全部專案約三分之一。Top 10高星專案中,deer-flow(79k星)探索長週期SuperAgent框架;CodeWhale(40k星)是由DeepSeek原生專案發展成的程式設計智慧體框架;orca(36k星)關注多Agent編排。這些開源專案路徑不同,但都在回答同一個問題:如何讓Agent在“持續執行”上走得更遠。

其次是上下文和記憶管理。當任務從幾分鐘延長到幾個小時,Agent面臨的除了推理能力問題,還有如何儲存狀態、理解專案歷史,並在後續任務中正確呼叫已有資訊。在報名統計中,記憶與上下文相關專案共有56個,累計194k星(剔除頭部專案vllm的88k星後仍約106k星)。開發者正在嘗試Git、資料庫、知識圖譜等不同路線,但Agent記憶目前仍沒有統一答案。最後是評測和安全。研究與評測、安全治理兩個方向各有24個專案,是報名生態中規模較小的類別,但決定著Agent能否真正進入生產環境。有開發者嘗試建立跨Harness評測體系;有開發者則關注工具呼叫許可權、檔案系統隔離和程式碼執行沙箱。如果說長任務和記憶解決的是“Agent能不能完成任務”,那麼評測和安全解決的就是“Agent能不能被放心使用”。

這三個方向對應了Agent從“能用”走向“好用”的關鍵迭代路徑:長任務執行能力決定Agent能否完成複雜工作,上下文和記憶能力決定Agent能否持續參與長期專案,而評測和安全能力決定Agent能否被真正部署到生產環境。這也是Harness需要持續最佳化的核心方向。

DeepSeek官方尚未、也或許不會公佈最終的篩選標準和名單。但從這份報名統計表來看,真正有價值的,是開發者們正在從不同角度探索Agent落地應用的路徑。對於DeepSeek Harness團隊而言,內測名單的意義,或許並不是尋找“最熱門”的專案,而是找到能夠在產品迭代過程中提供有效反饋的開發者。比如名單中,akashic-agent的作者於V4 Flash高思考強度模式執行TerminalBench2.1,拿到70.8%的成績,是基於DeepSeek模型調優Agent執行時並給出實測結果的開發者。此外,open-design(83k星)、lobehub(81k星)、career-ops(63k星)等高星專案,都已經擁有一定使用者基礎,並處於Agent應用生態的上層,這些開發者長期面對真實使用者和實際工作流,能夠幫助DeepSeek瞭解Harness在不同場景中的使用需求。

隨著Agent獲得更強的工具呼叫和程式碼執行能力,許可權控制、檔案隔離、安全邊界等問題會越來越重要。報名區中有開發者曾挖掘CodexClaude CodeCursor等產品漏洞,關注的正是這些Agent從Demo走向產品時必須面對的問題。當然,這份名單並非完整樣本。由於評論區天然混雜報名、討論和圍觀,加上提交格式不統一,部分專案仍存在身份無法確認、倉庫失效、描述缺失等問題。統計檔案也並非完全準確,核查過程中發現一些開源專案的分類出現錯誤,比如“我的世界機器人”被分到了安全領域,但總體上可以作為參考。同時,很多高星專案的報名也並非作者本人,有不少是僅提交過PR的參與者,並不能完全代表這些Agent專案。

DeepSeek Harness最終會是什麼樣,目前還沒有答案。但這場由內測招募引發的開源專案“大摸底”,卻揭露了Agent時代的競爭焦點。769份報名記錄、712個開源倉庫、120萬Stars背後,開發者關注的是一個底層的問題:當模型具備越來越強的推理能力後,如何讓它穩定、長期、可靠地完成真實任務。有人在解決長任務執行,讓Agent不會跑到一半失控;有人在探索記憶和上下文管理,讓Agent能理解一個持續演進的專案;有人在測試安全邊界,確保工具呼叫和程式碼執行不會成為風險源。這些專案未必都會進入DeepSeek的內測名單,但它們提前勾勒出了一張未來Agent工程演進的路線圖。