DeepSeek Harness 對決 Claude Code、Codex:同模型有無 Harness 差距多大?實測 44→64 題完整解析

目錄
共 41 個章節
DeepSeek Harness 是什麼?4 天 129K 星的開源發布事件全解析
2026 年 8 月 13 日,DeepSeek 一口氣拋出三件大事,震撼了整個 AI 開發圈。同一天,開源 agent 框架 DeepSeek Harness(簡稱 dsh)以 developer preview 形式登上 GitHub,V4-Pro 正式版對外發布,API 價格調整方案也跟著公告,並於 8 月 17 日零時生效。這三件事綁在一起,背後藏著一個明確的戰略意圖,DeepSeek 不再只是賣模型的廠商,它要把開發者整個工作流程,都放進自己的工具鏈裡。

最搶眼的數字來自 GitHub。專案發布當天,星數在 24 小時內衝破 8 萬,觀察者網報導為 80.3K,一舉超過 Grok-1 多年累計的 5.2 萬星(來源:觀察者網,2026)。到了 8 月 17 日,實際查詢 GitHub API,星數已達 129,070,fork 數 12,875,授權 MIT,版本 v0.1(來源:GitHub API,2026-08-17)。四天內從 27.5K 暴漲到 129K,這是 2026 年最現象級的開源發布,沒有之一。
一切皆插件,Cordis 微內核撐起開放架構
DeepSeek Harness 到底是什麼?官方定義了一個公式:Agent 等於 Model 加上 Harness。模型是靈魂,而 harness 賦予 agent 理解環境、操作工具、持續工作的能力。換句話說,模型負責思考,harness 負責動手。核心設計哲學只有一句話,「一切皆插件」。模型、工具、技能、會話、沙箱、儲存、迴圈、排程、UI,每一層都可以替換,全部以插件形式掛載。底層是北大與 DeepSeek 聯合發表的論文《A Programming Paradigm for Spatiotemporal Composability》所實作的 Cordis 微內核(來源:Cordis 論文,2026)。Cordis 只管插件掛載、卸載與依賴管理,agent 的具體能力,全部由插件各自負責。
四種運行模式各有定位。標準模式提供完整工具集,包含檔案編輯、shell、搜尋、技能、規劃、目標、子代理與工作流。PTC 模式(Code mode)讓模型寫一段程式,組合多輪工具呼叫,官方稱之為 programmatic tool calling。極簡模式只保留 shell 與檔案編輯器,用途是模型基準測試,B 站創作者魚皮實測後發現極簡模式性能暴增,但幾乎沒人拿來日常使用。創造模式則允許在運行時檢查環境、於記憶體中實驗插件、組合全新模式。每次運行的軌跡都可追蹤,append-only session log 搭配 Trajectory 檢視,支援 resume、fork、search、replay。(來源:DeepSeek 官方,2026)
更重要的是模型中立。dsh 不綁死自家模型,可以接 DeepSeek、Anthropic、OpenAI,以及任何 OpenAI 相容端點。啟動方式有四種:Web UI、TUI、Headless、Python SDK。不會 Node.js 的開發者,可以直接用 pip install deepseek-harness-sdk 安裝 Python 版,跳過 npm。安裝指令只有一行:npx @deepseek-ai/dsh web(來源:DeepSeek 官方,2026)。
從賣模型到賣工具鏈,三連發的真正用意
戰略意義在於,harness 是比模型更難替換的一層。開發者今天可以因為價格、性能,隨時從 GPT 換到 Claude 再換到 DeepSeek,但一旦整個開發流程、插件生態、自動化迴圈都建立在某個 harness 上,轉換成本就非常高。觀察者網引述業界說法,中國公司第一次在模型加工程外殼的層面,擁有和 Anthropic 正面對抗的完整閉環能力(來源:觀察者網,2026)。
三連發的巧妙之處在於漲價與 harness 的搭配。8 月 17 日起,V4-Pro 高峰時段輸出價格從每百萬 token 6 元漲到 27 元,漲幅 350%,空閒時段 13.5 元,漲幅 225%;V4-Flash 漲幅落在 50% 到 150%。高峰時段為北京時間 9:00 到 12:00、14:00 到 18:00(來源:北京商報,2026)。模型漲價,自家 harness 卻能靠緩存命中率省下大量 token,等於把開發者往自家工具鏈推。魚皮在實測影片中說了一句流傳很廣的話:「DeepSeek 接不接自家 Harness 效果差距大到離譜,同一 V4 Pro 裸接 Codex 連線條都畫不對,換 Harness 後對標 Claude。」獨立評測者 sentdex 也給出具體數據,同一組 V4 Flash 權重,自寫簡陋工具只答對 44/89 題,換上社區完整 Harness 後提升到 64/89 題,整整多了 20 題(來源:魚皮 B 站影片,2026)。
中國社群狂熱,國際社群理性的兩極反應
同一個發布,中國與國際社群的溫度差非常明顯。中國市場這邊,Bilibili 幾乎被 DeepSeek Harness 洗版。魚皮(98.6 萬粉絲)的實測影片突破 61.1 萬觀看、2.9 萬讚、1431 條彈幕;阿江-Relakkes(MediaCrawler 作者)的影片也有 34.7 萬觀看,內測用戶說兩天跑了 20 億 token,社區已經有人做出 2005 門戶風格 UI、Claude Code 風格 TUI、多 Agent 協作插件(來源:阿江 B 站影片,2026)。發布 21 小時內,dsh-plugin 主題的 repo 超過 1300 個(來源:觀察者網,2026)。V2EX 上多帖熱議,有人說「寫一個前後端專案才花 1 塊錢」,軌跡功能廣受好評。
Hacker News 則是另一種氛圍。討論串拿到 731 分、292 則留言,團隊負責人崔添翼(tianyicui)親自回應,強調這是 early developer preview,預期會有破壞性變更(來源:Hacker News,2026)。正面評價肯定 Cordis 插件架構有趣、traceability 獨特;負面意見同樣尖銳,有人抱怨 README 太簡略,有人形容論文「讀起來像詞彙沙拉」,還有人直接說讀完論文後感覺「looked just like every other harness」,跟 pi、OpenClaw、Codex App 沒有本質差異。也有資深開發者類比 Eclipse 的 OSGi 插件系統,感嘆「每一代都在重新發明一樣的東西」。
真實安全事故,400G 檔案被刪的警鐘
在討論架構與星數之前,必須先正視一個真實發生的安全事故。有 Windows 用戶在安裝插件時,DSH 處理符號連結的路徑解析出現錯誤,加上插件擁有 Full access 完全訪問權限、刪除檔案前沒有二次確認、也沒有進回收站,結果直接刪掉了 G 盤根目錄約 400G 的檔案(來源:什麼值得買,2026)。這個事件對任何想導入 agent 的企業而言都是最明確的安全紅線,權限管理不是小事,預設最小權限、刪除前確認、可回復機制,缺一不可。
除此之外,dsh 現在還是 v0.1 的 developer preview,官方自己都在 README 裡警告會有 compatibility-breaking changes。V2EX 開發者直言,要上生產環境起碼等 1.0,激進一點也要 0.5。200k token 以上的長上下文,UI 會明顯卡頓,多模態圖片體驗也不佳。這些限制都說明了同一件事,這是一個極具潛力、但還沒成熟的框架。對台灣的開發者與企業來說,現階段最務實的做法是先在小範圍實驗,把安全機制與權限盤點做在前面,再考慮是否導入正式流程。下一章,我們將深入拆解 Cordis 插件架構與四種運行模式的實際操作。
核心概念拆解:Agent = Model + Harness,Cordis 微內核與四種運行模式
要理解 DeepSeek Harness(以下簡稱 dsh),第一個要建立的觀念,就是官方在 GitHub 儲存庫開宗明義寫下的公式:Agent = Model + Harness。這個等式看似簡單,背後卻藏著 DeepSeek 對 agent 架構的完整想像。Model 是模型本身,負責理解與推理;Harness 是模型外層的「馬具與韁繩」,賦予 agent 理解環境、呼叫工具、持續工作的能力。模型是靈魂,Harness 是身體,兩者缺一不可。

這個拆法與 OpenAI、Anthropic 的垂直整合路線截然不同。Claude Code 把模型、工具、skills、hooks 全部打包成一套產品,使用者拿到的是「整機」。dsh 則是將引擎與車身分開,模型的品質固然重要,但真正決定 agent 實際表現的,往往是 Harness 這層工程外殼。2026 年 8 月多份獨立實測都印證了這個觀點。海外評測者 sentdex 使用同一份 V4 Flash 權重,自己寫的精簡工具只答對 44 題,換上社群開發的完整 Harness 後答對 64 題,整整多出 20 題(來源:sentdex 獨立評測,2026)。對岸創作者魚皮也直言,同一顆 V4 Pro 裸接 Codex 時連線條都畫不對,換上 Harness 後就能對標 Claude Code(來源:魚皮 B 站實測,2026)。這說明 Harness 不是可有可無的配件,而是決定模型智商能否兌現的關鍵載體。
Cordis 微內核,只管理中樞,其餘交給插件
dsh 的底層,是北京大學與 DeepSeek 聯合發表的論文《A Programming Paradigm for Spatiotemporal Composability》所描述的 Cordis 微內核(來源:Cordis 論文,2026)。Cordis 的設計哲學與微內核作業系統如出一轍,核心只處理最基本的工作:插件的掛載、卸載與依賴解析。除此之外,agent 的具體能力全部仰賴插件,模型、工具、技能、會話、沙箱、儲存、迴圈、排程乃至使用者介面,每一層都可以抽換。
這個設計在技術圈引發了不少歷史類比。Hacker News 上有開發者指出,這與 Eclipse 的 OSGi 插件系統殊途同歸,甚至感嘆「每一代都在重新發現同樣的東西」(來源:Hacker News,2026)。Reddit 上則有人稱呼它是「Agent 界的 VS Code」(來源:Reddit r/DeepSeek,2026)。這個類比相當貼切。VS Code 之所以能稱霸編輯器市場,靠的是極致輕量的核心加上無限擴充的生態,dsh 想在 agent 領域重演同樣的劇本。
四種運行模式,對應從開發到研究的完整光譜
dsh 提供四種運行模式,分別是標準模式、PTC 模式、極簡模式與創造模式(來源:官方文件,2026)。四種模式並非只是功能加減,而是對應截然不同的使用情境。
標準模式,開箱即用的完整工具集
標準模式配備完整工具集,包括檔案編輯、shell、搜尋、技能、規劃、目標管理、子代理與工作流。這是大多數使用者預設的選擇,適合日常開發任務,從寫程式、跑測試到整理專案,都能在這一模式下完成。官方的設計意圖是「開箱即用」,讓使用者不必費心思考底層機制,專注在任務本身。
PTC 模式,用程式語言組合工具呼叫
PTC 的全名是 Programmatic Tool Calling,運作邏輯與其他模式截然不同。傳統的 agent 每次呼叫工具,都由模型逐步決定下一步動作,PTC 模式則讓模型先寫出一段程式,用程式語言組合多輪工具呼叫。這就好比把「每做一步都要請示的基層員工」升級成「先
實戰起手式:npx 一鍵啟動、Python SDK 與三種介面實測
理論說得再多,都不如實際跑一次安裝來得踏實。DeepSeek Harness 官方在 官方頁面 提供了兩種安裝路徑,一是透過 Node.js 生態的 npx 指令,二是 Python SDK 套件。前者適合已經熟悉前端工具鏈的開發者,後者則讓沒有安裝 Node.js 環境的使用者也能快速上手。本節我們把安裝過程、三種操作介面的差異,以及社群實際回報的數據一次講清楚。

npx 一鍵啟動,Web UI 立刻上線
安裝 DeepSeek Harness 最直接的方式,就是在終端機輸入這一行指令:
npx @deepseek-ai/dsh web
npx 會自動抓取套件並啟動 Web UI,接著瀏覽器就會開啟操作介面。整個過程不用手動下載檔案、不用設定環境變數,對初次接觸的使用者來說門檻極低。官方文件也列出其他啟動參數,包括 TUI 介面的 npx @deepseek-ai/dsh tui,以及 Headless 模式的 npx @deepseek-ai/dsh headless,讓使用者依需求選擇不同的操作方式。
這套安裝流程在中國社群引起熱烈討論。Bilibili 知名創作者魚皮的實測影片累積超過 61 萬觀看次數,他在影片中示範了從 npx 啟動到完成第一個任務的完整流程,並強調「DeepSeek 接不接自家 Harness 效果差距大到離譜」,同一顆 V4 Pro 模型裸接其他工具連線條都畫不對,換上 Harness 之後表現直接對標 Claude Code,這段評論被騰訊新聞轉載後廣為流傳。
Python SDK,免 Node.js 的第二條路
對於不熟悉 JavaScript 生態系的開發者,DeepSeek 也提供了 Python 版本的 SDK:
pip install deepseek-harness-sdk
安裝完成後即可在 Python 環境中呼叫 harness 功能,不必額外安裝 Node.js。這條路徑特別適合以 Python 為主要開發語言、或是在資料科學環境中工作的使用者。根據 SegmentFault 的部署指南,官方總共提供四種啟動方式,除了前面提到的 Web UI、TUI、Headless 之外,Python SDK 本身也是一種獨立的操作介面,讓開發者可以把 harness 嵌入自己的應用程式當中。
三種介面實測比較
Web UI、TUI、Headless 這三種介面各有不同的適用場景,以下整理社群實測後的差異:
- Web UI:圖形化介面,滑鼠點擊即可操作,適合視覺化檢視任務執行過程。官方以瀏覽器為基礎,介面會展示完整的 append-only session log,每次運行紀錄都可供日後檢視、復原或分岔。AI超元域的實測影片指出,Web UI 在操作直覺度上勝過 Claude Code 的文字介面。
- TUI:終端機介面,在終端機內以鍵盤操作,保有文字的輕量與速度。V2EX 開發者回報 TUI 的執行速度「比 codex 快非常多」,對於習慣終端機工作的工程師來說,TUI 是最順手的选择。
- Headless:無介面模式,適合排程任務、伺服器部署,或是把 harness 當作背景服務執行。九天Hector 的比較影片提到,Headless 模式搭配 Cron 排程可以做到全自動化的任務處理。
三種介面共用同一套底層引擎,切換介面不會影響任務執行結果,差別只在操作體驗。有一個值得注意的現象是,魚皮在實測中提到「極簡模式」性能暴增,這個模式只保留 shell 與檔案編輯器,雖然拿來做模型基準測試很合適,但「幾乎沒人用」。這也側面說明了完整工具集對一般使用者的重要性。
橙皮書 129 行啟動清單,非工程師也能照做
在官方文件之外,社群也出現了一份非常實用的參考資料。GitHub 上的 deepseek-harness-orange-book(橙皮書)目前累積 801 顆星,作者以「不寫程式的人」為對象,花了 24 小時跑完整套流程,整理出 129 行啟動清單,並附上三份原始會話日誌。這份清單補足了官方文件缺乏的第一手操作紀錄,對中文使用者來說尤其方便,因為它把安裝過程中的常見錯誤與排除方法都記錄下來了。
橙皮書的出現反映了 DeepSeek Harness 的社群擴散速度。發布 21 小時內,dsh-plugin 主題的儲存庫就超過 1300 個,有人做出了 2005 年入口網站風格的 UI、有人開發了 Claude Code 風格的 TUI,還有人做出多 Agent 協作插件,這些都是官方沒有提供的擴充功能。
成本實測,「寫一個前後端項目才花 1 塊錢」
開發者最關心的永遠是成本。V2EX 上有使用者回報,透過 Harness 的快取命中機制,寫一個完整的前後端專案,API 花費竟然只要人民幣 1 塊錢左右。這個數字之所以這麼低,是因為 harness 會重複利用快取的 token,同一段程式碼反覆修改時,不需要每次都重新計算。DeepSeek 在 8 月 17 日調整 API 定價之後,V4-Pro 的輸出價格從每百萬 token 6 元漲到 27 元,漲幅高達 350%,華爾街見聞 的報導指出,這樣的漲價策略讓「用 DeepSeek 省成本」的敘事開始鬆動。但 harness 本身的快取設計,某種程度上緩解了漲價帶來的衝擊。
200k 上下文以上的 UI 卡頓,真實存在的效能瓶頸
不是所有回報都是正面的。V2EX 上有開發者反應,當對話上下文超過 200k tokens 之後,Web UI 會出現明顯卡頓,操作延遲大幅增加。這個問題的根源在於 JavaScript 執行環境的效能上限,並非 DeepSeek Harness 獨有,其他以網頁為基礎的 agent 工具也有類似狀況。另外也有使用者抱怨多模態圖片體驗不佳,雖然 Harness 支援圖片輸入,但顯示與縮放的操作流暢度還有改進空間。
整體而言,DeepSeek Harness 的安裝流程確實做到了「一鍵啟動」的承諾,Python SDK 也照顧到了非 Node.js 使用者的需求。三種介面的設計各有所長,可以涵蓋從圖形化操作到全自動化的各種場景。不過,0.1 版本的定位終究是 developer preview,官方在 Hacker News 上親自回應「expect breaking changes」,V2EX 開發者的建議很直接:「上生產起碼要 1.0,激進一點 0.5」。想嚐鮮的人現在就可以動手,但要把正式工作負載搬上去,建議再等版本穩定一些。
同一模型有無 Harness 差距多大?44→64 題、魚皮神鬼二象性與 Codex 對決
DeepSeek Harness 發布至今,最常被問的問題不是架構多漂亮,而是「同一個模型,接不接 Harness 到底差多少」。這一章我們直接用三組對照實驗來回答:獨立評測者 sentdex 的 44 題到 64 題、B 站創作者魚皮的「神鬼二象性」實測、九天Hector 的 Harness 對決 Codex。補上我們以 Hermes 對照 dsh 的第一手觀察。

44→64:同一個 V4 Flash,多 20 題從哪裡來
sentdex 是海外知名的 Python 教育者,他的做法值得先講清楚:他使用同一個 V4 Flash 權重,先用自己的陽春工具串 API,逐題跑完 89 道實作測試,只得到 44 題正確。接著換上社群製作、功能完整的 Harness,全程不改模型參數,同一個 Flash 權重直接拿到 64 題,整整多了 20 題(資料來源:sentdex 獨立評測,2026)。
這個對照之所以關鍵,在於它把模型能力跟外層工具拆開。模型本身就像一顆引擎,Harness 是變速箱、底盤跟方向盤。引擎再好,如果變速箱齒比錯誤,跑起來照樣輸給調校正確的對手。sentdex 把原始數據公開後,社群重新理解了 DeepSeek 官方那句「Agent = Model + Harness」,那不是行銷話術,而是可以直接量化的差距。
當然,44 到 64 的進展不代表 Harness 把模型變聰明了。更精確的講法是,完整的工具鏈讓模型原本就會的能力有機會被完整兌現。檔案編輯、shell 執行、搜尋循環這些動作,陽春工具常常卡到一半就一去不回,分數自然上不去。sentdex 的實驗也揭露一個殘酷事實:很多人說 DeepSeek 模型「沒那麼強」,其實是輸在沒有幫模型裝上合適的外骨骼。
魚皮的神鬼二象性:裸接 Codex 連直線都畫不對
B 站創作者魚皮擁有 98.6 萬粉絲,他的實測影片《DeepSeek Harness 首發實測+入門教程》上線後累積 61.1 萬觀看、2.9 萬讚(資料來源:魚皮 Bilibili 影片,2026)。影片裡的金句被大量轉傳:「DeepSeek 接不接自家 Harness 效果差距大到離譜。同一 V4 Pro 裸接 Codex 連線條都畫不對,換 Harness 後對標 Claude。」
「裸接」的意思是,直接把 DeepSeek 的 API 當成 OpenAI 相容端點,塞給 Codex 這個 agent 框架使用,沒有針對 DeepSeek 模型特性做任何調整。結果是連「畫一條直線」這種基礎繪圖指令都失敗。換上 DeepSeek Harness 之後,同一個模型畫出來的東西可以跟 Claude 搭配 Codex 的表現相提並論。
社群把這個現象叫作「神鬼二象性」,同一個模型,一會像神、一會像鬼,分水嶺就在 harness。另外魚皮也測了官方提供的極簡模式,這個模式只保留 shell 跟檔案編輯器兩種工具,結果性能反而暴增,被社群戲稱「邪修」(資料來源:騰訊新聞轉載魚皮實測,2026)。這告訴我們,工具不是越多越好,過度複雜的工具面有時反倒干擾模型的判斷,與其什麼都掛上去,不如幫 agent 挑選當下任務真正需要的幾把刀。
九天Hector 的 Harness VS Codex:效率翻倍、效果追平
如果說魚皮的測試證明「有 Harness 跟沒有 Harness 差很多」,九天Hector 的影片則回答「跟成熟的閉源方案比,到底誰贏」。他在 B 站發布《VS Codex 全面對比評測》,3.5 萬觀看(資料來源:九天Hector B 站影片,2026)。結論濃縮成八個字:效率翻倍、效果追平。
效率翻倍,指的是同樣任務消耗的回合數與時間,Harness 的軌跡設計讓工具呼叫更精簡,省下大量來回確認的 token。效果追平,則是產出品質至少不輸 Codex。以「追平」而非「碾壓」來形容,算是相當務實的評價。對企業決策者來說,「效率翻倍」直接反映在成本上,尤其 DeepSeek 在 2026 年 8 月 17 日調漲 API 價格,高峰時段 V4-Pro 輸出每百萬 token 從人民幣 6 元漲到 27 元(資料來源:北京商報,2026),省回合數就等於省真金白銀。
九天Hector 也點出 Codex 在 GitHub 原生 PR 工作流上的優勢,這是它深耕多年的護城河,而 Harness 的開放原始碼特性與插件自由組合,是另一種路線的吸引力。兩個工具的最終選擇,取決於你的團隊是開發者密集型還是自動化密集型。
我們用 Hermes 對照 dsh:穩定比酷更重要
看完兩個創作者的實測,回到我們自己的第一手對照。替代方案有限公司長期使用 Hermes Agent,它提供多平台 gateway、profiles、cron 排程與 tool calling,是我們顧問業務的主力工具。dsh 發布後,社群已經有人把 dsh 整合進 Hermes,當作 delegated coding engine,每次呼叫約 0.30 美元(資料來源:Reddit r/PiCodingAgent,2026)。
我們實際上機跑了一輪,優點確實明顯:插件概念徹底,session log 的 trajectory 可以回放、搜尋、重跑,除錯體驗很舒服。但 0.1 版的不穩定也同樣明顯,安裝第三方插件時遇到權限提示不夠清楚,正好對應到 Windows 用戶被刪 400GB 檔案的案例(資料來源:什麼值得買整理阿江 B 站影片,2026)。
從台灣企業的落地角度來看,我們會把 harness 的選型拆成三件事:權限安全、成本結構、生態成熟度。權限安全是最硬的一條線,任何 agent 在上生產環境前,必須先做完整的權限盤點,這是 400G 事故教訓換來的。成本結構要搭配漲價後的新牌價重新試算,原本算好的專案預算可能已經失真。生態成熟度則要看團隊自己有沒有能力維護插件,而不是看星數。我們的結論是,dsh 值得追,但現階段建議在沙盒環境跑兩週,把 trajectory 調出來驗證,再談正式導入。穩定性永遠大於話題性。
整理三組對照實驗的結論:
- sentdex 對照:同一 V4 Flash,陽春工具 44/89 題,完整 Harness 64/89 題,差距 20 題。
- 魚皮對照:同一 V4 Pro 裸接 Codex 連直線都畫不對,換 Harness 對標 Claude,極簡模式反而性能暴增。
- 九天Hector 對照:Harness 對決 Codex,效率翻倍、效果追平,GitHub PR 工作流仍是 Codex 的強項。
回到這一章的標題:同一模型有無 Harness 差距多大?答案是直接反映在成績單上,44 題對 64 題,畫不出直線對上比肩 Claude。Harness 不是魔法,它是把模型能力兌現的基礎設施。對台灣開發者來說,好消息是現在有繁體中文與簡體中文的實測內容可以參考,壞消息是 0.1 版本離生產線還有距離。我們會在系列文後段繼續討論成本與安全性,把導入決策需要的數據補齊。
4 天 129K 星背後的另一面:400G 刪檔事故、漲價衝擊與品牌紅利質疑
DeepSeek Harness 從 27.5K 星暴漲到 129K 星只花了四天,表面上是 2026 年最亮眼的開源發布之一。但這股狂潮底下,真實發生過刪掉使用者 400G 檔案的安全事故,同一天 API 調漲最高 5 倍,國際社群則拋出「換個牌子可能連 1K 星都沒有」的尖銳質疑。本章不談口號,把事故、帳單與批評攤開來看。
真實事故:符號連結解析錯誤,G 盤 400G 檔案人間蒸發
先講最嚴重的事。根據什麼值得買的報導(什麼值得買,2026),一名 Windows 使用者安裝插件時,DSH 在處理符號連結的引號與路徑解析時發生錯誤,誤把 G 盤根目錄當成目標,連同約 400G 的檔案一起刪除。更關鍵的是當時 Harness 以 Full access 完全訪問權限執行,刪除前沒有二次確認,也沒有進資源回收筒,等於直接人間蒸發。這個案例最早由 B 站創作者阿江在實測影片中揭露(阿江實測影片,2026)。
對企業來說,這不是單一使用者的悲劇,而是導入前的安全紅線。任何 agent 框架只要具備檔案編輯與 shell 執行能力,等於拿到一台電腦的鑰匙。權限盤點、路徑驗證、刪除前確認與回收筒機制,缺一不可。0.1 版的 developer preview 階段就發生這類事故,也回應了官方在 README 中自己承認的「THERE WILL BE COMPATIBILITY-BREAKING CHANGES」。換句話說,現在把這個工具接進正式環境,等於讓一個還在施工中的機器手臂碰生產線。
8/17 漲價:V4-Pro 輸出從 6 元跳到 27 元,低價敘事動搖
事故之外,開發者最有感的可能是帳單。DeepSeek 在發布 Harness 的同時宣布 API 調漲,8/17 00:00 生效(北京商報,2026)。V4-Pro 高峰時段輸出價格從每百萬 token 6 元漲到 27 元,漲幅 350%;離峰也要 13.5 元,漲幅 225%。V4-Flash 同樣調漲 50% 到 150%,高峰時段訂在上午九點到十二點、下午兩點到六點(北京時間)。華爾街見聞(2026)也報導了這波調價,並且點出峰谷定價的用意是引導開發者把非即時任務挪到離峰執行。
這波漲價讓「DeepSeek 等於便宜」的敘事開始動搖。過去台灣開發者把 DeepSeek 當作成本最低的 API 選項,如今峰谷定價引入之後,成本估算變得複雜。若再加上自家 Harness 宣稱的緩存命中率優勢,官方顯然想引導開發者留在自家工具鏈,用省下來的 token 抵銷漲價。但 V2EX 上有開發者不買帳,直言「緩存命中率高有什麼用,和能力沒啥關係」(V2EX,2026),漲價能不能被功能抵銷,還需要更多實測數據支撐。對靠 DeepSeek API 做產品的團隊來說,這不是 6 元漲到 27 元的算術題,而是商業模式還成不成立的戰略題。
國際社群冷眼:從「這是什麼」到「跟其他 harness 差不多」
中國社群一片火熱,國際社群則理性得多。Hacker News 上這篇討論拿到 731 分、292 則留言(Hacker News,2026),作者崔添翼親自回應「early developer preview, expect breaking changes」。底下留言卻很老實,有人說 README 太簡陋,「But like, what is it? Odd that this reached #1」;有人讀完 Cordis 論文後評論「looked just like every other harness」;也有人批評 npm/Node.js 生態是「npm slop」,並把 Cordis 插件系統類比成 Eclipse OSGi,感嘆「每一代人都在重新發明一次輪子」。
Reddit 的討論同樣分歧。r/DeepSeek(2026)有人熱情讚嘆「這是 agent harness 界的 VS Code」,r/PiCodingAgent 卻在討論 DeepSeek Harness 跟 pi 是不是已經收斂到同一套哲學,換句話說,同質化質疑正在蔓延。OpenCode 免費接 DeepSeek V4 Flash、提供 1M 上下文,也常被拿來當作「何必用 dsh」的替代答案。還有開發者直言「用這個不如用 pi」,認為 dsh 現階段只是把別人做過的事重新包裝。
品牌紅利質疑:非 DeepSeek 出品,可能連 1K 星都沒有
所有批評裡最犀利的來自 V2EX:一位開發者直言「上線 3 天 100K 星,這產品如果不是 DeepSeek 出的,連 1K 也不會有。初期吃品牌紅利,後期靠實力」(V2EX,2026)。這句話點出一個殘酷現實:GitHub 星數在某種程度上是品牌信任狀,DeepSeek 三個字帶來的流量與情感加成,遠超過任何獨立開源專案能獲得的關注。24 小時內社區冒出 1300 多個插件 repo,這裡面有多少是跟風、多少是真正可用,需要時間篩選。對比之下,同樣具備插件架構的 Prime Agent 累積到 16.5K 星花了多久,而 dsh 四天就拿到 129K,星數的參考價值必須打個折扣。
同樣的質疑也指向定位:有人認為 dsh 與其說是 coding agent,不如說是一個開發框架,距離「裝好就能用」的產品還很遠。V2EX 使用者抱怨命令列跑 Web UI 對一般客戶不友善、有「小作坊感」;200k 上下文以上 UI 卡頓、多模態圖片體驗差,這些都是 0.1 版的原罪。智東西的報導中也提到內測成員對「開發框架還是 coding agent」的定位存在異議,官方自己的說法都不夠清楚,外界自然更難判斷。
小結:紅利會退,事故與帳單不會
回到本章標題:四天 129K 星是事實,400G 刪檔事故是事實,輸出價格從 6 元漲到 27 元也是事實,非 DeepSeek 出品可能沒人理的品牌紅利質疑同樣是事實。對台灣企業而言,星數是信心指標,事故才是決策依據。下一篇我們將聚焦安全紅線,把權限管理與導入前的自查清單整理出來。
替代方案有限公司觀點:企業導入前先做權限盤點,再談 Harness 遷移
四天 129K 顆星確實是 2026 年最現象級的開源發布之一,但我們在幫客戶做技術顧問時,從來不看星數下決策。前一章提到的那起 400G 刪檔事故,才是真正值得企業停下來想三秒的訊號。一個 Windows 用戶在安裝插件時,因為符號連結的引號與路徑解析錯誤,DSH 直接刪掉了 G 盤根目錄約 400G 的檔案,當下用的是 Full access 權限、沒有二次確認、也沒進回收站(來源:什麼值得買)。這不是個案式的操作失誤,它同時踩中了三個企業資安最忌諱的坑:權限過大、路徑解析不可信、破壞性操作無防護。
所以我們在這一章把話說白:企業導入 DeepSeek Harness 之前,先做權限盤點,再談遷移。工具可以換,資料沒了就是沒了。以下三個檢查項目,是我們在 Hermes 導入經驗與 dsh 原始碼審查基礎上,建議客戶在 PoC 之前就完成的功課。
第一件事:Full access 權限必須關閉,改用具名帳號與目錄白名單
400G 刪檔事故發生的環境是「Full access 權限+無二次確認」。這兩個條件同時存在,任何 agent 框架都可能釀災,不只是 dsh。企業導入時的務實做法是:
- 禁止讓 agent 以管理員權限啟動。無論是 Windows 的 Administrator 還是 Linux 的 root,都應該被列為禁止項目。agent 需要的不是系統最高權限,而是「剛好夠用」的目錄存取範圍。
- 為每個專案建立獨立的使用者帳號。讓 dsh 或任何 harness 只對特定工作目錄有寫入權限,例如
/srv/agents/project-a,而不是整個家目錄或整顆硬碟。 - 刪除與覆寫操作必須有二次確認。就算 dsh 0.1 版沒有內建這個機制,企業也可以透過外層的檔案系統權限或備援策略來補強,例如把 agent 的執行環境放進容器或虛擬機,讓它根本摸不到實體磁碟。
我們在 Hermes 的實務經驗是,權限設計花一個下午,勝過事後花三天救資料。這不是口號,是每一次幫客戶做 agent 導入時的第一個工作項目。
第二件事:符號連結路徑必須逐一驗證,Windows 環境尤其要小心
dsh 這起事故的技術根源是符號連結解析錯誤。Windows 的符號連結與 Linux 的 symlink 行為不同,引號處理、路徑分隔符號、權限繼承規則都有差異,而 dsh 目前是 developer preview,官方自己都說「THERE WILL BE COMPATIBILITY-BREAKING CHANGES」。
企業導入前的路徑檢查清單,我們建議至少包含以下項目:
- 盤點所有會被 agent 觸及的符號連結,記錄其實際指向的絕對路徑。
- 確認 agent 的工作目錄中沒有任何指向系統根目錄、使用者設定檔目錄或共用磁碟區的連結。
- 在 Windows 環境額外測試含空格與中文的目錄名稱,確認 dsh 的引號處理不會把路徑切錯。
- 建立路徑變更的變更管理流程,任何新增的符號連結都必須經過審核。
這些步驟看起來繁瑣,但我們對客戶說得很直接:導入一個 0.1 版的框架,本來就該付出比成熟工具更多的驗證成本。不想付這個成本,那就等 0.5 或 1.0 再進來,這也是一種理性的決策。
第三件事:峰谷定價下的成本試算表,現在就要建立
2026 年 8 月 17 日起,DeepSeek API 價格大幅調整,V4-Pro 的高峰輸出價格從每百萬 token 6 元漲到 27 元,漲幅 350%,空閒時段也漲了 225%;V4-Flash 漲幅落在 50% 到 150% 之間,高峰時段為北京時間 9:00 到 12:00 與 14:00 到 18:00(來源:北京商報、華爾街見聞)。這意味著「用 DeepSeek 省成本」的舊敘事需要重新計算。
我們建議企業建立一張簡單的試算表,至少包含以下欄位:
| 工作負載類型 | 每日高峰時段呼叫量(百萬 token) | 每日離峰時段呼叫量(百萬 token) | 高峰成本(元) | 離峰成本(元) |
|---|---|---|---|---|
| 程式碼產生與修改 | 2.5 | 1.0 | 67.5 | 13.5 |
| 程式碼審查與解釋 | 0.8 | 2.2 | 21.6 | 29.7 |
| 測試案例產生 | 1.2 | 0.5 | 32.4 | 6.75 |
把既有的開發流程拆成「可排程」與「不可排程」兩類,將大量批次任務挪到離峰時段執行,是吸收漲價衝擊最直接的手段。另外,dsh 主打的高快取命中率確實能降低實際支出,但快取命中率跟輸出品質是兩件事,V2EX 上已經有人點出「快取命中率高有什麼用,和能力沒啥關係」,企業試算時不該把快取省下的錢當作必然實現的效益(來源:V2EX 討論)。
我們自己的選擇:Hermes 續用,dsh 進沙箱實驗
過去這段時間,我們在內部同時跑 Hermes 與 dsh。目前的結論是:Hermes 繼續擔任正式工作負載的執行環境,dsh 留在沙箱與旁路實驗。理由有三個。第一,dsh 的 0.1 版穩定性還不足以支撐我們對客戶的服務承諾,UI 在 200k 上下文以上會卡頓,多模態圖片體驗也還沒到位。第二,我們需要的是可以排程、可監控、可設定的成熟工作流,Hermes 的多平台 gateway、profiles 與 cron 機制滿足了這些需求,而且社群已經有人成功把 dsh 整合進 Hermes 當作 delegated coding engine,這條路線對我們來說是「兩全其美」而非「二選一」。第三,V4-Pro 漲價後,我們仍在測試透過 Hermes 管理提示詞與上下文來控制 token 消耗,這比直接更換框架更符合成本效益。
但這不代表 dsh 不值得關注。它的 Cordis 插件架構與軌跡追蹤功能確實有獨特價值,independent 實測顯示同一組 V4 Flash 權重,從自寫簡陋工具的 44/89 題進步到社區完整 harness 的 64/89 題,差距 20 題(來源:sentdex 實測)。問題不在於「dsh 好不好」,而在於「你的環境準備好了沒」。我們的建議是,先把權限盤點做完,再讓 dsh 進測試環境跑兩週,用真實的工作負載驗證,而不是用 GitHub 星數決定生產環境的歸屬。
台灣企業的落地建議:繁體中文生態是切入點,也是責任
以我們在台灣市場的觀察,繁體中文的 dsh 實測與導入文件非常少,這既是內容紅利,也是專業責任。企業決策者不該因為看不懂英文文件,就跳過安全評估直接上線。我們的做法是,把 Day 5 的安全紅線內容轉譯成繁體中文的權限自查清單,包含 Full access 關閉、符號連結路徑驗證、成本試算表建立三個步驟,提供給有導入意願的客戶作為起手式。同時我們也提醒客戶,dsh 的插件生態雖然在 24 小時內湧入超過 1300 個 repo,但品質參差不齊,任何第三方插件都應該視同未經驗證的外部程式碼,放進隔離環境測試後再考慮使用。
台灣企業沒有品牌紅利可以吃,每一個導入決策都要自己扛後果。我們的立場很清楚:星數是信心的來源,但不是安全的保證。先盤點權限、再選工具,順序對了,遷移才有意義。dsh 有機會成為重要的開發基礎設施,但那是 1.0 之後的事。現在這個時間點,與其追逐 129K 顆星的熱度,不如把企業內部的權限邊界畫清楚,這才是導入任何 agent 框架之前,唯一不會後悔的投資。
結論:Harness 選擇不是信仰題,而是權限、成本、可追蹤性的工程決策
DeepSeek Harness 在四天內衝上 129K 顆星,成為 2026 年最現象級的開源發布之一。星數這麼高,話題這麼熱,很多人會覺得「不跟上好像就落伍了」。但我們把整份研究報告讀完之後,結論很簡單:選擇 harness 不是信仰題,不是哪個陣營比較潮的問題,而是一道需要同時考量權限邊界、成本結構、可追蹤性的工程決策。星數再高,不會替你的企業扛下資料遺失的風險;社群再熱,也不會幫你吸收 API 漲價後的營運成本。
這不是要潑冷水,而是希望把決策流程具體化。接下來這五個步驟,每一項都可以在一個禮拜內執行完畢,不需要等 1.0 正式版,也不需要等生態成熟。先跑完這五關,你的團隊自然會知道答案。
第一步:用同一模型搭配不同 harness 自行跑分
多數評測文章比的是「不同模型+不同 harness」的組合,這樣比出來的結果混入了太多變數,無法回答「harness 到底貢獻了多少」這個問題。正確的做法是鎖定同一個模型,例如 V4-Pro 或 V4-Flash,然後分別接上 dsh、Claude Code、OpenCode、Prime Agent,用同一組提示詞、同一批任務跑一遍。
這方面的證據已經很清楚了。獨立評測者 sentdex 做過實測,同一組 V4 Flash 權重,用自寫的簡陋工具只解出 44/89 題,換上社群完整的 harness 之後進步到 64/89 題,整整多解出 20 題。中國知名實測者魚皮也直言,同一顆 V4-Pro 裸接 Codex 連線條都畫不對,換成 Harness 之後表現直接對標 Claude。這些案例告訴我們,harness 的品質對模型表現的影響,可能比換一顆模型的差異還大。
但別人的數據只能當參考。你的任務類型、你的提示詞風格、你的工具鏈組合都是獨一無二的,只有自己跑過才知道哪個 harness 適合你。跑分不是為了證明誰比較厲害,而是為了讓團隊對「換 harness 之後效能會差多少」這件事有實際的數字感。
第二步:檢查 append-only session log 是否滿足稽核需求
dsh 每次運行都會產出 append-only 的 session log,這份紀錄只能用新增的方式寫入,不能被修改或覆蓋,而且支援 resume、fork、search、replay 四種操作。聽起來很技術,但對企業來說,這代表一件非常重要的事:agent 做過什麼,事後都查得到。
如果你的產業需要內部稽核、客戶稽核或法規遵循,這項能力就不是加分項,而是必要條件。試想一個情境:agent 在自動化流程中誤刪了某個資料夾,如果沒有完整的操作軌跡,工程團隊只能靠記憶和推測來還原現場,這在企業環境是完全不可接受的。有 append-only log,至少能精確定位是哪個環節出了錯、當時下了什麼指令、用了什麼權限。
我們建議你把 dsh 的 session log 匯出格式,拿去給公司的資安或稽核部門看一遍,確認這份紀錄能不能對應到你們既有的稽核流程。如果答案是肯定的,那就多一個採用理由;如果答案是否定的,這個缺口就要靠其他工具補上,成本也要算進去。
第三步:驗證插件來源與權限邊界
dsh 的核心設計是「一切皆插件」,模型、工具、技能、沙箱、儲存都可以替換,這帶來了極大的彈性,也帶來了極大的風險。發布 24 小時內就出現超過 1300 個社群插件 repo,但數量不代表品質,其中混雜了多少未經驗證的程式碼,沒有人知道。
最嚴重的案例是 Windows 用戶在安裝插件時,因為符號連結的解析錯誤,加上當下使用的是 Full access 完全訪問權限,沒有二次確認、也沒有進資源回收桶,直接刪掉了 G 碟根目錄約 400G 的檔案。這不是假設性的風險,是真實發生過的事故。
所以第三關很簡單:任何第三方插件,都視同未經驗證的外部程式碼,一律先放進隔離環境測試,確認行為符合預期之後,才考慮放到正式環境。同時,權限邊界要在一開始就設定好,agent 預設不要給 Full access,需要執行高風險操作時應該設計成獨立的批准流程。這一關過不了,後面再怎麼省成本都是枉然。
第四步:計算漲價後的每任務成本
DeepSeek 在 2026 年 8 月 17 日調漲 API 價格,V4-Pro 高峰時段的輸出價格從每百萬 token 6 元漲到 27 元,漲幅高達 350%,空閒時段也漲了 225%。高峰時段定義為北京時間上午 9 點到 12 點、下午 2 點到 6 點,如果你是台灣企業,這正好涵蓋大部分工作時段。
這代表「用 DeepSeek 很便宜」的舊印象已經不再適用了。你必須改用「每任務成本」來評估,把每次任務平均消耗的輸入、輸出 token 數算出來,乘上新價格,加上快取命中率的影響,才是真實成本。有些開發者實測寫一個前後端專案花不到一塊錢人民幣,那是在漲價前的場景,漲價後同樣的工作量可能是三到五倍的支出。
另外要注意峰谷定價的排程效應。為了省成本,你可能會想把重負載任務避開高峰時段,但如果這會影響到團隊的工作節奏,省下來的錢是否值得,就要仔細權衡。這部分的計算,每家企業的參數都不一樣,建議用實際的 token 用量數據來做試算。
第五步:建立企業內部的安全回滾機制
dsh 目前的版本是 v0.1,官方自己在文件裡明確寫了「THERE WILL BE COMPATIBILITY-BREAKING CHANGES」,開發者社群也普遍認為要上生產環境,至少等 0.5 或 1.0 之後再說。在這種前提下,如果你決定導入,就要有完整的回滾計畫。
這不是「出了問題再想辦法」的僥倖心態,而是要把回滾路徑先寫進操作手冊。具體來說:dsh 的設定檔、插件清單、工作目錄在每次變更前都要有快照;session log 要定期備份到獨立的儲存空間;如果 dsh 升級後發現不相容,要能快速切回前一版。還沒被 dsh 取代的舊工具鏈也不要急著刪,保留一條退路,等新系統穩定運行一段時間再處理。
另外強烈建議先用小規模的專案試跑,不要一上來就把核心流程全部遷移過去。選一個非關鍵的內部工具或報告流程當作 pilot,跑個兩週,確認權限控管、log 稽核、成本估算都符合預期,再逐步擴大範圍。這樣做的好處是,就算出了問題,傷害也在可控範圍內。
替代方案有限公司的觀點
我們在台灣服務企業客戶的經驗是,一套工具能不能落地,往往不是看它的上限,而是看它的下限。dsh 的下限是 400G 刪檔事故、是 0.1 版的破壞性變更、是插件生態的良莠不齊,這些都是企業導入前必須正視的現實。
但我們也不認為因此就應該完全忽略 dsh。它的插件化架構、session log 的可追蹤性,確實是目前開源 harness 裡少見的設計。對台灣團隊來說,繁體中文的導入經驗分享非常少,這既是風險也是機會,願意花時間自己跑實測的團隊,反而能累積別人沒有的第一手數據。
如果你看完這一系列文章,正在猶豫要不要導入 dsh,我們建議你直接拿前五個步驟去執行一輪,不需要再等更多評測文章。跑完之後,你心裡對「該不該換」就會有答案。如果過程中遇到權限設計、成本估算、回滾規劃這類問題,歡迎寫信到 [email protected],我們會按照你的實際情境,陪你把導入計畫走完。
Related





