Pi Agent 是什麼?一個不滿 Claude Code 的開發者,為何會親手打造出 9.6 萬星的極簡開源 Coding Agent?

目錄
共 38 個章節
認識 Pi Agent:9.6 萬星極簡開源 Coding Agent 的產品定位與核心數據
在 2026 年 8 月的此刻,GitHub 上出現了一個值得台灣開發者關注的開源專案,名為 Pi Agent(程式庫名為 earendil-works/pi)。根據我們在 2026-08-24 透過 GitHub API 實查的數據,這個專案已累積 95,916 顆星,對於一個 2025 年 8 月才創建的 repository 來說,成長速度相當驚人。它不只是另一個炒作型的 AI 套件,而是試圖回答一個核心問題:一個前沿模型(frontier model)到底需要多少控制框架(harness)才能勝任軟體開發任務?

核心數據與產品定位:從 GitHub API 看 Pi 的本質
先從最客觀的數據切入。下表是我們在撰寫本文時,直接呼叫 GitHub API 取得的原始資料,並非轉述二手消息。
| 欄位 | 數值 | 備註 |
|---|---|---|
| Repository | earendil-works/pi | 官方正式名稱 |
| Stars | 95,916 | 2026-08-24 查證 |
| Forks | 11,864 | 2026-08-24 查證 |
| License | MIT | Copyright 2025 Mario Zechner |
| Language | TypeScript | 核心程式語言 |
| Created | 2025-08-09 | 專案成立時間 |
| Pushed | 2026-08-23 | 表示專案仍積極維護 |
| Open Issues | 133 | 單一時間點的存量 |
從官方定位來看,Pi 不把自己定位成單一工具,而是一個 AI agent toolkit(代理工具組),採用 monorepo 架構管理多個套件。官方網站於 pi.dev 提供完整文件。這個架構意味著,Pi 並非一封閉的應用程式,而是企圖成為開發者打造自主 AI 代理的底層積木。它不綁定任何單一雲端服務,也不強迫使用者進入特定編輯器,而是以極簡的方式存在於終端機(terminal)之中。
三大套件拆解:pi-ai、pi-agent-core、pi-coding-agent
Pi 的 monorepo 主要由三個套件組成,彼此分工明確。理解這三者的關係,就能掌握 Pi 的整體設計思維。
- pi-ai:這是一個統一的多供應商 LLM API 層。它的目標是讓開發者用同一套程式碼,串接 OpenAI、Anthropic、Google 等超過 20 家模型供應商,涵蓋 300 多個模型。對於想避免被單一廠商鎖定的團隊來說,這個抽象層提供了極大的彈性。無論是要切換到開源模型,或是採用不同供應商的旗艦模型,都只需要調整設定檔。
- pi-agent-core:這是 agent 的執行期(runtime),負責處理 agent 的迴圈邏輯、工具呼叫(tool calling)以及與模型的溝通。它不包含使用者介面,是純邏輯的核心,讓開發者可以在不同的前端介面上建構代理行為。
- pi-coding-agent:這是實際在終端機執行的互動式 coding agent CLI(command-line interface)。開發者直接在命令列啟動 Pi,它便能在當前目錄下讀取程式碼、編輯檔案、執行 bash 指令。整個互動過程都在終端機畫面中完成,沒有複雜的圖形介面。
這樣的拆分方式,讓 Pi 既能滿足一般開發者「開箱即用」的需求,也能滿足進階開發者「重新組裝」的渴望。如果對內建的 CLI 不滿意,你可以直接呼叫 pi-agent-core 撰寫自己的 agent 程式,這就是它作為 toolkit 的價值所在。
極簡哲學的起源:一個不滿 Claude Code 的開發者
Pi 的誕生與作者 Mario Zechner(GitHub 帳號 badlogic)有直接關係。他是知名遊戲開發框架 libGDX 的作者,也是重度 Claude Code 使用者。根據他在 個人部落格(2025-08-03)的描述,他曾撰寫 cchistory 工具來追蹤 Claude Code 的 system prompt 變更,甚至動手 patch 官方 binary。後來他得出一個結論:與其不斷適應別人的產品,不如自己寫一個。
他的核心論點在於,frontier model 已經透過強化學習(RL)被訓練成知道 coding agent 該怎麼做,開發者根本不需要準備一份 10,000 token 的 system prompt 來「提醒」模型。Pi 的設計僅提供四個工具:read、write、edit、bash,加上不到 1,000 token 的 system prompt。如果缺少某個功能,使用者可以直接問 Pi 自己寫擴充,因為 Pi 有能力讀取自己的原始碼和文件,而且擴充就是用 TypeScript 撰寫,並跑在與 agent 相同的執行程序中。
這個極簡路線在 2026 年獲得了戲劇性的驗證。根據我們的追蹤,Anthropic 為了 Claude 5 世代模型,在 2026-07 刪除了 Claude Code 80% 以上的 system prompt。這等於是官方自己承認,過去的複雜提示詞確實有大量冗餘,也證明 Pi 的方向是正確的。
第三方評測怎麼看:成本、勝率與透明度的實測
外界對 Pi 的評價,可以從幾個關鍵的第三方實測看出端倪。
- Composio 實測(2026-08-10):根據 Composio 的評測報告,他們花了 100 小時進行兩工具測試。在他們自家的工具使用評測上,Pi 以 20/30 通過,每個成功案例成本僅 $0.028。作為對照,Claude Code 是 16/30,每個成功案例成本高達 $0.195。若以成本效率計算,Pi 的優勢相當明顯。
- Reddit 社群討論:在 r/ClaudeCode 板上的熱門文章「Why I switched from Claude Code to Pi」中,許多實用主義的開發者分享了他們轉換的心路歷程。社群知名人物 IndyDevDan 更給出一個生動的比喻:Claude Code 是 starter pack,而 Pi 是 endgame。不過他也誠實表示,自己仍有 80% 的工作依靠 Claude Code 完成。
- 透明度比較:Yage.ai 的分析(2026-05-18)指出,Pi 最大的差異點在於透明度。Claude Code 的子代理(sub-agents)你只能看到結果,但 Pi 的每一個決策與動作都清楚呈現在終端機上,這對於需要精準掌控流程的開發者來說至關重要。
「Claude Code 是 starter pack,Pi 是 endgame。」IndyDevDan 的這句話,精準點出了兩者在開發者心中的定位差異。
關鍵風險:沒有內建權限系統
在讚揚之餘,我們必須嚴肅看待 Pi 的設計抉擇。官方 README 明確表示,Pi 不內建權限系統,預設以啟動者的權限執行所有指令。這代表如果使用者以管理員身分在終端機執行 Pi,Pi 就擁有整個系統的完整控制權。對於企業環境而言,這是一個需要嚴肅評估的風險點。
原廠提供的解法是自行 containerize(容器化),官方文件提到可透過 Gondolin 擴充、Plain Docker,或是 OpenShell 三種模式進行隔離。這個做法賦予極大的自由度,但也將安全責任完全轉移到使用者身上。相較於 Claude Code 內建的權限控管,Pi 的作法對開發者友善,卻對管理者不夠友善。
把視角拉回台灣市場。對於預算有限、又希望採用 AI Agent 來提升效率的中小企業(SME)來說,Pi 的 MIT 授權加上按用量計費(pay-per-token)的商業模式,確實比每個月 $20 美元起跳的訂閱制更具吸引力。但導入前必須先盤點內部技術人力是否足夠。如果你的團隊有人熟悉 Docker 與終端機操作,Pi 會是極具成本效益的選項;反之,則需審慎考量權限管理可能帶來的資安風險。我們在後續章節會針對「Pi vs Hermes」的定位差異進行更深入的探討,協助讀者判斷哪種工具更適合自己的工作流程。
不滿 Claude Code 的開發者:Mario Zechner 為何動手寫自己的 Agent
在開源遊戲開發圈,Mario Zechner(網路暱稱 badlogic)這個名字並不陌生。他是 libGDX 的作者,一款在 Java 生態系中廣為使用的跨平台遊戲開發框架。從遊戲引擎到 AI Agent,看似跳躍的職涯路線,其實共享同一種思維模式:當現有工具無法滿足需求,就動手打造自己的。

Zechner 曾經是 Claude Code 的重度使用者,重度到什麼程度?他自行撰寫了 cchistory 這款工具,用來追蹤 Claude Code system prompt 的每一次變更,甚至直接動手 patch 官方 binary,只為了讓工具更符合自己的使用習慣。這種做法在一般開發者眼中已是極致,但 Zechner 最終還是選擇離開。
從重度使用者到出走者
Zechner 的出走並非一時衝動。他在 2025-08-03 發表的文章 cchistory 中,記錄了自己對 Claude Code 的觀察。他發現官方持續調整 system prompt,卻未提供任何版本紀錄,於是他自己動手記錄。這種對透明度的執著,成為他日後設計 Pi 的核心價值。
真正讓他決定 quit 的關鍵,在於他對「frontier model 到底需要多少提示詞」的思考。Claude Code 使用上萬 token 的 system prompt 來約束模型行為,但 Zechner 認為,訓練完成的 frontier model 早已內化 coding agent 該有的行為模式,根本不需要如此龐大的提示詞。他的結論是:模型真正需要的工具,只有 read、write、edit、bash 這四個。
Pi 的誕生:極簡主義的極致實踐
2025-08-09,Zechner 在 GitHub 上建立了 earendil-works/pi 這個儲存庫。他取名 Pi 的用意,居然是要「讓別人 Google 不到」這個專案,這種低調的態度與專案日後的爆紅形成強烈對比。截至 2026-08-24,Pi 已累積 95,916 顆星、11,864 個 fork,授權為 MIT,主要語言是 TypeScript(資料來源:GitHub API,2026-08-24)。
Pi 的設計哲學可以濃縮成一句話:用不到 1,000 token 的 system prompt 與四個工具,做到與 Claude Code 同等級的事。沒有 MCP 內建、沒有權限系統、沒有子代理,一切都維持在最小可行狀態。Zechner 甚至說,缺功能時與其等官方更新,不如直接問 Pi 自己,因為 Pi 可以讀自己的原始碼與文件,擴充功能以 TypeScript 撰寫,運行在 agent 迴圈的同一個執行程序中。
這個極簡路線獲得了第三方驗證。Composio 在 2026-08-10 發布的實測報告(來源)顯示,在自家工具使用評測上,Pi 以 20/30 通過、每個成功成本 $0.028,對比 Claude Code 的 16/30、$0.195。這意味著 Pi 不僅通過率更高,成本更是只有五分之一左右。
更具說服力的認證來自 Anthropic 官方。2026-07 為了 Claude 5 世代模型,Anthropic 刪除了 Claude Code 80% 以上的 system prompt。官方自己朝 Pi 的方向靠攏,等於為 Zechner 的論點背書。
加入 Earendil:商業化與開源的平衡
2026-04,Zechner 宣布加入 Earendil,並在部落格文章「I’ve sold out」中說明這個決定。許多開源社群成員擔心這是否代表 Pi 會走向閉源,但事實並非如此。Pi 的核心程式碼至今仍保持 MIT 授權,Copyright 2025 Mario Zechner(資料來源:GitHub LICENSE 檔,2026-08-24)。
加入 Earendil 後,Pi 維持活躍開發,2026-08-23 仍有 push 紀錄(資料來源:GitHub API)。官方定位是 AI agent toolkit 的 monorepo,包含三大套件:pi-coding-agent(互動式 coding agent CLI)、pi-agent-core(agent runtime)、pi-ai(統一多供應商 LLM API,支援 OpenAI、Anthropic、Google 等 20+ providers、300+ 模型)。
風險與批評
Pi 的極簡設計並非沒有代價。最大的風險在於無內建權限系統,README 自己承認預設以啟動者權限執行,需要隔離就必須自行 containerize。對個人開發者來說這是彈性,對企業管理者來說卻是資安隱憂。此外,Pi 無法使用 Claude Pro 訂閱價跑 Claude 模型,必須走 API 計費,對成本敏感的使用者反而是優點。
回顧 Zechner 的旅程,他從一個不滿現狀的重度使用者,變成親自打造替代方案的開發者,最終獲得市場與官方雙重認證。這種「自己動手」的精神,正是開源社群的珍貴傳統。至於 Pi 是否適合你的工作流程,我們在後續章節會深入比較 Pi、Claude Code、Codex 與 Hermes 的定位差異。
極簡哲學拆解:read、write、edit、bash 四個工具如何扛住 Coding Agent 的工作
上一章我們談到 Pi 的誕生背景,以及它在 GitHub 上快速累積的九萬多顆星。這章要深入拆解一個許多人第一眼看到會懷疑的設計:Pi 的 system prompt 不到一千個 token,只給了模型 read、write、edit、bash 這四個工具,沒有內建 MCP,也沒有權限系統。這樣陽春的配置,憑什麼在第三方評測中交出比 Claude Code 更好的成績?答案藏在作者對前沿模型能力的深刻理解,以及一個反直覺的假設:模型也許根本不需要那麼多提示詞。

四個工具等於四個權限邊界
先看這四個工具各扛什麼責任。read 負責讀取檔案內容,write 負責建立或覆寫檔案,edit 負責針對既有檔案做精準修改,bash 則讓模型直接執行終端指令。這四者恰好構成一個 coding agent 在終端環境裡的最小操作集合:理解現況、產生變更、執行驗證。多兩個工具看似更豐富,卻會讓模型在每一步決策時多兩個選擇,選擇一多,行為就難以預測。Zechner 的設計哲學是把選擇權還給模型,而不是用大量工具與規則去框住模型。
更關鍵的是權限邊界的隱喻。Pi 沒有內建權限系統,等於這四個工具就是權限本身。read 只能看、write 和 edit 只能動檔案、bash 則擁有啟動者的完整權限。這樣的設計把安全責任明確地交給使用者,而非假裝工具層可以擋住所有風險。對照 Anthropic 在 Claude Code 裡實作的細膩權限矩陣,Pi 的態度更像是「我知道你聰明到可以做事,也聰明到可以闖禍,所以請自己把門鎖好」。
刪除八成的 system prompt:Anthropic 的間接背書
Pi 的核心論點是,前沿模型在強化學習階段,已經被訓練成一個會用工具的 agent。它不需要一萬個 token 的提示詞來提醒自己「先讀檔案再修改,執行測試再回報」。二〇二六年七月,Anthropic 為了新一代 Claude 模型,刪除了 Claude Code 八成以上的 system prompt,等於官方親自驗證了 Zechner 的方向。當模型供應商自己都發現提示詞冗餘時,Pi 的極簡路線就不再只是個人偏好,而是產業共識的先行者。
這也解釋了為什麼 Pi 不內建 MCP。MCP 是 Anthropic 提出的開放協定,用意是讓 agent 接上各種外部工具與資料源。但 Pi 的態度是:模型需要什麼能力,自然會開口問。使用者可以叫 Pi 讀自己的原始碼,再看官方文件,然後用 TypeScript 寫一支擴充套件,掛進 agent 迴圈的同一個執行程序。擴充能力不是內建,而是長在模型會寫程式這件事上。這個假設極度依賴模型能力,卻也恰好是當代前沿模型最擅長的事。
真實數據:省的不只是提示詞
Composio 在二〇二六年八月十日公布的第三方評測顯示,跑一百小時的工具使用測試中,Pi 在三十道題目裡通過二十道,每個成功案例平均成本零點零二八美元;Claude Code 通過十六道,每個成功案例成本零點一九五美元。Pi 的通過率高於 Claude Code,成本卻只有約七分之一。這份數據說明極簡提示詞的效益不只反映在行為穩定性,也直接反映在帳單上。
「Claude Code 是 starter pack,Pi 是 endgame。」IndyDevDan 這句話在社群廣為流傳,但他自己也承認八成工作仍使用 Claude Code。
評測結論其實很誠實:Claude Code 仍是多數人實際工作的日常主力。這背後的原因不是工具能力,而是生態成熟度。Claude Code 的 plan mode、子代理、內建 MCP 與權限系統,對於不想自己組裝的人來說,開箱即用的體驗還是比較省事。
缺功能就問 Pi,這才是最狠的設計
Pi 最令競爭者難受的設計,在於它把「擴充」這件事情變成一個無窮迴圈。使用者覺得缺某個功能,不必等作者釋出新版,也不必開 issue 許願。直接問 Pi:「我現在這個工作流程需要一個能批次改檔名的工具,請參考你的原始碼,幫我寫一支 extension。」模型會讀專案結構、理解 extension 的介面約定,然後產出對應的 TypeScript 檔。檔案一放,功能就長出來了。
這個機制的深層意義是,Pi 的 roadmap 不再由單一作者或公司決定,而是由每一位使用者的需求即時驅動。社群在 Reddit 上也確實這樣玩,有人把 Claude Code 的 plan mode 用 extension 補回來,有人加入子代理的雛形,有人串上外部 MCP server。社群的功能補完速度,其實比官方版本迭代還快。這讓我們看到一個新的軟體發展模式:harness 本身保持極簡,所有額外能力都長在「寫程式」這件事上面。
使用者要付出什麼代價
極簡設計的自由不是沒有代價。第一,沒有內建權限系統,代表預設就是全系統存取。開發者在自己電腦上用沒問題,但企業要導入就得自行搭配 containerization 或 sandbox。Pi 的官方文件提出 Gondolin 擴充、Plain Docker、OpenShell 三種隔離模式,問題是這些都需要技術人力去設定。對沒有 DevOps 背景的小型公司來說,這是一道不算低的門檻。
第二,Pi 無法用 Claude Pro 的訂閱價格跑 Claude 模型,必須走 API 計費。對用量小的人來說,pay-per-token 通常比月訂閱便宜,但對每天大量使用的人來說,帳單可能比二十美元的訂閱還可觀。第三,沒有 plan mode 與 sub-agents,代表複雜任務的分解與規劃,得靠使用者自己在 prompt 裡引導,或等待社群 extension 補齊。
極簡不是偷懶,是信任模型
把 Pi 與 Claude Code 的差異攤開來看,兩者的距離其實不是功能數量,而是對模型的信任程度。Anthropic 的作法比較像是小心翼翼地扶著模型走路,每一步都給提示、給限制、給確認。Zechner 的作法則是把模型丟進終端,說「你已經知道怎麼寫程式了,自己看著辦」。二〇二六年七月 Anthropic 自己砍掉八成 system prompt,等於承認過去的輔助輪裝太多。
對台灣的開發者與企業來說,這個案例的真正啟發在於:導入 AI agent 時,不必然要選擇一套功能齊全的整合型產品。先問清楚自己的團隊有沒有能力處理權限與隔離,再評估使用頻率與成本結構,才決定要用哪一種 harness。功能少一點,未必是壞事,只要模型夠聰明,缺的東西都可以自己長出來。
第三方實測:Composio 一百小時評測,Pi 以 20/30 與 1/7 成本勝過 Claude Code
官方文件寫得再漂亮,都比不上一次第三方實測來得有說服力。二〇二六年八月十日,Composio 公布了一份耗時一百小時的評測報告,把 Pi 與 Claude Code 放在自家的工具使用評測上反覆測試,比較兩者在真實工具呼叫情境下的表現。結果顯示,Pi 在三十個案例中通過二十個,Claude Code 通過十六個,Pi 以六比五的勝場數略勝一籌;更關鍵的是成本,根據 Composio 官方評測,Pi 每個成功案例的成本約為零點零二八美元,Claude Code 則需要零點一九五美元,兩者相差約七倍。這個數字迅速在開發者圈傳開,也讓原本抱持觀望態度的人開始認真思考,Pi 是否真的可以成為 Claude Code 的替代方案。

一百小時實測,數字背後的意義
Composio 的測試方式不是單一任務跑到底那麼簡單,而是涵蓋三十個不同的工具呼叫情境,模擬真實開發流程中 agent 必須讀取檔案、執行指令、解析回應、修正錯誤的完整循環。每一個案例都需要 agent 正確串接外部工具,只要中途斷掉就視為失敗。Pi 在三十個案例中通過二十個,Claude Code 通過十六個,以勝場數計算為六比五,Pi 小勝。若換算成通過率,Pi 約為六成七,Claude Code 約為五成三,兩者在正確率上的差距並不算懸殊。
| 項目 | Pi | Claude Code |
|---|---|---|
| 通過案例數 | 二十個 | 十六個 |
| 每個成功案例成本 | 零點零二八美元 | 零點一九五美元 |
| 總成本估算 | 零點五六美元 | 三點一二美元 |
總成本估算是以每個成功案例成本乘以通過數推估,Pi 約為零點五六美元,Claude Code 約為三點一二美元。當然,實際專案的費用會因任務複雜度而變動,但這個量級差異已經足以說明,Pi 在成本結構上具有明顯優勢。Composio 在報告中也註明,這些數據是以自家評估工具得出的結果,並非官方宣稱的效能保證,讀者仍應依照自己的使用情境重新驗證。
Reddit 實用派怎麼說,轉換文與爭論
成本數據是一回事,真實使用者的經驗又是另一回事。Reddit 的 r/ClaudeCode 板出現了一篇標題為〈Why I switched from Claude Code to Pi〉的轉換文,作者以實用派的角度分享自己更換主力工具的過程。文中指出,Pi 的啟動速度快、system prompt 短、沒有過多干擾,對已經熟悉命令列的開發者來說,反而更像是一把順手的工具。更重要的是,Pi 支援多供應商 API,不必被單一廠商的訂閱方案綁住,想接 OpenRouter 或本地模型都可以。
這篇文章的留言區充滿了不同意見。有人贊同成本論點,也有人認為 Pi 缺少權限系統、plan mode、sub-agents 這些功能,日常維護大型專案時還是會想回到 Claude Code。開發者 IndyDevDan 在討論串留下了一句經典評論:Claude Code 是 starter pack,Pi 是 endgame。這句話後來被許多人引用,但 IndyDevDan 自己也承認,他大約八成的工作時間仍然使用 Claude Code。這個矛盾恰恰反映了工具選擇的真實樣貌。
Claude Code 是 starter pack,Pi 是 endgame。我自己八成的工作還是用 Claude Code。
這段話點出了一個關鍵事實:評測勝出與日常主力,從來就不是同一件事。
為什麼評測贏了,日常卻不換
把 Composio 的評測結果、Reddit 的轉換文、IndyDevDan 的評論放在一起看,會發現一個有趣的現象:所有肯定 Pi 的人都沒有否認 Claude Code 依然是目前多數團隊的日常主力。原因在於,評測衡量的是特定情境下的正確率與成本,而日常開發還包含團隊協作、權限控管、除錯流程、既有工具鏈整合等因素。Pi 的設計哲學是極簡,它不內建權限系統,預設以啟動者的權限執行所有指令,想要隔離環境就得自己用 Docker 或 containerization 方案補上。對個人開發者來說這不是問題,對需要嚴格資安的企業來說,這卻可能是致命的弱點。
這個設計差異其實來自 Pi 作者 Mario Zechner 的理念。他本身就是重度 Claude Code 使用者,曾撰寫 cchistory 這個工具追蹤 Claude Code 的 system prompt 變更,甚至直接繞過官方 binary 來探索模型的運作方式。二〇二五年八月,他決定自己動手寫一個 agent,只保留 read、write、edit、bash 四個工具,配上不到一千個 token 的 system prompt,他認為 frontier model 已經被訓練到知道 coding agent 該怎麼運作,不需要一萬個 token 的提示來提醒。二〇二六年七月,Anthropic 為了 Claude 5 世代模型刪除八成以上的 Claude Code system prompt,等於替這個觀點做了官方背書。
對台灣的開發者與企業來說,Composio 這份評測的最大價值,不是告訴大家哪個工具比較好,而是提供一個清晰的參照座標。如果你的團隊熟悉命令列、用量大、對成本敏感,而且有能力自己處理容器隔離,Pi 確實值得認真考慮。如果你需要的是開箱即用、有完整權限管理與圖形介面的整合方案,Claude Code 依然是比較安穩的選擇。工具沒有絕對的優劣,只有適不適合你的情境。
競品地圖:Claude Code、Codex、Hermes、Cursor 與 Pi 的六項關鍵差異
二〇二六年的 AI coding agent 市場,已經不是「要不要用」的問題,而是「要用哪一個」的問題。打開 Hacker News 或 Reddit,每天都有新的評測、新的論戰、新的遷徙文章。對台灣的開發團隊來說,這個局面既令人興奮,也令人頭痛。興奮的是選擇很多,頭痛的是選擇太多,而且每個方案的定位、哲學、收費方式都南轅北轍。

這篇文章把市場上最常被拿來與 Pi 比較的五個方案攤開來看:Claude Code、OpenAI Codex、Hermes、Cursor,以及 OpenClaw。我們用一張定位總表先建立整體輪廓,再深入拆解 Pi 與 Hermes 的差異,解釋一個 Reddit 上廣為流傳的說法,Pi 是「OpenClaw 背後的 agent」。
六個方案的定位總覽:誰是重型機具,誰是瑞士刀
市場研究機構 MCPlato 在二〇二六年七月十日發布了一份五款 agent 的比較報告,對象涵蓋 Pi、Hermes、Codex、Claude Code 與自家產品。這份報告的切入點不是「誰比較強」,而是「誰的定位是什麼」。這個角度很關鍵,因為把 IDE 拿去跟 CLI 比、把助理拿去跟 coding harness 比,只會得到雞同鴨講的結論。
我們根據 MCPlato 的定位分類,再加上對 OpenClaw 的理解,整理出下表。這張表是整個章節的骨架,後面的討論都會圍繞它展開。
| 方案 | 定位 | 與 Pi 的關鍵差異 |
|---|---|---|
| Pi | 最小終端 harness | 四個工具、不到千個 token 的 system prompt、MIT 授權、多供應商 API |
| Claude Code | 整合式 coding 系統 | 功能齊備但較重,訂閱制收費,僅支援 Anthropic 模型 |
| OpenAI Codex | 受管 coding 產品 | 雲端執行、封閉生態,Pi 則是在本地終端完全自訂 |
| Hermes | 持久助理 | 跨頻道、有記憶、可排程;Pi 純粹專注在 coding 任務 |
| Cursor | AI IDE | 圖形介面編輯器;Pi 是命令列工具,不碰編輯器體驗 |
| OpenClaw | agent 框架 | Pi 的 agent-core 是 OpenClaw 的底層引擎,詳見後文 |
從這張表可以看出一個重要的脈絡,Pi 沒有打算跟 Cursor 競爭編輯器體驗,也沒打算跟 Codex 搶雲端托管市場。它瞄準的是一個更根本的問題:當 frontier model 已經夠聰明時,你究竟還需要多少周邊基礎設施?
IndyDevDan 在 Composio 的評測文章下方留下了一句流傳甚廣的話:「Claude Code 是 starter pack,Pi 是 endgame」。這句話很精準地捕捉了 Pi 支持者的心態。但不是所有人都需要 endgame,也不是所有團隊都有能力駕馭 endgame 等級的工具。
Pi vs Hermes:最小 harness 碰上持久助理
在所有的比較中,Pi 與 Hermes 的對比最有意思,因為兩者看似都在做「agent」,但哲學幾乎完全相反。許多台灣讀者可能對 Hermes 比較陌生,這裡先簡單說明。Hermes 由 Nous Research 推出,定位是「持久助理」。它具備跨頻道整合能力,可以接上 Slack、Discord 等通訊平台,擁有長期記憶,還能依照排程自動執行任務。換句話說,Hermes 想要成為你的數位員工,而不是你的編碼工具。
Pi 則是完全不同的生物。它是一個純粹的 coding harness,不帶聊天頻道整合、不追蹤你的行事曆、不提供跨任務記憶。它的核心就是 read、write、edit、bash 四個工具,加上極簡的 system prompt。Pi 的假設是,模型本身已經夠強,不需要一個管家在旁邊嘮叨。
MCPlato 的報告特別點出這組對比,對我們的讀者而言,這個比較不只是學術分類,它直接影響採購決策。我們把兩者的差異拆成四個面向來討論。
- 任務範圍:Hermes 是 horizontal,什麼任務都可以接;Pi 是 vertical,專注在軟體開發這條線上。如果你需要一個 agent 幫你回覆電子郵件、整理會議記錄、排定行程,Hermes 是合理的選擇。如果你的需求是「把這個 bug 修好」「幫我重構這段程式」,Pi 的專注反而是優勢。
- 記憶與脈絡:Hermes 有持久記憶,能跨 session 記住你的偏好;Pi 刻意不提供這類功能。Pi 團隊的觀點是,coding 任務的脈絡應該由版控系統與專案文件來承接,而不是由 agent 的內部狀態承接。這是一個很工程師思維的選擇。
- 整合深度:Hermes 直接與通訊平台綁定,開箱就有排程與通知;Pi 整合的是終端機與檔案系統。對習慣在命令列工作的開發者來說,Pi 的整合更直接;對非工程背景的使用者來說,Hermes 的介面更親切。
- 成本結構:Hermes 多數功能綁定 Nous 的基礎設施與模型;Pi 是 BYO-model,你可以接 OpenAI、Anthropic、Google 甚至是本地模型。成本敏感的使用者可以透過 Pi 完全掌控 token 花費。
簡言之,Pi 與 Hermes 的選擇,本質上是「你想要一個會寫程式的助理,還是想要一個很會寫程式的工具」的選擇。對我們自己的團隊來說,兩個工具我們都有實際使用經驗。我們內部跑 Hermes 處理日常營運與排程,但所有需要深度程式撰寫的工作,我們還是回到 Pi 與 Claude Code。兩者不是替代關係,而是不同層級的工具。
Reddit 之謎:為什麼有人說 Pi 是 OpenClaw 背後的 agent
在 Reddit 的 r/ClaudeCode 版上,一篇標題為「Why I switched from Claude Code to Pi」的討論串引起了不少注意。這篇貼文主要是作者分享他從 Claude Code 遷移到 Pi 的心路歷程,但留言區出現了一個讓許多人困惑的說法,有人稱 Pi 是「the agent behind OpenClaw」。這個說法乍看之下令人費解,因為 OpenClaw 與 Pi 是兩個不同的開源專案,為什麼 Pi 會是 OpenClaw 背後的 agent?
要理解這個脈絡,需要先回到 OpenClaw 的起源。OpenClaw 原本是中國市場一個 Claude Code 的替代方案,主力是提供無需信用卡的 Claude 模型存取。二〇二五年底,OpenClaw 改變方向,轉型為一個通用 agent 框架,讓使用者可以透過不同的大模型來驅動自動化任務。而 Pi 的 monorepo 中有一個套件叫做 pi-agent-core,它是一個獨立於 CLI 的 agent runtime,可以嵌入其他應用程式中。
OpenClaw 的開發者看上了 pi-agent-core 的簡潔設計,將其作為 OpenClaw 的底層 agent 引擎之一,讓使用者可以選擇以 Pi 作為執行核心,再疊加 OpenClaw 的通訊、排程與記憶層。換句話說,OpenClaw 把 Pi 視為引擎,自己則扮演車身的角色。Reddit 使用者稱 Pi 為「OpenClaw 背後的 agent」,指的就是這層嵌入關係。
這也解釋了 Pi 官方 README 中那句「缺功能?問 Pi 自己寫」的實際意義。Pi 的核心不是一個大型應用程式,而是一個可以被其他系統嵌用的模組。對台灣的開發者來說,這代表一個新的整合可能性:你不一定要把 Pi 當作終端工具來操作,你可以把它當作一個函式庫,嵌進自己的產品中。這種靈活度是 Claude Code 或 Cursor 這類封閉產品不可能提供的。
替代方案有限公司的觀點:地圖是死的,選擇是活的
看完這份競品地圖,我們想以台灣軟體圈的視角,提供幾點落地觀察。第一,市場上的工具分類看起來壁壘分明,但實際使用時界線非常模糊。Cursor 開始加入更多 terminal 功能,Claude Code 也在簡化自己的 system prompt,Pi 的社群則透過 ext 讓它長出類似 sub-agent 的能力。二〇二六年的下半場,大家其實都在互相學習。
第二,對台灣多數的中小企業來說,我們強烈建議導入任何 agent 之前,先認清自己屬於哪一種使用者。如果你們團隊有熟悉命令列的工程師,而且希望掌控每一筆 token 的流向,Pi 的極簡哲學與按用量計費結構非常適合。如果你們需要的是讓非工程師也能操作的自動化工具,Hermes 的持久助理模式可能更貼近需求。如果你們希望減輕團隊的維護負擔,Claude Code 或 Codex 的受管模式會是比較安心的選擇。
第三,也是最重要的,不要被「免費」或「開源」沖昏頭。Pi 採用 MIT 授權確實誘人,但它不內建權限系統,預設以啟動者的權限執行。我們在輔導客戶導入時,一定會要求先做好容器隔離與權限控管,再談生產力。工具本身沒有好壞,只有是否搭配了正確的治理機制。地圖終究是死的,選擇適合自己團隊路徑的智慧,才是活的那部分。
台灣企業導入 Pi 的三大考量:權限風險、containerization、pay-per-token 成本結構
前一段談到 Pi 的極簡哲學與多供應商設計,確實讓它成為一款輕巧而充滿彈性的 coding agent。但要把這套工具放進台灣企業的日常工作流程,單看功能還不夠,三個面向會直接左右導入的成敗:權限風險、容器化策略(containerization),以及按用量計費的成本結構。這三者彼此牽動,跳過任何一個,開源帶來的優勢都可能變成維運上的缺口。

權限風險:啟動者權限就是最大的暴露面
Pi 的 GitHub 官方倉庫在 README 中說得很直白,它不內建權限系統,預設以啟動者的權限執行指令。白話來說,今天你用哪一個帳號啟動 Pi,Pi 就擁有那個帳號的完整能力,可以讀寫檔案、呼叫 bash、改動系統設定。個人開發者享受這種自由度,企業卻必須先面對一個現實:萬一 agent 在正式環境刪錯目錄,或者把含客戶資料的檔案輸出到外部,開發者不能說「是工具自己做的」,法律責任還是落在公司身上。
台灣的《個人資料保護法》對企業處理個資的義務要求嚴格。當 Pi 以高權限帳號運行在開發或測試環境,任何涉及個資的檔案被讀取、被寫入 log、或被指令輸出,都是潛在的外洩路徑。MIT 授權(Copyright 2025 Mario Zechner)讓你可以自由使用、修改,甚至拿來商用,但授權條款不會替你的資料外洩背書。截至 2026 年 8 月 24 日,Pi 在 GitHub 已累積 95,916 顆星,數字確實驚人,但星數反映的是熱度,不是企業治理成熟度,這兩者要分開看。另一個容易被忽略的風險是 prompt injection,當 Pi 讀取網頁內容或外部文件時,被刻意放入的指令有可能誘導 agent 執行非預期動作,這在 agent 工具中是共通問題,Pi 也無法完全免除。
containerization:Gondolin、Plain Docker、OpenShell 三種模式的運作與取捨
權限機制的空缺,官方自己也很清楚,解法是容器化。Pi 提供三種隔離模式,分別是 Gondolin 擴充、Plain Docker、OpenShell,三者的隔離粒度與設定成本截然不同。
- Gondolin 擴充:這是官方推薦的路線,透過擴充機制把 sandbox 能力掛進 agent loop,讓每個 bash 指令都被攔截,送到隔離環境後才執行。好處是粒度最細,可以針對單一指令做管控;代價是需要花時間理解擴充 API 與容器網路設定。
- Plain Docker:把整個 Pi 工作階段包進 Docker 容器,設定最簡單,適合想快速把流程跑起來的團隊。缺點是隔離粒度較粗,一旦容器內需要存取外部資源,反而要想辦法調整掛載設定。
- OpenShell:以較輕量的方式模擬 shell 環境,適合開發者個人反覆測試,但不該被當成正式環境的防護牆。使用前必須詳讀文件,確認它守在什麼層級。
這三種模式也能混搭,Gondolin 管指令、Plain Docker 管工作階段,或者用 OpenShell 做日常開發。關鍵在於企業必須有人理解容器網路、磁碟掛載與指令攔截這幾件事。台灣中小企業若團隊只有兩三位工程師,教育訓練就要提早排進去,不能假設工具裝完就自動安全。還要留意一個常見誤區:隔離環境並非萬靈丹,若是把整個家目錄掛載進容器,或者讓容器直接存取正式資料庫,隔離效果等於沒有,等於白忙一場。
pay-per-token 成本結構:比 $20 美元月訂閱更符合台灣 SME 的用量曲線
Pi 的成本模式與 Claude Code 的訂閱制是兩條完全不同的路。Claude Code 走月費制,核心方案從 $20 美元起跳,用量超過就降速,重度使用者還得考慮 $200 美元的高用量方案。Pi 則採 pay-per-token,按每一次 API 呼叫的 token 數量收費,要接 OpenAI、Anthropic、Google 都行,也能透過 Pi 官網的文件接 OpenRouter,甚至直接跑本地模型,讓部分工作完全不產生 API 費用。需要留意的是,Pi 無法用 Claude Pro 訂閱價格呼叫 Claude 模型,要走 API 計費,對既有的訂閱使用者來說,付費邏輯需要重新適應。
第三方評測給了一個很實際的比較。Composio 在 2026 年 8 月 10 日公布實測,30 個任務中 Pi 通過 20 個,每個成功任務的成本約 $0.028;Claude Code 通過 16 個,每個成功任務約 $0.195。換算之後,Pi 的單位成功成本大約是 Claude Code 的七分之一。
Pi 每個成功任務成本約 $0.028,Claude Code 約 $0.195,Pi 約為 Claude Code 的七分之一。資料來源:Composio 實測(2026-08-10)。
台灣企業導入前,建議先把過去三個月的模型 API 用量抓出來,估算實際花費再決定要走訂閱還是按量計費。多數中小企業的用量起伏很大,可能這個月趕專案、下個月只做維護,pay-per-token 的彈性在這裡特別有優勢。再加上 OpenRouter 這類服務,台灣開發者不需要一次綁定單一海外供應商,可以依照模型表現與價格隨時切換,這對預算有限的團隊是非常實際的自由度。
至於安裝門檻,Pi 的官方 npm 套件為 @earendil-works/pi-coding-agent,一行指令就能裝好。供應鏈方面,Pi 把 npm 依賴全部鎖定版本,lockfile 被視為唯一準則,CI 流程中也會執行 npm audit。對已經熟悉 Node.js 生態的技術團隊,安裝幾乎沒有障礙,真正的學習曲線在於 prompt 設計與隔離策略的搭配。
整體而言,Pi 的三大考量其實是一體三面:權限風險要求企業先建立治理機制,容器化提供具體的防護手段,成本結構則讓導入具備商業上的合理性。若團隊有基本的容器與指令管控能力,Pi 絕對值得試;若完全沒有技術人力,那先補齊隔離知識,再談導入也不遲。
替代方案有限公司觀點:AI Agent harness 該怎麼選?我們用 Hermes 跑出來的答案
替代方案有限公司的日常,就是替台灣的中小企業把 AI Agent 裝進真實的工作流程。這個過程我們不只幫客戶選工具,自己也在第一線同時跑兩套 harness:一套是 Pi,另一套是 Hermes。跑了一個多月之後,我們最深的體會是,選 harness 不是選「最強的那個」,而是選「最不會扯後腿的那個」。每個工具都有自己的脾氣,先搞清楚任務型態,比追求最新星數更重要。
三種任務型態,三種選擇
我們參考了 MCPlato 在 2026 年 7 月發布的五款 agent 比較,該文把 Pi 定位為最小終端 harness,Hermes 是持久助理,Codex 是受管 coding 產品,Claude Code 是整合式系統。這個分類與我們自己的實測感受一致。
先說純 coding 任務。Pi 的核心是 pi-coding-agent,一個互動式 CLI,只提供 read、write、edit、bash 四個工具,system prompt 不到一千個 token。我們實際觀察,frontier model 經過 RL 訓練之後,本來就知道 coding agent 該怎麼工作,harness 塞再多提示詞只是浪費 token。Anthropic 在 2026 年 7 月為了準備 Claude 5 世代模型,刪掉了 Claude Code 超過八成的 system prompt,等於官方自己往 Pi 的方向靠。純粹寫程式、改 bug、重構,Pi 是我們的首選。
但同樣的情境換成「需要跨頻道持久記憶」,結論就翻盤了。Hermes 的強項在於記憶、跨頻道整合與排程,它能記住長期的對話脈絡,在 Slack、Discord 或其他通訊平台上持續運作。Pi 沒有聊天頻道整合,也不提供跨 session 的記憶,終端一關就歸零。我們有個客戶想把 agent 接到自家的 Discord 伺服器,
結論:Pi Agent 對你的具體意義,與三個可以立刻做的下一步
前文談到客戶想把 agent 接到 Discord 伺服器,這個案例正好濃縮了整個系列的結論:選 harness 之前,先搞清楚你的需求場景。Pi 不是萬靈丹,它不做持久記憶、不提供跨頻道整合,但它在純 coding 這條賽道上,用極簡設計打出了一場漂亮的成本與透明度戰爭。
先看數字。Pi Agent 在 2026 年 8 月 24 日於 GitHub 官方頁面上累積了 95,916 顆星、11,864 次 fork,從 2025 年 8 月 9 日創建到現在不過一年,MIT 授權、TypeScript 撰寫、原始碼公開。這個成長速度的背後,是大量開發者對過度包裝的 coding agent 感到疲倦。
Pi 的核心設計取捨可以濃縮成三句話:模型已經知道 coding agent 該怎麼做,harness 不需要一萬個 token 的提醒;權限交給使用者自己負責,要隔離就 containerize;供應商不要綁死,OpenAI、Anthropic、Google 等二十多家供應商、三百多個模型隨時可切換。Anthropic 在 2026 年 7 月為了 Claude 5 世代模型,刪掉 Claude Code 超過八成的 system prompt,等於官方認證了 Pi 的方向。
第三方實測同樣支持這個判斷。Composio 在 2026 年 8 月 10 日發布的 100 小時第三方評測中,Pi 在自家工具使用評測上 20/30 通過,每個成功案例成本 0.028 美元;Claude Code 只有 16/30,每個成功案例成本 0.195 美元(composio.dev)。Pi 的成本不到 Claude Code 的七分之一。
下一步一:安裝 pi-coding-agent 跑一輪真實任務
打開終端機執行 npm install -g @earendil-works/pi-coding-agent,設定好 API key,然後挑一個手上真正卡關的任務,不要拿 Hello World 練習。建議場景:把老專案從 CommonJS 遷移到 ESM、重構一支巢狀迴圈、修掉困擾你整個下午的 bug。
Pi 沒有 plan mode 也沒有子代理,它就是 read、write、edit、bash 四個工具輪流上陣,每一行指令都顯示在終端機裡。這種透明的執行過程,正是它跟 Claude Code 最大的差異(yage.ai,2026 年 5 月 18 日)。跑完一輪,你的感受就是最真實的評測。
下一步二:用 Composio 的 eval 框架自測兩個工具
不要只相信我們或任何評測者的結論。Composio 開放了工具使用評測框架,把日常工作最常用的兩個工具,例如檔案編輯與 git 操作,設定好任務與驗證標準,讓 Pi 跟 Claude Code 各跑一輪。比對通過率與花費,這個實驗會告訴你,在你的工作負載下誰才是真正省錢的那一個。
Composio 的 20/30 對 16/30 是在特定條件下的結果,你的數字可能不同,但親手驗證的過程比任何評測文都有說服力。記得把模型的選擇也列入變因,Pi 可以接 OpenAI、Anthropic、Google 或本地模型,不同供應商的成本與品質差異很大。
下一步三:打開帳單,算一次真實成本
Claude Pro 每個月 20 美元起,Team 方案每人每月 30 美元起,重度使用者甚至要上到 200 美元等級的方案。Pi 走 pay-per-token,用多少付多少。拿過去三個月的 API 帳單除以實際使用時數,再對照你的訂閱費,算完你就知道哪個划算。
以下提供粗略對照,數字以 Composio 2026 年 8 月評測的單次成功成本為基礎,實際費用依模型與用量調整:
| 項目 | Pi Agent | Claude Code |
|---|---|---|
| 付費方式 | pay-per-token | 訂閱制 |
| 單次成功成本 | 美金 0.028 元 | 美金 0.195 元 |
| 月費下限 | 依 API 用量,可趨近於零 | 20 美元起 |
| 模型綁定 | 多供應商自由切換 | 限 Anthropic |
風險提醒:權限管理是你的責任
這裡必須再次強調,Pi 預設沒有權限系統,它以啟動者的權限執行所有指令。你在哪個目錄執行,它就有哪個目錄的存取權,README 自己也承認這件事。部署到正式環境前,務必搭配 Docker、Gondolin 擴充或 OpenShell 做隔離。台灣的中小企業如果沒有專職技術人員,這一段請務必找熟悉 containerization 的夥伴協助,安全永遠不能省。
Pi 與 Hermes、Codex、Claude Code 的選擇沒有標準答案,重點是先動手實測。我們在替代方案有限公司(altsol.tw)提供 AI Agent 導入諮詢,涵蓋 harness 選型、權限設計與容器化落地,也協助客戶評估 Pi 與自家工作流的適配程度。無論你想自架、接本地模型,還是需要完整的 sandbox 方案,我們都能陪你走一遍。
📩 有任何問題或需要協助,歡迎聯絡我們:[email protected]
Related





