AI

Pi Agent 是什麼?一個不滿 Claude Code 的開發者,為何會親手打造出 9.6 萬星的極簡開源 Coding Agent?

2026年8月24日
9 分鐘閱讀
Pi Agent 是什麼?一個不滿 Claude Code 的開發者,為何會親手打造出 9.6 萬星的極簡開源 Coding Agent?

目錄

38 個章節

認識 Pi Agent:9.6 萬星極簡開源 Coding Agent 的產品定位與核心數據

在 2026 年 8 月的此刻,GitHub 上出現了一個值得台灣開發者關注的開源專案,名為 Pi Agent(程式庫名為 earendil-works/pi)。根據我們在 2026-08-24 透過 GitHub API 實查的數據,這個專案已累積 95,916 顆星,對於一個 2025 年 8 月才創建的 repository 來說,成長速度相當驚人。它不只是另一個炒作型的 AI 套件,而是試圖回答一個核心問題:一個前沿模型(frontier model)到底需要多少控制框架(harness)才能勝任軟體開發任務?

earendil-works/pi 的 GitHub 專案首頁,顯示 95,916 顆星與 README 開頭,是這個開源專案的入口。
earendil-works/pi 的 GitHub 專案首頁,顯示 95,916 顆星與 README 開頭,是這個開源專案的入口。

核心數據與產品定位:從 GitHub API 看 Pi 的本質

先從最客觀的數據切入。下表是我們在撰寫本文時,直接呼叫 GitHub API 取得的原始資料,並非轉述二手消息。

欄位 數值 備註
Repository earendil-works/pi 官方正式名稱
Stars 95,916 2026-08-24 查證
Forks 11,864 2026-08-24 查證
License MIT Copyright 2025 Mario Zechner
Language TypeScript 核心程式語言
Created 2025-08-09 專案成立時間
Pushed 2026-08-23 表示專案仍積極維護
Open Issues 133 單一時間點的存量

從官方定位來看,Pi 不把自己定位成單一工具,而是一個 AI agent toolkit(代理工具組),採用 monorepo 架構管理多個套件。官方網站於 pi.dev 提供完整文件。這個架構意味著,Pi 並非一封閉的應用程式,而是企圖成為開發者打造自主 AI 代理的底層積木。它不綁定任何單一雲端服務,也不強迫使用者進入特定編輯器,而是以極簡的方式存在於終端機(terminal)之中。

三大套件拆解:pi-ai、pi-agent-core、pi-coding-agent

Pi 的 monorepo 主要由三個套件組成,彼此分工明確。理解這三者的關係,就能掌握 Pi 的整體設計思維。

  • pi-ai:這是一個統一的多供應商 LLM API 層。它的目標是讓開發者用同一套程式碼,串接 OpenAI、Anthropic、Google 等超過 20 家模型供應商,涵蓋 300 多個模型。對於想避免被單一廠商鎖定的團隊來說,這個抽象層提供了極大的彈性。無論是要切換到開源模型,或是採用不同供應商的旗艦模型,都只需要調整設定檔。
  • pi-agent-core:這是 agent 的執行期(runtime),負責處理 agent 的迴圈邏輯、工具呼叫(tool calling)以及與模型的溝通。它不包含使用者介面,是純邏輯的核心,讓開發者可以在不同的前端介面上建構代理行為。
  • pi-coding-agent:這是實際在終端機執行的互動式 coding agent CLI(command-line interface)。開發者直接在命令列啟動 Pi,它便能在當前目錄下讀取程式碼、編輯檔案、執行 bash 指令。整個互動過程都在終端機畫面中完成,沒有複雜的圖形介面。

這樣的拆分方式,讓 Pi 既能滿足一般開發者「開箱即用」的需求,也能滿足進階開發者「重新組裝」的渴望。如果對內建的 CLI 不滿意,你可以直接呼叫 pi-agent-core 撰寫自己的 agent 程式,這就是它作為 toolkit 的價值所在。

極簡哲學的起源:一個不滿 Claude Code 的開發者

Pi 的誕生與作者 Mario Zechner(GitHub 帳號 badlogic)有直接關係。他是知名遊戲開發框架 libGDX 的作者,也是重度 Claude Code 使用者。根據他在 個人部落格(2025-08-03)的描述,他曾撰寫 cchistory 工具來追蹤 Claude Code 的 system prompt 變更,甚至動手 patch 官方 binary。後來他得出一個結論:與其不斷適應別人的產品,不如自己寫一個。

他的核心論點在於,frontier model 已經透過強化學習(RL)被訓練成知道 coding agent 該怎麼做,開發者根本不需要準備一份 10,000 token 的 system prompt 來「提醒」模型。Pi 的設計僅提供四個工具:read、write、edit、bash,加上不到 1,000 token 的 system prompt。如果缺少某個功能,使用者可以直接問 Pi 自己寫擴充,因為 Pi 有能力讀取自己的原始碼和文件,而且擴充就是用 TypeScript 撰寫,並跑在與 agent 相同的執行程序中。

這個極簡路線在 2026 年獲得了戲劇性的驗證。根據我們的追蹤,Anthropic 為了 Claude 5 世代模型,在 2026-07 刪除了 Claude Code 80% 以上的 system prompt。這等於是官方自己承認,過去的複雜提示詞確實有大量冗餘,也證明 Pi 的方向是正確的。

第三方評測怎麼看:成本、勝率與透明度的實測

外界對 Pi 的評價,可以從幾個關鍵的第三方實測看出端倪。

  • Composio 實測(2026-08-10):根據 Composio 的評測報告,他們花了 100 小時進行兩工具測試。在他們自家的工具使用評測上,Pi 以 20/30 通過,每個成功案例成本僅 $0.028。作為對照,Claude Code 是 16/30,每個成功案例成本高達 $0.195。若以成本效率計算,Pi 的優勢相當明顯。
  • Reddit 社群討論:在 r/ClaudeCode 板上的熱門文章「Why I switched from Claude Code to Pi」中,許多實用主義的開發者分享了他們轉換的心路歷程。社群知名人物 IndyDevDan 更給出一個生動的比喻:Claude Code 是 starter pack,而 Pi 是 endgame。不過他也誠實表示,自己仍有 80% 的工作依靠 Claude Code 完成。
  • 透明度比較:Yage.ai 的分析(2026-05-18)指出,Pi 最大的差異點在於透明度。Claude Code 的子代理(sub-agents)你只能看到結果,但 Pi 的每一個決策與動作都清楚呈現在終端機上,這對於需要精準掌控流程的開發者來說至關重要。

「Claude Code 是 starter pack,Pi 是 endgame。」IndyDevDan 的這句話,精準點出了兩者在開發者心中的定位差異。

關鍵風險:沒有內建權限系統

在讚揚之餘,我們必須嚴肅看待 Pi 的設計抉擇。官方 README 明確表示,Pi 不內建權限系統,預設以啟動者的權限執行所有指令。這代表如果使用者以管理員身分在終端機執行 Pi,Pi 就擁有整個系統的完整控制權。對於企業環境而言,這是一個需要嚴肅評估的風險點。

原廠提供的解法是自行 containerize(容器化),官方文件提到可透過 Gondolin 擴充、Plain Docker,或是 OpenShell 三種模式進行隔離。這個做法賦予極大的自由度,但也將安全責任完全轉移到使用者身上。相較於 Claude Code 內建的權限控管,Pi 的作法對開發者友善,卻對管理者不夠友善。

把視角拉回台灣市場。對於預算有限、又希望採用 AI Agent 來提升效率的中小企業(SME)來說,Pi 的 MIT 授權加上按用量計費(pay-per-token)的商業模式,確實比每個月 $20 美元起跳的訂閱制更具吸引力。但導入前必須先盤點內部技術人力是否足夠。如果你的團隊有人熟悉 Docker 與終端機操作,Pi 會是極具成本效益的選項;反之,則需審慎考量權限管理可能帶來的資安風險。我們在後續章節會針對「Pi vs Hermes」的定位差異進行更深入的探討,協助讀者判斷哪種工具更適合自己的工作流程。

不滿 Claude Code 的開發者:Mario Zechner 為何動手寫自己的 Agent

在開源遊戲開發圈,Mario Zechner(網路暱稱 badlogic)這個名字並不陌生。他是 libGDX 的作者,一款在 Java 生態系中廣為使用的跨平台遊戲開發框架。從遊戲引擎到 AI Agent,看似跳躍的職涯路線,其實共享同一種思維模式:當現有工具無法滿足需求,就動手打造自己的。

earendil-works/pi 的 Releases 頁,可以看到 Pi 的版本發布歷史,最新版號與更新重點都在這裡。
earendil-works/pi 的 Releases 頁,可以看到 Pi 的版本發布歷史,最新版號與更新重點都在這裡。

Zechner 曾經是 Claude Code 的重度使用者,重度到什麼程度?他自行撰寫了 cchistory 這款工具,用來追蹤 Claude Code system prompt 的每一次變更,甚至直接動手 patch 官方 binary,只為了讓工具更符合自己的使用習慣。這種做法在一般開發者眼中已是極致,但 Zechner 最終還是選擇離開。

從重度使用者到出走者

Zechner 的出走並非一時衝動。他在 2025-08-03 發表的文章 cchistory 中,記錄了自己對 Claude Code 的觀察。他發現官方持續調整 system prompt,卻未提供任何版本紀錄,於是他自己動手記錄。這種對透明度的執著,成為他日後設計 Pi 的核心價值。

真正讓他決定 quit 的關鍵,在於他對「frontier model 到底需要多少提示詞」的思考。Claude Code 使用上萬 token 的 system prompt 來約束模型行為,但 Zechner 認為,訓練完成的 frontier model 早已內化 coding agent 該有的行為模式,根本不需要如此龐大的提示詞。他的結論是:模型真正需要的工具,只有 read、write、edit、bash 這四個。

Pi 的誕生:極簡主義的極致實踐

2025-08-09,Zechner 在 GitHub 上建立了 earendil-works/pi 這個儲存庫。他取名 Pi 的用意,居然是要「讓別人 Google 不到」這個專案,這種低調的態度與專案日後的爆紅形成強烈對比。截至 2026-08-24,Pi 已累積 95,916 顆星、11,864 個 fork,授權為 MIT,主要語言是 TypeScript(資料來源:GitHub API,2026-08-24)。

Pi 的設計哲學可以濃縮成一句話:用不到 1,000 token 的 system prompt 與四個工具,做到與 Claude Code 同等級的事。沒有 MCP 內建、沒有權限系統、沒有子代理,一切都維持在最小可行狀態。Zechner 甚至說,缺功能時與其等官方更新,不如直接問 Pi 自己,因為 Pi 可以讀自己的原始碼與文件,擴充功能以 TypeScript 撰寫,運行在 agent 迴圈的同一個執行程序中。

這個極簡路線獲得了第三方驗證。Composio 在 2026-08-10 發布的實測報告(來源)顯示,在自家工具使用評測上,Pi 以 20/30 通過、每個成功成本 $0.028,對比 Claude Code 的 16/30、$0.195。這意味著 Pi 不僅通過率更高,成本更是只有五分之一左右。

更具說服力的認證來自 Anthropic 官方。2026-07 為了 Claude 5 世代模型,Anthropic 刪除了 Claude Code 80% 以上的 system prompt。官方自己朝 Pi 的方向靠攏,等於為 Zechner 的論點背書。

加入 Earendil:商業化與開源的平衡

2026-04,Zechner 宣布加入 Earendil,並在部落格文章「I’ve sold out」中說明這個決定。許多開源社群成員擔心這是否代表 Pi 會走向閉源,但事實並非如此。Pi 的核心程式碼至今仍保持 MIT 授權,Copyright 2025 Mario Zechner(資料來源:GitHub LICENSE 檔,2026-08-24)。

加入 Earendil 後,Pi 維持活躍開發,2026-08-23 仍有 push 紀錄(資料來源:GitHub API)。官方定位是 AI agent toolkit 的 monorepo,包含三大套件:pi-coding-agent(互動式 coding agent CLI)、pi-agent-core(agent runtime)、pi-ai(統一多供應商 LLM API,支援 OpenAI、Anthropic、Google 等 20+ providers、300+ 模型)。

風險與批評

Pi 的極簡設計並非沒有代價。最大的風險在於無內建權限系統,README 自己承認預設以啟動者權限執行,需要隔離就必須自行 containerize。對個人開發者來說這是彈性,對企業管理者來說卻是資安隱憂。此外,Pi 無法使用 Claude Pro 訂閱價跑 Claude 模型,必須走 API 計費,對成本敏感的使用者反而是優點。

回顧 Zechner 的旅程,他從一個不滿現狀的重度使用者,變成親自打造替代方案的開發者,最終獲得市場與官方雙重認證。這種「自己動手」的精神,正是開源社群的珍貴傳統。至於 Pi 是否適合你的工作流程,我們在後續章節會深入比較 Pi、Claude Code、Codex 與 Hermes 的定位差異。

極簡哲學拆解:read、write、edit、bash 四個工具如何扛住 Coding Agent 的工作

上一章我們談到 Pi 的誕生背景,以及它在 GitHub 上快速累積的九萬多顆星。這章要深入拆解一個許多人第一眼看到會懷疑的設計:Pi 的 system prompt 不到一千個 token,只給了模型 read、write、edit、bash 這四個工具,沒有內建 MCP,也沒有權限系統。這樣陽春的配置,憑什麼在第三方評測中交出比 Claude Code 更好的成績?答案藏在作者對前沿模型能力的深刻理解,以及一個反直覺的假設:模型也許根本不需要那麼多提示詞。

pi.dev 官方網站首頁,標語「There are many agent harnesses but this one is yours」,提供 curl、npm 等多種安裝方式。
pi.dev 官方網站首頁,標語「There are many agent harnesses but this one is yours」,提供 curl、npm 等多種安裝方式。

四個工具等於四個權限邊界

先看這四個工具各扛什麼責任。read 負責讀取檔案內容,write 負責建立或覆寫檔案,edit 負責針對既有檔案做精準修改,bash 則讓模型直接執行終端指令。這四者恰好構成一個 coding agent 在終端環境裡的最小操作集合:理解現況、產生變更、執行驗證。多兩個工具看似更豐富,卻會讓模型在每一步決策時多兩個選擇,選擇一多,行為就難以預測。Zechner 的設計哲學是把選擇權還給模型,而不是用大量工具與規則去框住模型。

更關鍵的是權限邊界的隱喻。Pi 沒有內建權限系統,等於這四個工具就是權限本身。read 只能看、write 和 edit 只能動檔案、bash 則擁有啟動者的完整權限。這樣的設計把安全責任明確地交給使用者,而非假裝工具層可以擋住所有風險。對照 Anthropic 在 Claude Code 裡實作的細膩權限矩陣,Pi 的態度更像是「我知道你聰明到可以做事,也聰明到可以闖禍,所以請自己把門鎖好」。

刪除八成的 system prompt:Anthropic 的間接背書

Pi 的核心論點是,前沿模型在強化學習階段,已經被訓練成一個會用工具的 agent。它不需要一萬個 token 的提示詞來提醒自己「先讀檔案再修改,執行測試再回報」。二〇二六年七月,Anthropic 為了新一代 Claude 模型,刪除了 Claude Code 八成以上的 system prompt,等於官方親自驗證了 Zechner 的方向。當模型供應商自己都發現提示詞冗餘時,Pi 的極簡路線就不再只是個人偏好,而是產業共識的先行者。

這也解釋了為什麼 Pi 不內建 MCP。MCP 是 Anthropic 提出的開放協定,用意是讓 agent 接上各種外部工具與資料源。但 Pi 的態度是:模型需要什麼能力,自然會開口問。使用者可以叫 Pi 讀自己的原始碼,再看官方文件,然後用 TypeScript 寫一支擴充套件,掛進 agent 迴圈的同一個執行程序。擴充能力不是內建,而是長在模型會寫程式這件事上。這個假設極度依賴模型能力,卻也恰好是當代前沿模型最擅長的事。

真實數據:省的不只是提示詞

Composio 在二〇二六年八月十日公布的第三方評測顯示,跑一百小時的工具使用測試中,Pi 在三十道題目裡通過二十道,每個成功案例平均成本零點零二八美元;Claude Code 通過十六道,每個成功案例成本零點一九五美元。Pi 的通過率高於 Claude Code,成本卻只有約七分之一。這份數據說明極簡提示詞的效益不只反映在行為穩定性,也直接反映在帳單上。

「Claude Code 是 starter pack,Pi 是 endgame。」IndyDevDan 這句話在社群廣為流傳,但他自己也承認八成工作仍使用 Claude Code。

評測結論其實很誠實:Claude Code 仍是多數人實際工作的日常主力。這背後的原因不是工具能力,而是生態成熟度。Claude Code 的 plan mode、子代理、內建 MCP 與權限系統,對於不想自己組裝的人來說,開箱即用的體驗還是比較省事。

缺功能就問 Pi,這才是最狠的設計

Pi 最令競爭者難受的設計,在於它把「擴充」這件事情變成一個無窮迴圈。使用者覺得缺某個功能,不必等作者釋出新版,也不必開 issue 許願。直接問 Pi:「我現在這個工作流程需要一個能批次改檔名的工具,請參考你的原始碼,幫我寫一支 extension。」模型會讀專案結構、理解 extension 的介面約定,然後產出對應的 TypeScript 檔。檔案一放,功能就長出來了。

這個機制的深層意義是,Pi 的 roadmap 不再由單一作者或公司決定,而是由每一位使用者的需求即時驅動。社群在 Reddit 上也確實這樣玩,有人把 Claude Code 的 plan mode 用 extension 補回來,有人加入子代理的雛形,有人串上外部 MCP server。社群的功能補完速度,其實比官方版本迭代還快。這讓我們看到一個新的軟體發展模式:harness 本身保持極簡,所有額外能力都長在「寫程式」這件事上面。

使用者要付出什麼代價

極簡設計的自由不是沒有代價。第一,沒有內建權限系統,代表預設就是全系統存取。開發者在自己電腦上用沒問題,但企業要導入就得自行搭配 containerization 或 sandbox。Pi 的官方文件提出 Gondolin 擴充、Plain Docker、OpenShell 三種隔離模式,問題是這些都需要技術人力去設定。對沒有 DevOps 背景的小型公司來說,這是一道不算低的門檻。

第二,Pi 無法用 Claude Pro 的訂閱價格跑 Claude 模型,必須走 API 計費。對用量小的人來說,pay-per-token 通常比月訂閱便宜,但對每天大量使用的人來說,帳單可能比二十美元的訂閱還可觀。第三,沒有 plan mode 與 sub-agents,代表複雜任務的分解與規劃,得靠使用者自己在 prompt 裡引導,或等待社群 extension 補齊。

極簡不是偷懶,是信任模型

把 Pi 與 Claude Code 的差異攤開來看,兩者的距離其實不是功能數量,而是對模型的信任程度。Anthropic 的作法比較像是小心翼翼地扶著模型走路,每一步都給提示、給限制、給確認。Zechner 的作法則是把模型丟進終端,說「你已經知道怎麼寫程式了,自己看著辦」。二〇二六年七月 Anthropic 自己砍掉八成 system prompt,等於承認過去的輔助輪裝太多。

對台灣的開發者與企業來說,這個案例的真正啟發在於:導入 AI agent 時,不必然要選擇一套功能齊全的整合型產品。先問清楚自己的團隊有沒有能力處理權限與隔離,再評估使用頻率與成本結構,才決定要用哪一種 harness。功能少一點,未必是壞事,只要模型夠聰明,缺的東西都可以自己長出來。

第三方實測:Composio 一百小時評測,Pi 以 20/30 與 1/7 成本勝過 Claude Code

官方文件寫得再漂亮,都比不上一次第三方實測來得有說服力。二〇二六年八月十日,Composio 公布了一份耗時一百小時的評測報告,把 Pi 與 Claude Code 放在自家的工具使用評測上反覆測試,比較兩者在真實工具呼叫情境下的表現。結果顯示,Pi 在三十個案例中通過二十個,Claude Code 通過十六個,Pi 以六比五的勝場數略勝一籌;更關鍵的是成本,根據 Composio 官方評測,Pi 每個成功案例的成本約為零點零二八美元,Claude Code 則需要零點一九五美元,兩者相差約七倍。這個數字迅速在開發者圈傳開,也讓原本抱持觀望態度的人開始認真思考,Pi 是否真的可以成為 Claude Code 的替代方案。

Composio 的實測文章「Pi Agent vs Claude Code in 2026」,記錄一百小時實測中 Pi 以 20/30 通過、成本約為 Claude Code 的七分之一。
Composio 的實測文章「Pi Agent vs Claude Code in 2026」,記錄一百小時實測中 Pi 以 20/30 通過、成本約為 Claude Code 的七分之一。

一百小時實測,數字背後的意義

Composio 的測試方式不是單一任務跑到底那麼簡單,而是涵蓋三十個不同的工具呼叫情境,模擬真實開發流程中 agent 必須讀取檔案、執行指令、解析回應、修正錯誤的完整循環。每一個案例都需要 agent 正確串接外部工具,只要中途斷掉就視為失敗。Pi 在三十個案例中通過二十個,Claude Code 通過十六個,以勝場數計算為六比五,Pi 小勝。若換算成通過率,Pi 約為六成七,Claude Code 約為五成三,兩者在正確率上的差距並不算懸殊。

項目 Pi Claude Code
通過案例數 二十個 十六個
每個成功案例成本 零點零二八美元 零點一九五美元
總成本估算 零點五六美元 三點一二美元

總成本估算是以每個成功案例成本乘以通過數推估,Pi 約為零點五六美元,Claude Code 約為三點一二美元。當然,實際專案的費用會因任務複雜度而變動,但這個量級差異已經足以說明,Pi 在成本結構上具有明顯優勢。Composio 在報告中也註明,這些數據是以自家評估工具得出的結果,並非官方宣稱的效能保證,讀者仍應依照自己的使用情境重新驗證。

Reddit 實用派怎麼說,轉換文與爭論

成本數據是一回事,真實使用者的經驗又是另一回事。Reddit 的 r/ClaudeCode 板出現了一篇標題為〈Why I switched from Claude Code to Pi〉的轉換文,作者以實用派的角度分享自己更換主力工具的過程。文中指出,Pi 的啟動速度快、system prompt 短、沒有過多干擾,對已經熟悉命令列的開發者來說,反而更像是一把順手的工具。更重要的是,Pi 支援多供應商 API,不必被單一廠商的訂閱方案綁住,想接 OpenRouter 或本地模型都可以。

這篇文章的留言區充滿了不同意見。有人贊同成本論點,也有人認為 Pi 缺少權限系統、plan mode、sub-agents 這些功能,日常維護大型專案時還是會想回到 Claude Code。開發者 IndyDevDan 在討論串留下了一句經典評論:Claude Code 是 starter pack,Pi 是 endgame。這句話後來被許多人引用,但 IndyDevDan 自己也承認,他大約八成的工作時間仍然使用 Claude Code。這個矛盾恰恰反映了工具選擇的真實樣貌。

Claude Code 是 starter pack,Pi 是 endgame。我自己八成的工作還是用 Claude Code。

這段話點出了一個關鍵事實:評測勝出與日常主力,從來就不是同一件事。

為什麼評測贏了,日常卻不換

把 Composio 的評測結果、Reddit 的轉換文、IndyDevDan 的評論放在一起看,會發現一個有趣的現象:所有肯定 Pi 的人都沒有否認 Claude Code 依然是目前多數團隊的日常主力。原因在於,評測衡量的是特定情境下的正確率與成本,而日常開發還包含團隊協作、權限控管、除錯流程、既有工具鏈整合等因素。Pi 的設計哲學是極簡,它不內建權限系統,預設以啟動者的權限執行所有指令,想要隔離環境就得自己用 Docker 或 containerization 方案補上。對個人開發者來說這不是問題,對需要嚴格資安的企業來說,這卻可能是致命的弱點。

這個設計差異其實來自 Pi 作者 Mario Zechner 的理念。他本身就是重度 Claude Code 使用者,曾撰寫 cchistory 這個工具追蹤 Claude Code 的 system prompt 變更,甚至直接繞過官方 binary 來探索模型的運作方式。二〇二五年八月,他決定自己動手寫一個 agent,只保留 read、write、edit、bash 四個工具,配上不到一千個 token 的 system prompt,他認為 frontier model 已經被訓練到知道 coding agent 該怎麼運作,不需要一萬個 token 的提示來提醒。二〇二六年七月,Anthropic 為了 Claude 5 世代模型刪除八成以上的 Claude Code system prompt,等於替這個觀點做了官方背書。

對台灣的開發者與企業來說,Composio 這份評測的最大價值,不是告訴大家哪個工具比較好,而是提供一個清晰的參照座標。如果你的團隊熟悉命令列、用量大、對成本敏感,而且有能力自己處理容器隔離,Pi 確實值得認真考慮。如果你需要的是開箱即用、有完整權限管理與圖形介面的整合方案,Claude Code 依然是比較安穩的選擇。工具沒有絕對的優劣,只有適不適合你的情境。

競品地圖:Claude Code、Codex、Hermes、Cursor 與 Pi 的六項關鍵差異

二〇二六年的 AI coding agent 市場,已經不是「要不要用」的問題,而是「要用哪一個」的問題。打開 Hacker News 或 Reddit,每天都有新的評測、新的論戰、新的遷徙文章。對台灣的開發團隊來說,這個局面既令人興奮,也令人頭痛。興奮的是選擇很多,頭痛的是選擇太多,而且每個方案的定位、哲學、收費方式都南轅北轍。

Mario Zechner 的個人部落格文章「cchistory: Tracking Claude Code System Prompt and Tool Changes」,記錄他追蹤 Claude Code 變更的過程。
Mario Zechner 的個人部落格文章「cchistory: Tracking Claude Code System Prompt and Tool Changes」,記錄他追蹤 Claude Code 變更的過程。

這篇文章把市場上最常被拿來與 Pi 比較的五個方案攤開來看:Claude Code、OpenAI Codex、Hermes、Cursor,以及 OpenClaw。我們用一張定位總表先建立整體輪廓,再深入拆解 Pi 與 Hermes 的差異,解釋一個 Reddit 上廣為流傳的說法,Pi 是「OpenClaw 背後的 agent」。

六個方案的定位總覽:誰是重型機具,誰是瑞士刀

市場研究機構 MCPlato 在二〇二六年七月十日發布了一份五款 agent 的比較報告,對象涵蓋 Pi、Hermes、Codex、Claude Code 與自家產品。這份報告的切入點不是「誰比較強」,而是「誰的定位是什麼」。這個角度很關鍵,因為把 IDE 拿去跟 CLI 比、把助理拿去跟 coding harness 比,只會得到雞同鴨講的結論。

我們根據 MCPlato 的定位分類,再加上對 OpenClaw 的理解,整理出下表。這張表是整個章節的骨架,後面的討論都會圍繞它展開。

方案 定位 與 Pi 的關鍵差異
Pi 最小終端 harness 四個工具、不到千個 token 的 system prompt、MIT 授權、多供應商 API
Claude Code 整合式 coding 系統 功能齊備但較重,訂閱制收費,僅支援 Anthropic 模型
OpenAI Codex 受管 coding 產品 雲端執行、封閉生態,Pi 則是在本地終端完全自訂
Hermes 持久助理 跨頻道、有記憶、可排程;Pi 純粹專注在 coding 任務
Cursor AI IDE 圖形介面編輯器;Pi 是命令列工具,不碰編輯器體驗
OpenClaw agent 框架 Pi 的 agent-core 是 OpenClaw 的底層引擎,詳見後文

從這張表可以看出一個重要的脈絡,Pi 沒有打算跟 Cursor 競爭編輯器體驗,也沒打算跟 Codex 搶雲端托管市場。它瞄準的是一個更根本的問題:當 frontier model 已經夠聰明時,你究竟還需要多少周邊基礎設施?

IndyDevDan 在 Composio 的評測文章下方留下了一句流傳甚廣的話:「Claude Code 是 starter pack,Pi 是 endgame」。這句話很精準地捕捉了 Pi 支持者的心態。但不是所有人都需要 endgame,也不是所有團隊都有能力駕馭 endgame 等級的工具。

Pi vs Hermes:最小 harness 碰上持久助理

在所有的比較中,Pi 與 Hermes 的對比最有意思,因為兩者看似都在做「agent」,但哲學幾乎完全相反。許多台灣讀者可能對 Hermes 比較陌生,這裡先簡單說明。Hermes 由 Nous Research 推出,定位是「持久助理」。它具備跨頻道整合能力,可以接上 Slack、Discord 等通訊平台,擁有長期記憶,還能依照排程自動執行任務。換句話說,Hermes 想要成為你的數位員工,而不是你的編碼工具。

Pi 則是完全不同的生物。它是一個純粹的 coding harness,不帶聊天頻道整合、不追蹤你的行事曆、不提供跨任務記憶。它的核心就是 read、write、edit、bash 四個工具,加上極簡的 system prompt。Pi 的假設是,模型本身已經夠強,不需要一個管家在旁邊嘮叨。

MCPlato 的報告特別點出這組對比,對我們的讀者而言,這個比較不只是學術分類,它直接影響採購決策。我們把兩者的差異拆成四個面向來討論。

  • 任務範圍:Hermes 是 horizontal,什麼任務都可以接;Pi 是 vertical,專注在軟體開發這條線上。如果你需要一個 agent 幫你回覆電子郵件、整理會議記錄、排定行程,Hermes 是合理的選擇。如果你的需求是「把這個 bug 修好」「幫我重構這段程式」,Pi 的專注反而是優勢。
  • 記憶與脈絡:Hermes 有持久記憶,能跨 session 記住你的偏好;Pi 刻意不提供這類功能。Pi 團隊的觀點是,coding 任務的脈絡應該由版控系統與專案文件來承接,而不是由 agent 的內部狀態承接。這是一個很工程師思維的選擇。
  • 整合深度:Hermes 直接與通訊平台綁定,開箱就有排程與通知;Pi 整合的是終端機與檔案系統。對習慣在命令列工作的開發者來說,Pi 的整合更直接;對非工程背景的使用者來說,Hermes 的介面更親切。
  • 成本結構:Hermes 多數功能綁定 Nous 的基礎設施與模型;Pi 是 BYO-model,你可以接 OpenAI、Anthropic、Google 甚至是本地模型。成本敏感的使用者可以透過 Pi 完全掌控 token 花費。

簡言之,Pi 與 Hermes 的選擇,本質上是「你想要一個會寫程式的助理,還是想要一個很會寫程式的工具」的選擇。對我們自己的團隊來說,兩個工具我們都有實際使用經驗。我們內部跑 Hermes 處理日常營運與排程,但所有需要深度程式撰寫的工作,我們還是回到 Pi 與 Claude Code。兩者不是替代關係,而是不同層級的工具。

Reddit 之謎:為什麼有人說 Pi 是 OpenClaw 背後的 agent

在 Reddit 的 r/ClaudeCode 版上,一篇標題為「Why I switched from Claude Code to Pi」的討論串引起了不少注意。這篇貼文主要是作者分享他從 Claude Code 遷移到 Pi 的心路歷程,但留言區出現了一個讓許多人困惑的說法,有人稱 Pi 是「the agent behind OpenClaw」。這個說法乍看之下令人費解,因為 OpenClaw 與 Pi 是兩個不同的開源專案,為什麼 Pi 會是 OpenClaw 背後的 agent?

要理解這個脈絡,需要先回到 OpenClaw 的起源。OpenClaw 原本是中國市場一個 Claude Code 的替代方案,主力是提供無需信用卡的 Claude 模型存取。二〇二五年底,OpenClaw 改變方向,轉型為一個通用 agent 框架,讓使用者可以透過不同的大模型來驅動自動化任務。而 Pi 的 monorepo 中有一個套件叫做 pi-agent-core,它是一個獨立於 CLI 的 agent runtime,可以嵌入其他應用程式中。

OpenClaw 的開發者看上了 pi-agent-core 的簡潔設計,將其作為 OpenClaw 的底層 agent 引擎之一,讓使用者可以選擇以 Pi 作為執行核心,再疊加 OpenClaw 的通訊、排程與記憶層。換句話說,OpenClaw 把 Pi 視為引擎,自己則扮演車身的角色。Reddit 使用者稱 Pi 為「OpenClaw 背後的 agent」,指的就是這層嵌入關係。

這也解釋了 Pi 官方 README 中那句「缺功能?問 Pi 自己寫」的實際意義。Pi 的核心不是一個大型應用程式,而是一個可以被其他系統嵌用的模組。對台灣的開發者來說,這代表一個新的整合可能性:你不一定要把 Pi 當作終端工具來操作,你可以把它當作一個函式庫,嵌進自己的產品中。這種靈活度是 Claude Code 或 Cursor 這類封閉產品不可能提供的。

替代方案有限公司的觀點:地圖是死的,選擇是活的

看完這份競品地圖,我們想以台灣軟體圈的視角,提供幾點落地觀察。第一,市場上的工具分類看起來壁壘分明,但實際使用時界線非常模糊。Cursor 開始加入更多 terminal 功能,Claude Code 也在簡化自己的 system prompt,Pi 的社群則透過 ext 讓它長出類似 sub-agent 的能力。二〇二六年的下半場,大家其實都在互相學習。

第二,對台灣多數的中小企業來說,我們強烈建議導入任何 agent 之前,先認清自己屬於哪一種使用者。如果你們團隊有熟悉命令列的工程師,而且希望掌控每一筆 token 的流向,Pi 的極簡哲學與按用量計費結構非常適合。如果你們需要的是讓非工程師也能操作的自動化工具,Hermes 的持久助理模式可能更貼近需求。如果你們希望減輕團隊的維護負擔,Claude Code 或 Codex 的受管模式會是比較安心的選擇。

第三,也是最重要的,不要被「免費」或「開源」沖昏頭。Pi 採用 MIT 授權確實誘人,但它不內建權限系統,預設以啟動者的權限執行。我們在輔導客戶導入時,一定會要求先做好容器隔離與權限控管,再談生產力。工具本身沒有好壞,只有是否搭配了正確的治理機制。地圖終究是死的,選擇適合自己團隊路徑的智慧,才是活的那部分。

台灣企業導入 Pi 的三大考量:權限風險、containerization、pay-per-token 成本結構

前一段談到 Pi 的極簡哲學與多供應商設計,確實讓它成為一款輕巧而充滿彈性的 coding agent。但要把這套工具放進台灣企業的日常工作流程,單看功能還不夠,三個面向會直接左右導入的成敗:權限風險、容器化策略(containerization),以及按用量計費的成本結構。這三者彼此牽動,跳過任何一個,開源帶來的優勢都可能變成維運上的缺口。

Superlinear Academy 的分析文章「Pi: A Better AI Coding Tool, Locked Out」,討論 Pi 的極簡設計與作者為何離開 Claude Code。
Superlinear Academy 的分析文章「Pi: A Better AI Coding Tool, Locked Out」,討論 Pi 的極簡設計與作者為何離開 Claude Code。

權限風險:啟動者權限就是最大的暴露面

Pi 的 GitHub 官方倉庫在 README 中說得很直白,它不內建權限系統,預設以啟動者的權限執行指令。白話來說,今天你用哪一個帳號啟動 Pi,Pi 就擁有那個帳號的完整能力,可以讀寫檔案、呼叫 bash、改動系統設定。個人開發者享受這種自由度,企業卻必須先面對一個現實:萬一 agent 在正式環境刪錯目錄,或者把含客戶資料的檔案輸出到外部,開發者不能說「是工具自己做的」,法律責任還是落在公司身上。

台灣的《個人資料保護法》對企業處理個資的義務要求嚴格。當 Pi 以高權限帳號運行在開發或測試環境,任何涉及個資的檔案被讀取、被寫入 log、或被指令輸出,都是潛在的外洩路徑。MIT 授權(Copyright 2025 Mario Zechner)讓你可以自由使用、修改,甚至拿來商用,但授權條款不會替你的資料外洩背書。截至 2026 年 8 月 24 日,Pi 在 GitHub 已累積 95,916 顆星,數字確實驚人,但星數反映的是熱度,不是企業治理成熟度,這兩者要分開看。另一個容易被忽略的風險是 prompt injection,當 Pi 讀取網頁內容或外部文件時,被刻意放入的指令有可能誘導 agent 執行非預期動作,這在 agent 工具中是共通問題,Pi 也無法完全免除。

containerization:Gondolin、Plain Docker、OpenShell 三種模式的運作與取捨

權限機制的空缺,官方自己也很清楚,解法是容器化。Pi 提供三種隔離模式,分別是 Gondolin 擴充、Plain Docker、OpenShell,三者的隔離粒度與設定成本截然不同。

  • Gondolin 擴充:這是官方推薦的路線,透過擴充機制把 sandbox 能力掛進 agent loop,讓每個 bash 指令都被攔截,送到隔離環境後才執行。好處是粒度最細,可以針對單一指令做管控;代價是需要花時間理解擴充 API 與容器網路設定。
  • Plain Docker:把整個 Pi 工作階段包進 Docker 容器,設定最簡單,適合想快速把流程跑起來的團隊。缺點是隔離粒度較粗,一旦容器內需要存取外部資源,反而要想辦法調整掛載設定。
  • OpenShell:以較輕量的方式模擬 shell 環境,適合開發者個人反覆測試,但不該被當成正式環境的防護牆。使用前必須詳讀文件,確認它守在什麼層級。

這三種模式也能混搭,Gondolin 管指令、Plain Docker 管工作階段,或者用 OpenShell 做日常開發。關鍵在於企業必須有人理解容器網路、磁碟掛載與指令攔截這幾件事。台灣中小企業若團隊只有兩三位工程師,教育訓練就要提早排進去,不能假設工具裝完就自動安全。還要留意一個常見誤區:隔離環境並非萬靈丹,若是把整個家目錄掛載進容器,或者讓容器直接存取正式資料庫,隔離效果等於沒有,等於白忙一場。

pay-per-token 成本結構:比 $20 美元月訂閱更符合台灣 SME 的用量曲線

Pi 的成本模式與 Claude Code 的訂閱制是兩條完全不同的路。Claude Code 走月費制,核心方案從 $20 美元起跳,用量超過就降速,重度使用者還得考慮 $200 美元的高用量方案。Pi 則採 pay-per-token,按每一次 API 呼叫的 token 數量收費,要接 OpenAI、Anthropic、Google 都行,也能透過 Pi 官網的文件接 OpenRouter,甚至直接跑本地模型,讓部分工作完全不產生 API 費用。需要留意的是,Pi 無法用 Claude Pro 訂閱價格呼叫 Claude 模型,要走 API 計費,對既有的訂閱使用者來說,付費邏輯需要重新適應。

第三方評測給了一個很實際的比較。Composio 在 2026 年 8 月 10 日公布實測,30 個任務中 Pi 通過 20 個,每個成功任務的成本約 $0.028;Claude Code 通過 16 個,每個成功任務約 $0.195。換算之後,Pi 的單位成功成本大約是 Claude Code 的七分之一。

Pi 每個成功任務成本約 $0.028,Claude Code 約 $0.195,Pi 約為 Claude Code 的七分之一。資料來源:Composio 實測(2026-08-10)

台灣企業導入前,建議先把過去三個月的模型 API 用量抓出來,估算實際花費再決定要走訂閱還是按量計費。多數中小企業的用量起伏很大,可能這個月趕專案、下個月只做維護,pay-per-token 的彈性在這裡特別有優勢。再加上 OpenRouter 這類服務,台灣開發者不需要一次綁定單一海外供應商,可以依照模型表現與價格隨時切換,這對預算有限的團隊是非常實際的自由度。

至於安裝門檻,Pi 的官方 npm 套件為 @earendil-works/pi-coding-agent,一行指令就能裝好。供應鏈方面,Pi 把 npm 依賴全部鎖定版本,lockfile 被視為唯一準則,CI 流程中也會執行 npm audit。對已經熟悉 Node.js 生態的技術團隊,安裝幾乎沒有障礙,真正的學習曲線在於 prompt 設計與隔離策略的搭配。

整體而言,Pi 的三大考量其實是一體三面:權限風險要求企業先建立治理機制,容器化提供具體的防護手段,成本結構則讓導入具備商業上的合理性。若團隊有基本的容器與指令管控能力,Pi 絕對值得試;若完全沒有技術人力,那先補齊隔離知識,再談導入也不遲。

替代方案有限公司觀點:AI Agent harness 該怎麼選?我們用 Hermes 跑出來的答案

替代方案有限公司的日常,就是替台灣的中小企業把 AI Agent 裝進真實的工作流程。這個過程我們不只幫客戶選工具,自己也在第一線同時跑兩套 harness:一套是 Pi,另一套是 Hermes。跑了一個多月之後,我們最深的體會是,選 harness 不是選「最強的那個」,而是選「最不會扯後腿的那個」。每個工具都有自己的脾氣,先搞清楚任務型態,比追求最新星數更重要。

三種任務型態,三種選擇

我們參考了 MCPlato 在 2026 年 7 月發布的五款 agent 比較,該文把 Pi 定位為最小終端 harness,Hermes 是持久助理,Codex 是受管 coding 產品,Claude Code 是整合式系統。這個分類與我們自己的實測感受一致。

先說純 coding 任務。Pi 的核心是 pi-coding-agent,一個互動式 CLI,只提供 read、write、edit、bash 四個工具,system prompt 不到一千個 token。我們實際觀察,frontier model 經過 RL 訓練之後,本來就知道 coding agent 該怎麼工作,harness 塞再多提示詞只是浪費 token。Anthropic 在 2026 年 7 月為了準備 Claude 5 世代模型,刪掉了 Claude Code 超過八成的 system prompt,等於官方自己往 Pi 的方向靠。純粹寫程式、改 bug、重構,Pi 是我們的首選。

但同樣的情境換成「需要跨頻道持久記憶」,結論就翻盤了。Hermes 的強項在於記憶、跨頻道整合與排程,它能記住長期的對話脈絡,在 Slack、Discord 或其他通訊平台上持續運作。Pi 沒有聊天頻道整合,也不提供跨 session 的記憶,終端一關就歸零。我們有個客戶想把 agent 接到自家的 Discord 伺服器,

結論:Pi Agent 對你的具體意義,與三個可以立刻做的下一步

前文談到客戶想把 agent 接到 Discord 伺服器,這個案例正好濃縮了整個系列的結論:選 harness 之前,先搞清楚你的需求場景。Pi 不是萬靈丹,它不做持久記憶、不提供跨頻道整合,但它在純 coding 這條賽道上,用極簡設計打出了一場漂亮的成本與透明度戰爭。

先看數字。Pi Agent 在 2026 年 8 月 24 日於 GitHub 官方頁面上累積了 95,916 顆星、11,864 次 fork,從 2025 年 8 月 9 日創建到現在不過一年,MIT 授權、TypeScript 撰寫、原始碼公開。這個成長速度的背後,是大量開發者對過度包裝的 coding agent 感到疲倦。

Pi 的核心設計取捨可以濃縮成三句話:模型已經知道 coding agent 該怎麼做,harness 不需要一萬個 token 的提醒;權限交給使用者自己負責,要隔離就 containerize;供應商不要綁死,OpenAI、Anthropic、Google 等二十多家供應商、三百多個模型隨時可切換。Anthropic 在 2026 年 7 月為了 Claude 5 世代模型,刪掉 Claude Code 超過八成的 system prompt,等於官方認證了 Pi 的方向。

第三方實測同樣支持這個判斷。Composio 在 2026 年 8 月 10 日發布的 100 小時第三方評測中,Pi 在自家工具使用評測上 20/30 通過,每個成功案例成本 0.028 美元;Claude Code 只有 16/30,每個成功案例成本 0.195 美元(composio.dev)。Pi 的成本不到 Claude Code 的七分之一。

下一步一:安裝 pi-coding-agent 跑一輪真實任務

打開終端機執行 npm install -g @earendil-works/pi-coding-agent,設定好 API key,然後挑一個手上真正卡關的任務,不要拿 Hello World 練習。建議場景:把老專案從 CommonJS 遷移到 ESM、重構一支巢狀迴圈、修掉困擾你整個下午的 bug。

Pi 沒有 plan mode 也沒有子代理,它就是 read、write、edit、bash 四個工具輪流上陣,每一行指令都顯示在終端機裡。這種透明的執行過程,正是它跟 Claude Code 最大的差異(yage.ai,2026 年 5 月 18 日)。跑完一輪,你的感受就是最真實的評測。

下一步二:用 Composio 的 eval 框架自測兩個工具

不要只相信我們或任何評測者的結論。Composio 開放了工具使用評測框架,把日常工作最常用的兩個工具,例如檔案編輯與 git 操作,設定好任務與驗證標準,讓 Pi 跟 Claude Code 各跑一輪。比對通過率與花費,這個實驗會告訴你,在你的工作負載下誰才是真正省錢的那一個。

Composio 的 20/30 對 16/30 是在特定條件下的結果,你的數字可能不同,但親手驗證的過程比任何評測文都有說服力。記得把模型的選擇也列入變因,Pi 可以接 OpenAI、Anthropic、Google 或本地模型,不同供應商的成本與品質差異很大。

下一步三:打開帳單,算一次真實成本

Claude Pro 每個月 20 美元起,Team 方案每人每月 30 美元起,重度使用者甚至要上到 200 美元等級的方案。Pi 走 pay-per-token,用多少付多少。拿過去三個月的 API 帳單除以實際使用時數,再對照你的訂閱費,算完你就知道哪個划算。

以下提供粗略對照,數字以 Composio 2026 年 8 月評測的單次成功成本為基礎,實際費用依模型與用量調整:

項目 Pi Agent Claude Code
付費方式 pay-per-token 訂閱制
單次成功成本 美金 0.028 元 美金 0.195 元
月費下限 依 API 用量,可趨近於零 20 美元起
模型綁定 多供應商自由切換 限 Anthropic

風險提醒:權限管理是你的責任

這裡必須再次強調,Pi 預設沒有權限系統,它以啟動者的權限執行所有指令。你在哪個目錄執行,它就有哪個目錄的存取權,README 自己也承認這件事。部署到正式環境前,務必搭配 Docker、Gondolin 擴充或 OpenShell 做隔離。台灣的中小企業如果沒有專職技術人員,這一段請務必找熟悉 containerization 的夥伴協助,安全永遠不能省。

Pi 與 Hermes、Codex、Claude Code 的選擇沒有標準答案,重點是先動手實測。我們在替代方案有限公司(altsol.tw)提供 AI Agent 導入諮詢,涵蓋 harness 選型、權限設計與容器化落地,也協助客戶評估 Pi 與自家工作流的適配程度。無論你想自架、接本地模型,還是需要完整的 sandbox 方案,我們都能陪你走一遍。

📩 有任何問題或需要協助,歡迎聯絡我們:[email protected]

Related

延伸閱讀