AI

快取命中定價解密:如何用$0.0028/M把API成本壓到極致

2026年5月26日
3 分鐘閱讀
快取命中定價解密:如何用$0.0028/M把API成本壓到極致

快取命中定價解密:如何用$0.0028/M把API成本壓到極致

2026年的AI API市場正在經歷一場前所未有的價格革命。當你打開 DeepSeek 的定價表,映入眼簾的是「每百萬輸入 Token 僅需0.14美元」(2026年9月查核:這個數字屬於已退役的 V4-Flash-0731,現行 V4.1 Flash 為離峰0.15美元、尖峰0.30美元),這個數字幾乎讓所有傳統模型定價顯得像奢侈品。然而,真正的高手不會只看基本單價;他們的目光落在一個更隱蔽、卻威力無窮的機制上:快取命中定價。以 Claude API 的 Prompt Caching 為例,重複的長 System Prompt 費用可以砍掉九成,搭配 Batch API 後更能壓到原價的5%。本文將為你拆解這些數字背後的商業邏輯,並教你如何用「快取命中」這個槓桿,把API成本壓到極致:每百萬Token最低只要0.0028美元?讓我們一步步驗證。

deepseek-ai/DeepSeek-V3 在 GitHub 的專案首頁。對照正文「DeepSeek 模型與架構」相關說明,可查看 README、目錄結構與倉庫入口。
▲ deepseek-ai/DeepSeek-V3 在 GitHub 的專案首頁。對照正文「DeepSeek 模型與架構」相關說明,可查看 README、目錄結構與倉庫入口。

2026年9月更新:先講三個更正

這篇文章寫於2026年5月。當時 DeepSeek 官方價目表還沒列出快取命中價,本文因此用 Claude 的公開價目推估,事後 DeepSeek 已在官方定價頁明列快取命中價格,這個前提必須更正,正文與表格都已更新。其次,本文原本把 Claude Haiku 4.5 的價格寫成每百萬輸入0.80美元、快取命中0.08美元,查核官方價目表後確認那是舊款 Haiku 3.5 的數字,Haiku 4.5 實際為輸入1美元、5分鐘快取寫入1.25美元、快取命中0.10美元、輸出5美元,表格已一併修正。第三,Anthropic 在2026年推出 Claude Sonnet 5,同樣的快取邏輯但單價更低,本文補上新的一列。

一、快取命中的價格魔法:從$3到$0.15

要理解快取命中定價的威力,先看一組對比。根據 Anthropic 官方定價,Claude Sonnet 4.6 的標準輸入價格為每百萬 Token 3美元。但如果你啟用 Prompt Caching,首次寫入快取(cache write)會略高,為3.75美元(標準價的125%);一旦命中快取(cache read),價格直接降到0.30美元,只有原價的10%。

2026年9月的現況是,Anthropic 的現行主力已換成 Claude Sonnet 5,標準輸入降到每百萬 Token 2美元、輸出10美元,5分鐘快取寫入2.50美元、快取命中0.20美元,同樣的省錢邏輯起始單價更低。本文後續比較仍以 Sonnet 4.6 為主軸,因為它是當初的計算基準,最新價格請以官方價目表為準。

deepseek-ai/DeepSeek-V3 的 Releases 分頁,列出正式版本與更新說明,方便核對文中提到的版號。
▲ deepseek-ai/DeepSeek-V3 的 Releases 分頁,列出正式版本與更新說明,方便核對文中提到的版號。

更驚人的是,當你把快取與Batch API疊加使用:

  • Batch + 無快取:$1.50(半價)
  • Batch + cache write:$1.875(原價的62.5%)
  • Batch + cache read:僅$0.15(原價的5%)

也就是說,原本需要3美元的輸入成本,透過「批次處理加上快取命中」可以降到0.15美元,節省幅度高達95%。而 DeepSeek V4-Flash-0731 的基本單價已低到0.14美元,幾乎與 Claude 的「快取命中加 Batch」價格相當。這意味著,如果你能讓使用者查詢大量命中快取,你甚至可以用比 DeepSeek 基本價還低的成本,運行 Claude 這樣的高階模型。

那麼,快取命中的原理是什麼?簡單說,當你的應用頻繁發送相同的系統提示(System Prompt)、工具描述、長文檔摘要前綴時,API提供者會把這些靜態內容暫存起來。後續請求若前半段順序一致,即可直接讀取快取,不需重新計算注意力(Attention),從而大幅降低運算成本,供應商再把這部分節省回饋給你。

二、主要模型快取定價對照表(2026年9月查核)

模型 標準輸入 ($/1M tokens) 快取寫入 ($/1M tokens) 快取命中 ($/1M tokens) Batch + 快取命中 ($/1M tokens)
Claude Sonnet 5 $2.00 $2.50 $0.20 $0.10
Claude Sonnet 4.6 $3.00 $3.75 $0.30 $0.15
Claude Haiku 4.5 $1.00 $1.25 $0.10 $0.05
DeepSeek V4.1 Flash(deepseek-flash,現行) $0.15 離峰/$0.30 尖峰 未另計 $0.003 離峰/$0.006 尖峰 —
GPT-5.6 Luna $0.20 $0.25 $0.02 $0.01

備註:Claude 各欄快取價格取自官方價目表,快取命中為標準輸入價的10%,5分鐘快取寫入為125%,Batch 欄為 Batch 五折後推算。DeepSeek 官方現行價目表已明列快取命中價,V4.1 Flash 為每百萬 Token 離峰0.003美元、尖峰0.006美元;已退役的 V4-Flash-0731 是0.0028美元,也就是本文標題數字的由來。OpenAI 的快取以 cached input 計價,GPT-5.6 Luna 為每百萬0.02美元、Batch 後0.01美元。

deepseek-ai/DeepSeek-V3 的 Issues 分頁,可見使用者回報與討論,評估維護狀態與常見踩坑時可對照閱讀。
▲ deepseek-ai/DeepSeek-V3 的 Issues 分頁,可見使用者回報與討論,評估維護狀態與常見踩坑時可對照閱讀。

三、快取命中定價的商業邏輯:為什麼供應商願意打折?

你可能會問:供應商為什麼不直接用低價吸引用戶,而要設計「快取命中」這種複雜定價?原因在於資源效率。根據業界常見的成本結構估算,輸入 Token 約佔總成本的三成、輸出 Token 約五成,其餘兩成落在重試與冗餘呼叫等隱藏成本(此為業界經驗值,非官方數字)。其中,輸入 Token 的運算成本高度集中於注意力機制(Attention),注意力機制的計算量隨序列長度呈平方成長,這正是長上下文推論昂貴的主因。

deepseek-ai/DeepSeek-R1 專案頁。對照正文的推理模型說明,可查看官方倉庫入口與文件。
▲ deepseek-ai/DeepSeek-R1 專案頁。對照正文的推理模型說明,可查看官方倉庫入口與文件。

當同一個System Prompt被數萬次重複發送,供應商必須浪費大量GPU算力在完全相同的內容上。快取機制讓供應商可以跳過這些重複計算,僅對變化的用戶輸入部分執行注意力。因此,快取命中定價本質上是「效率紅利共享」:你把工作做得越規律,供應商省下的錢越多,他們就願意用更低的價格回饋你。

事實上,這個模式並不新鮮。CDN(內容分發網路)很早就實行「邊緣快取命中」低價策略,資料庫查詢快取也類似,AI API 市場正在複製同樣的邏輯。至於能省多少,取決於你的請求結構與命中率,不是固定折扣。實務上,如果 AI Agent 每天發送十萬次請求、且八成輸入內容可以快取,輸入端費用會明顯下降,但輸出端與未命中的部分不受影響,整體帳單能省下的比例通常低於輸入端的降幅,估算預算時要先想清楚這一點。

四、實戰策略:如何打造「快取友好」的Agent架構?

要享受快取命中的低價,你的API請求必須符合以下條件:

  • 固定長上下文前置:將System Prompt、工具定義、品牌語氣、長文檔摘要前綴放在請求的最前面,且順序保持不變。
  • 分離變動部分:用戶的具體問題、動態變化的欄位(如時間戳、隨機ID)放在後半段,不要混入快取塊。
  • 保持高頻重複:同一個System Prompt被越多請求使用,快取命中率越高。如果你的Agent為不同客戶客製化大量不同的System Prompt,則快取效益會稀釋。

以下是一個簡化的程式碼範例(Python pseudo-code),展示如何用Claude API啟用Prompt Caching:

import anthropic

client = anthropic.Anthropic(api_key="your_key")

# 將常駐的System Prompt放在最前面,並標記可快取
system_prompt = {
    "type": "text",
    "text": "你是一個專業客服AI。請遵循以下品牌語氣:...(此處2000 tokens固定內容)",
    "cache_control": {"type": "ephemeral"}
}

# 用戶輸入為變動部分
user_message = {
    "type": "text",
    "text": "我今天訂單狀態怎麼查?"
}

response = client.messages.create(
    model="claude-sonnet-5",
    system=[system_prompt],
    messages=[{"role": "user", "content": [user_message]}],
    max_tokens=1024
)

# 首次請求會產生cache_write費用($2.50/M),後續相同system prompt則觸發cache_read($0.20/M,Sonnet 5 價目)

DeepSeek 的情況要更正:官方價目表其實已經列出快取命中價,V4-Flash-0731 為每百萬 Token 0.0028美元。現行的 V4.1-Flash 雖然基礎單價拉到離峰0.15美元、尖峰0.30美元,離峰快取命中仍只要0.003美元。當基礎價格已經壓得很低,快取的邊際節省看起來不顯眼,但在長 System Prompt 且高頻重複的場景,省下的比例一樣可觀。反過來說,如果你的請求幾乎不重複,硬做快取只會增加架構複雜度。

五、真的能達到$0.0028/M嗎?能,但那只是輸入端最便宜的一格

標題的0.0028美元,指的是 DeepSeek V4-Flash-0731 官方公布的「快取命中輸入價」,每百萬 Token 0.0028美元,不是整筆帳單的平均單價。這一點必須說清楚,否則很容易誤讀。實際帳單由三塊組成:快取未命中或寫入的輸入、快取命中的輸入、以及輸出。

以 Claude Haiku 4.5 對照,官方價目是:

  • 標準輸入:$1.00/M
  • 5分鐘快取寫入:$1.25/M
  • 快取命中:$0.10/M,搭配 Batch 五折後約$0.05/M(皆為官方價目數字)

用一個具體情境算給你看。假設客服 Agent 每天送出十萬次請求,System Prompt 固定兩千 Token,每次用戶問題兩百 Token,回覆三百 Token,而且九成請求命中快取。輸入端只有一成用未命中價計,其餘用快取命中價;輸出端不受快取影響,三百 Token 以 Haiku 4.5 的5美元/M 計算約0.0015美元,仍是單次成本裡最大的一塊。所以「0.0028美元/M」為真,但它描述的是輸入端最便宜的那一格,不是你的平均成本。任何人拿單一最低價當成整體單價來報預算,都會低估帳單。

更務實的數字:現行的 DeepSeek V4.1 Flash 即使完全不靠快取,離峰輸入0.15美元/M、輸出0.60美元/M 已經很有競爭力,尖峰則加倍,所以把批次工作排到離峰時段的效益,往往比多花兩週做快取架構更直接。若再搭配模型路由,把八成的簡單任務導向 V4.1 Flash、兩成複雜任務交給 Claude Sonnet 並啟用快取,整體成本可以壓到相當低。

六、FAQ 常見問題

Q1:快取命中的定價是所有模型都支援嗎?
A:Anthropic、OpenAI、DeepSeek 三家目前都在官方價目表上公布了快取價。Anthropic 用 cache_control 欄位標示快取範圍,快取命中為標準輸入價的10%;OpenAI 以 cached input 計價,GPT-5.6 Luna 為每百萬0.02美元;DeepSeek 以 cache hit 計價,V4-Flash-0731 為0.0028美元、現行 V4.1 Flash 為離峰0.003美元。各家名稱與欄位不同,共同點是要把固定不變的內容放在請求最前面。

Q2:Batch API加上快取,會不會有衝突?
A:不會。Batch API仍然使用相同的Messages API協議,cache_control欄位正常解析。同一段system prompt在batch內仍能觸發cache_write/cache_read區分計費,最終結算在Messages API原價基礎上再乘以0.5(Batch折扣)。

Q3:快取命中的90%折扣有上限嗎?
A:目前Anthropic並未公開快取命中配額限制,但理論上快取容量有限,極高頻率的變動可能導致部分請求無法命中。建議監控cache read百分比。

Q4:使用DeepSeek V4.1 Flash是否還需要考慮快取?
A:要考慮。現行 V4.1 Flash 的離峰輸入是0.15美元/M、快取命中0.003美元/M,兩者差50倍,只要你的 System Prompt 夠長、重複率夠高,快取就值得做。若請求量達到每天數億 Token,即使只省下三成也非常可觀。

Q5:隱藏成本(如失敗重試)佔20%,快取能幫助嗎?
A:間接幫助。快取降低輸入成本後,你可以將省下的預算用於提升輸出品質或減少重試;但直接減少重試需要改善Prompt設計和模型選擇。

七、替代方案有限公司觀點

替代方案有限公司長期關注AI基礎設施成本優化,我們認為「快取命中定價」是本年度最重要的API經濟創新之一。然而,企業在追求極致低價的同時,必須注意以下陷阱:

  • 快取命中率不等於免費:即使命中率99%,仍有1%的cache write費用,且首次請求成本較高(cache write為原價125%)。如果你的應用用戶量波動劇烈,首次請求的比例會拉高平均成本。
  • 模型能力與快取收益的權衡:Claude Sonnet 4.6 的快取命中可低到0.30美元/M,但輸出價是15美元/M,才是主要成本來源(現行的 Sonnet 5 為輸入2美元、輸出10美元)。快取無法減少輸出 Token 費用,因此若你的應用輸出長文本,例如生成報告,快取的省錢效果有限。
  • 架構複雜度:要實現高快取命中率,你需要精細設計System Prompt、管理緩存區、監控命中率。對於小型團隊,直接使用 DeepSeek V4.1 Flash 並把批次工作排在離峰時段,可能比花時間開發快取系統更划算。

替代方案有限公司的建議是:先量化,再優化。記錄每一次請求的cache_read、cache_write、input/output token數量,然後計算每個付費用戶的毛利。不要只看總 Token 數,一個重度用戶可能吃掉20個輕度用戶的毛利。利用「模型路由分流」策略,將八成的任務導向便宜模型(如現行的 DeepSeek V4.1 Flash),兩成需要高智能的任務導向 Claude Sonnet 並啟用快取,整體成本效益最高。

相關閱讀:1.6T參數只激活49B?DeepSeek V4 MoE架構的效率奇蹟、跨模型擂台:DeepSeek V4 與 GPT、Qwen、小米的全面比較

八、結論與行動呼籲

快取命中定價正在重新定義 API 成本的下限。從 Claude 的快取加 Batch 折扣,到 DeepSeek V4.1 世代的低價與離峰計費,2026年的開發者比過去任何時候都更有能力建造大規模 AI 應用。要做到極致降本,你需要:

  1. 評估你的流量模式:是否屬於高頻、長System Prompt的應用?如果是,立刻導入Prompt Caching + Batch API。
  2. 試用DeepSeek V4.1 Flash:對於不需要極高智能的任務,直接用離峰0.15美元/M 的輸入價,再靠離峰排程省下一半,免去快取設計的麻煩。
  3. 建立成本監控儀表板:至少記錄model、input token、output token、cache read/write、retry count,才能精準計算每個用戶的真實成本。
  4. 與替代方案有限公司合作:我們提供API成本優化顧問服務,協助你設計路由策略、快取策略,並定期審計API帳單。

未來,隨著模型供應商更加競爭,快取定價可能成為標準功能。現在就開始調整你的API呼叫架構,讓每一分錢都花在刀口上。立即檢視你的即時監控數據,計算你的快取命中率,如果低於六成,你正在錯過最低成本的時代。

參考資料:本文原始數據取自2026年5月即時搜尋結果,包括CloudInsight成本分析、小李出海筆記實操指南、Tencent Cloud DeepSeek V4發布報導、Tenten完整解析等。2026年9月更新時,價格與型號已改依 Anthropic 官方價目表、OpenAI 官方價目表與 DeepSeek 官方定價頁查核。

Related

延伸閱讀