Skip to main content
Prompt 快取允許供應商重用之前處理過的提示內容。當您的提示開頭與之前快取的前綴匹配時,供應商會跳過重新處理這些 Token——顯著降低成本和延遲。

查看快取使用情況

快取使用情況反映在每個回應的 usage 物件中:

OpenAI 自動快取

OpenAI 自動快取提示前綴,無需特殊請求設定。 運作原理:
  • 快取在 OpenAI 伺服器端發生,當提示足夠長時自動觸發
  • 最小提示長度:1,024 Token
  • 快取條目在閒置約 1 小時後過期
  • 快取 Token 按折扣價計費(通常享受 50% 折扣)

Anthropic Claude Prompt 快取

Anthropic 支援兩種快取模式:
  • 自動快取(預設):Claude 自動快取系統提示。最少 1,024 Token。
  • 顯式快取cache_control):使用 "cache_control": {"type": "ephemeral"} 標記特定內容區塊,精確控制快取內容。

快取 TTL

支援的模型

顯式快取範例

使用 cache_control 在內容區塊層級控制快取:
透過 OpenAI 相容端點時,使用 extra_body 傳遞:

DeepSeek 自動快取

DeepSeek 與 OpenAI 類似,自動快取提示前綴,無需設定。

xAI(Grok)自動快取

Grok 模型在跨請求重用相同前綴時自動快取提示前綴,無需特殊設定。

Groq 自動快取

Groq 的推理基礎設施為支援的模型自動快取提示前綴。快取命中降低延遲,並反映在回應 usage 物件中。

Google Gemini Prompt 快取

Gemini 支援隱式(自動)和顯式快取。

隱式快取

Gemini 2.5 Flash 和 Pro 自動快取大型上下文,無需額外費用。快取命中在回應 usage 中可見。

透過 Gemini 原生 API 進行顯式快取

如需精細控制,可使用 Gemini 原生 cachedContents API。您建立快取物件並在後續請求中引用它:
透過 ARouter 的供應商代理使用 Gemini 原生端點處理快取內容:
回應包含 name 欄位(如 cachedContents/abc123),在後續請求中引用:
快取使用情況出現在回應中:

供應商黏性路由

為最大化快取命中率,您的重複請求應到達同一供應商實例。ARouter 支援黏性路由,確保需要的供應商獲得此保證。 當您的請求中包含 Anthropic cache_control 區塊時,ARouter 自動將具有相同前綴的後續請求路由到同一供應商端點,保持快取有效性。

黏性路由運作原理

  1. 帶有 cache_control 區塊的首次請求在供應商處處理並快取
  2. ARouter 記錄處理該請求的供應商實例
  3. 具有相同快取前綴的後續請求被路由到同一實例
  4. 快取命中降低您的費用(讀取比寫入便宜)並減少延遲

驗證快取命中

檢查 usage 物件以確認跨請求的快取命中:

供應商快取支援彙總