Skip to main content
Prompt 缓存允许供应商重用之前处理过的提示内容。当您的提示开头与之前缓存的前缀匹配时,供应商会跳过重新处理这些 Token——显著降低成本和延迟。

查看缓存使用情况

缓存使用情况反映在每个响应的 usage 对象中:

OpenAI 自动缓存

OpenAI 自动缓存提示前缀,无需特殊请求配置。 工作原理:
  • 缓存在 OpenAI 服务端发生,当提示足够长时自动触发
  • 最小提示长度:1,024 Token
  • 缓存条目在闲置约 1 小时后过期
  • 缓存 Token 按折扣价计费(通常享受 50% 折扣)

Anthropic Claude Prompt 缓存

Anthropic 支持两种缓存模式:
  • 自动缓存(默认):Claude 自动缓存系统提示。最少 1,024 Token。
  • 显式缓存cache_control):使用 "cache_control": {"type": "ephemeral"} 标记特定内容块,精确控制缓存内容。

缓存 TTL

支持的模型

显式缓存示例

使用 cache_control 在内容块级别控制缓存:
通过 OpenAI 兼容端点时,使用 extra_body 传递:

DeepSeek 自动缓存

DeepSeek 与 OpenAI 类似,自动缓存提示前缀,无需配置。

xAI(Grok)自动缓存

Grok 模型在跨请求重用相同前缀时自动缓存提示前缀,无需特殊配置。

Groq 自动缓存

Groq 的推理基础设施为支持的模型自动缓存提示前缀。缓存命中降低延迟,并反映在响应 usage 对象中。

Google Gemini Prompt 缓存

Gemini 支持隐式(自动)和显式缓存。

隐式缓存

Gemini 2.5 Flash 和 Pro 自动缓存大型上下文,无需额外费用。缓存命中在响应 usage 中可见。

通过 Gemini 原生 API 进行显式缓存

如需精细控制,可使用 Gemini 原生 cachedContents API。您创建缓存对象并在后续请求中引用它:
通过 ARouter 的提供商代理使用 Gemini 原生端点处理缓存内容:
响应包含 name 字段(如 cachedContents/abc123),在后续请求中引用:
缓存使用情况出现在响应中:

提供商粘性路由

为最大化缓存命中率,您的重复请求应到达同一提供商实例。ARouter 支持粘性路由,确保需要的提供商获得此保证。 当您的请求中包含 Anthropic cache_control 块时,ARouter 自动将具有相同前缀的后续请求路由到同一提供商端点,保持缓存有效性。

粘性路由工作原理

  1. 带有 cache_control 块的首次请求在提供商处处理并缓存
  2. ARouter 记录处理该请求的提供商实例
  3. 具有相同缓存前缀的后续请求被路由到同一实例
  4. 缓存命中降低您的费用(读取比写入便宜)并减少延迟

验证缓存命中

检查 usage 对象以确认跨请求的缓存命中:

提供商缓存支持汇总