当前位置:首页 > 文章列表 > 科技周边 > 人工智能 > Claude API 提示词缓存为什么总 miss:静态前缀、工具定义与 usage 核对

Claude API 提示词缓存为什么总 miss:静态前缀、工具定义与 usage 核对

来源:17golang原创 2026-07-18 18:35:12 0浏览 收藏
所属专题:AI 提示词工程与评测实践专题 - 从提示词设计、缓存命中到结构化输出与上线评测

同一个 Claude API 请求,第一轮调用耗时很高,第二次跑起来还是没看到缓存读取命中,很多团队第一反应都是先排查 cache_control 配置有没有生效。实际排查下来,绝大多数问题都出在请求拼装环节:工具定义、系统提示、检索片段和用户输入随便哪部分发生变动,断点之前的前缀内容就对不上了。缓存逻辑不是按“内容看起来相近”做模糊匹配,而是对断点之前的全部内容做完全精准的比对。

要点速览
  • 把工具定义、系统规则和长期知识放在稳定前缀;请求编号、当前时间和用户问题留在后面。
  • 断点前任何文本、图片或工具参数变化,都可能让下一次请求重新建缓存。
  • 不要只看总输入 token;同时记录 cache_read_input_tokenscache_creation_input_tokens
  • 先用两次完全相同的请求验证命中,再逐项恢复动态字段,定位会快得多。

缓存命中先看前缀,不是先看开关

提示词缓存适合有固定规则、固定工具和长背景资料的调用场景。它复用的是从请求起始位置到缓存断点的一整段前缀内容;在 Claude 的请求结构里,工具配置、系统提示和消息内容都是按固定顺序拼接成这段内容的。第二次调用只要在断点前面多插了一个日期字段、一条新增的检索结果,或者工具说明的排列顺序有变动,整个前缀就会被判定为全新内容。

内容是否适合断点之前常见后果
固定系统规则适合多个会话可共享同一段前缀
稳定的工具 JSON Schema适合减少每次重复发送的固定描述
当前日期、request_id不适合每次变化都会让匹配失效
实时检索片段、用户问题通常不适合应放到断点之后作为本轮输入

这里不用急着把所有资料全都往前缀里塞。缓存命中的核心目的是复用固定不变的内容部分,不等于要把随时会变的业务状态全部封死。比如客服 Agent 的服务规范可以长期不改动,订单号、账户状态和本轮用户提出的问题,就应该放在断点后面传入。

把工具定义与系统规则收在断点之前

最简单的写法可以直接用顶层的自动缓存控制功能。它会把所有可缓存的内容自动推到请求里最后一个支持缓存的位置;只要你的系统规则和工具定义是固定不变的,后续请求就很容易复用同一段前缀。生产环境的代码里还建议把工具数组做成版本化的配置,不要每次根据租户信息临时拼接出顺序不一样的结果。

{
  "model": "claude-sonnet-4-5",
  "max_tokens": 800,
  "cache_control": {"type": "ephemeral"},
  "system": "你是订单助手。只依据给定订单资料回答。",
  "tools": [
    {"name": "get_order", "description": "读取订单摘要"}
  ],
  "messages": [
    {"role": "user", "content": "订单 A-1048 的退款进度"}
  ]
}

上面的示例只用来演示内容摆放的位置关系,不建议把真实订单相关的业务数据直接写进系统提示。如果业务需要附带一份很长的商品规则,你可以把这份规则和工具定义放在一起固定下来,用户的订单号和本次提问内容留在消息尾部传入。这么做既不会丢失业务的实时性,也不会因为一个动态字段把前面的缓存复用机会彻底破坏。

Claude API 提示词缓存中稳定系统规则和工具定义位于断点前,动态用户输入位于断点后的等待链示意图

两次相同请求,先确认缓存是否真的被读取

验证效果的时候不用一上来就压测几百个请求。先在同一个运行环境里连续发两次内容完全一致的调用,把每次返回响应里的 usage 字段存下来。第一次调用通常会生成缓存,对应返回缓存创建 token;第二次调用如果前缀匹配成功,就会返回对应的缓存读取 token。只看接口返回耗时判断完全不准,网络抖动、请求排队都可能拖慢响应速度,干扰判断。

{
  "usage": {
    "input_tokens": 322,
    "cache_creation_input_tokens": 1840,
    "cache_read_input_tokens": 0,
    "output_tokens": 126
  }
}

代码里单独打点统计 cache_read_input_tokens 字段。如果这个值一直是0,可以按顺序缩小排查范围:先删掉动态生成的系统文本,再把工具数组固定下来,接着把历史消息精简到只剩一条。每次只改动一个变量,才能准确定位到底是哪部分内容破坏了原本的前缀匹配。缓存本身的生命周期也会影响命中结果,隔了很久再重新测试,就算命中也没法证明你的前缀设计是完全正确的。

Claude API 连续两次请求从缓存创建到缓存读取,并通过 usage 字段确认命中的等待链示意图

三个容易忽略的 miss 来源

工具描述被拼进了租户信息

有些项目为了在工具说明里显示店铺名称、权限范围,每次都临时替换描述文本。它对模型也许更直观,却破坏了缓存前缀。更稳妥的做法是保持工具契约不变,把租户信息放到用户消息或单独的数据块。

把当前时间写入系统规则

“现在是几点”这类变量放在系统规则开头最容易造成连续 miss。若确实需要时间,用靠后的消息承载,或者只在业务需要时补充,不要让所有请求为此失去复用。

命中后仍然只统计总 token

总输入 token 不会直接告诉你哪一段被复用。仪表盘至少分开记录普通输入、缓存创建和缓存读取三类 token,并把模型、工具版本和缓存策略一起作为维度。这样某次发布后命中下降,才能及时回查是哪套配置变了。

相关问题

自动缓存和显式断点怎么选?

调用结构简单、对话逐步增长时,自动方式更省事;需要精确控制一段长资料的位置时,再使用显式断点。无论哪种方式,断点之前都要稳定。

用户问题相同就一定命中吗?

不一定。用户问题只是请求的一部分;前面的工具、系统规则、历史消息或图片变化,同样会使前缀不再相同。

为什么本地命中、线上却不命中?

先比较线上拼装后的完整请求:环境变量插入的日期、租户配置、工具版本和观测字段都值得检查。不要只比业务入参。

缓存读取为零要不要马上改提示词?

先做两次完全一致的最小请求确认环境与生命周期,再逐步恢复真实上下文。一次线上调用的零读取,信息量通常不够。

收尾:把前缀当成一份可发布的配置

提示词缓存的收益来自稳定的内容复用,不是多开一个配置开关就能拿到的。把系统规则和工具定义当成版本化的配置产物,动态业务数据往后放,再通过 usage 返回字段核对缓存读取情况,频繁 miss 的问题就能从摸不着头脑的成本问题,变成可以一步步定位的配置问题。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Go 1.26.5 安全更新怎么跟进:crypto/tls 与 os 修复的升级运行手册Go 1.26.5 安全更新怎么跟进:crypto/tls 与 os 修复的升级运行手册
上一篇
Go 1.26.5 安全更新怎么跟进:crypto/tls 与 os 修复的升级运行手册
Go 静态文件更新了浏览器还是旧版本:Cache-Control、ETag 和文件名指纹怎么配
下一篇
Go 静态文件更新了浏览器还是旧版本:Cache-Control、ETag 和文件名指纹怎么配
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • SuperCLUE中文大模型评测基准:功能、能力维度与应用指南
    SuperCLUE
    SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
    100次使用
  • C-Eval中文评测基准:大语言模型多学科能力评估指南
    C-Eval
    深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
    18次使用
  • Gradio是什么?Python开源库快速构建机器学习Web演示界面
    Gradio
    Gradio是一个用于构建机器学习和数据科学Web应用的开源Python库。支持快速创建交互界面,获Google、Meta等大厂青睐,适合模型演示、部署反馈及调试。
    99次使用
  • AutoGPT是什么?开源AI Agent自动化工作流平台详解与使用教程
    AutoGPT
    AutoGPT是基于GPT-4的开源AI代理平台,拥有超10万GitHub星标。本文介绍其低代码界面、自动化工作流功能、系统配置要求及安装步骤,助您高效部署和管理AI Agent。
    104次使用
  • 腾讯扣叮官网:青少年编程教育平台,提供图形化编程、3D创作与虚拟仿真实验室
    腾讯扣叮
    腾讯扣叮是腾讯推出的6-18岁青少年编程学习平台,依托游戏与AI技术,提供图形化编程、3D创作、虚拟实验室及丰富赛事课程,助力培养计算思维与创新能力。
    101次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码