第 65 页 / 共 100 页 / 飞书修订版 6

5.Prompt caching

此文档由 学习AI的1000天 翻译制作(抖音,B站,YouTube)

邮箱: szqshan@gmail.com | 微信: szqshan
网址: www.xueai.org

==================================================

Prompt caching是一项功能,通过重复使用之前请求的计算工作来加速Claude的响应并降低文本生成成本。Claude不再在每次请求后丢弃所有处理工作,而是可以在您再次发送类似内容时保存并重复使用这些工作。

Claude通常如何处理请求

要理解prompt caching,让我们首先看看在没有启用缓存的情况下,典型请求过程中会发生什么。

image1.jpeg

当您向Claude发送消息时,它不会立即开始生成响应。相反,Claude会对您的输入进行大量的预处理工作:

image2.jpeg
  • 将prompt标记化为更小的片段
  • 为每个token创建嵌入向量
  • 基于周围文本添加上下文
  • 然后才生成实际的输出文本

在向您发送响应后,Claude会丢弃所有这些计算工作——标记化、嵌入向量和上下文分析都会被丢弃。

image3.jpeg

丢弃工作的问题

当您发出包含相同内容的后续请求时,这种方式就变得低效了。例如,在一个对话中,您要求Claude对同一篇长文本的摘要进行优化:

image4.jpeg

Claude必须对刚刚分析过的内容重复执行所有相同的预处理工作。正如Claude可能会想:"我刚刚处理了那条消息并丢弃了所有已完成的工作——我本可以重复使用它!"

image5.jpeg

Prompt Caching如何解决这个问题

Prompt caching通过保存预处理工作而不是丢弃它来改变这一工作流程:

image6.jpeg

当您发出初始请求时,Claude执行所有常规的预处理工作,但将结果存储在缓存中而不是丢弃它们。缓存就像一个查找表,表示"如果我再次看到这条消息,我将重复使用已经完成的工作。"

image7.jpeg

主要优势和限制

image8.jpeg

Prompt caching提供了几个优势:

  • 更快的响应:使用缓存内容的请求执行得更快
  • 更低的成本:您为请求中的缓存部分支付更少费用
  • 自动优化:初始请求写入缓存,后续请求从中读取

然而,需要牢记一些重要的限制:

  • 缓存持续时间:缓存内容仅保持一小时
  • 使用场景有限:只有在重复发送相同内容时才有益
  • 高频率要求:当相同内容在请求中出现频率极高时最为有效

Prompt 缓存最适用于文档分析工作流等场景,即对同一份大型文档提出多个问题,或者在基础内容保持不变而您需要完善特定方面的迭代编辑任务。

==================================================



此文档由 学习AI的1000天 翻译制作(抖音,B站,YouTube)
邮箱: szqshan@gmail.com | 微信: szqshan
网址: www.xueai.org