5.Prompt caching
此文档由 学习AI的1000天 翻译制作(抖音,B站,YouTube)
邮箱: szqshan@gmail.com | 微信: szqshan
网址: www.xueai.org
==================================================
Prompt caching是一项功能,通过重复使用之前请求的计算工作来加速Claude的响应并降低文本生成成本。Claude不再在每次请求后丢弃所有处理工作,而是可以在您再次发送类似内容时保存并重复使用这些工作。
Claude通常如何处理请求
要理解prompt caching,让我们首先看看在没有启用缓存的情况下,典型请求过程中会发生什么。

当您向Claude发送消息时,它不会立即开始生成响应。相反,Claude会对您的输入进行大量的预处理工作:

- 将prompt标记化为更小的片段
- 为每个token创建嵌入向量
- 基于周围文本添加上下文
- 然后才生成实际的输出文本
在向您发送响应后,Claude会丢弃所有这些计算工作——标记化、嵌入向量和上下文分析都会被丢弃。

丢弃工作的问题
当您发出包含相同内容的后续请求时,这种方式就变得低效了。例如,在一个对话中,您要求Claude对同一篇长文本的摘要进行优化:

Claude必须对刚刚分析过的内容重复执行所有相同的预处理工作。正如Claude可能会想:"我刚刚处理了那条消息并丢弃了所有已完成的工作——我本可以重复使用它!"

Prompt Caching如何解决这个问题
Prompt caching通过保存预处理工作而不是丢弃它来改变这一工作流程:

当您发出初始请求时,Claude执行所有常规的预处理工作,但将结果存储在缓存中而不是丢弃它们。缓存就像一个查找表,表示"如果我再次看到这条消息,我将重复使用已经完成的工作。"

主要优势和限制

Prompt caching提供了几个优势:
- 更快的响应:使用缓存内容的请求执行得更快
- 更低的成本:您为请求中的缓存部分支付更少费用
- 自动优化:初始请求写入缓存,后续请求从中读取
然而,需要牢记一些重要的限制:
- 缓存持续时间:缓存内容仅保持一小时
- 使用场景有限:只有在重复发送相同内容时才有益
- 高频率要求:当相同内容在请求中出现频率极高时最为有效
Prompt 缓存最适用于文档分析工作流等场景,即对同一份大型文档提出多个问题,或者在基础内容保持不变而您需要完善特定方面的迭代编辑任务。
==================================================
此文档由 学习AI的1000天 翻译制作(抖音,B站,YouTube)
邮箱: szqshan@gmail.com | 微信: szqshan
网址: www.xueai.org