第 63 页 / 共 100 页 / 飞书修订版 7

3.PDF support

此文档由 学习AI的1000天 翻译制作(抖音,B站,YouTube)

邮箱: szqshan@gmail.com | 微信: szqshan
网址: www.xueai.org

==================================================

SsAVbCU1DobuxwxoIYCcMV9Ynoc.pdf

Claude 可以直接读取和分析 PDF 文件,这使其成为文档处理的强大工具。这项功能的工作原理与图像处理类似,但在代码结构方面有一些关键差异。

设置 PDF 处理

要使用 Claude 处理 PDF 文件,您将使用与处理图像几乎相同的代码。主要区别在于文件类型规范和为了清晰起见而使用的变量名称。

以下是如何修改现有图像处理代码以适用于 PDF 的方法:

with open("earth.pdf", "rb") as f:

file_bytes = base64.standard_b64encode(f.read()).decode("utf-8")

messages = []

add_user_message(

messages,

[

{

"type": "document",

"source": {

"type": "base64",

"media_type": "application/pdf",

"data": file_bytes,

},

},

{"type": "text", "text": "用一句话总结这个文档"},

],

)

chat(messages)

图像处理的主要变更

当将图像处理代码适配为PDF处理时,你需要更新几个元素:

  • 将文件扩展名从 .png 改为 .pdf
  • 为了清晰起见,将变量名从 image_bytes 更新为 file_bytes
  • 将类型设置为"document"而不是"image"
  • 将媒体类型更改为"application/pdf"而不是"image/png"

Claude 可以从 PDF 中提取什么

Claude 的 PDF 处理能力远不止简单的文本提取。它可以分析和理解:

  • 整个文档中的文本内容
  • PDF 中嵌入的图像和图表
  • 表格及其数据关系
  • 文档结构和格式

这使得 Claude 本质上成为了从 PDF 文档中提取任何类型信息的一站式解决方案,无论您需要摘要、数据分析还是特定内容提取。

image1.jpeg

上面的示例显示了 Claude 成功处理了一篇保存为 PDF 的关于地球的维基百科文章,展示了它如何能够理解并用一句话总结复杂的文档内容。

==================================================



此文档由 学习AI的1000天 翻译制作(抖音,B站,YouTube)
邮箱: szqshan@gmail.com | 微信: szqshan
网址: www.xueai.org