以编程方式使用文档

本指南提供快速入门 WRITER 的概述 PDFParser 文档加载器.

WRITER 的 PDF 解析器 将 PDF 文档转换为其他格式,如文本或 Markdown。当您需要从 PDF 文件中提取和处理文本内容以进行进一步分析或集成到您的工作流程中时,这特别有用。在 langchain-writer,我们提供将 WRITER 的 PDF 解析器作为 LangChain 文档解析器的使用方法。

概述

集成详情

本地可序列化JS 支持下载量版本
PDFParserlangchain-writer!PyPI - 下载量!PyPI - 版本

设置

PDFParser 可在以下位置获取: langchain-writer package:

pip install --quiet -U langchain-writer

凭证

注册 WRITER AI Studio 以生成 API 密钥(您可以按照此 快速入门操作)。然后,设置 WRITER_API_KEY 环境变量:

if not os.getenv("WRITER_API_KEY"):
    os.environ["WRITER_API_KEY"] = getpass.getpass("Enter your WRITER API key: ")

设置 LangSmith 也很有帮助(但非必需),以便获得一流的可观察性。如果您希望这样做,可以设置 LANGSMITH_TRACINGLANGSMITH_API_KEY 环境变量:

os.environ["LANGSMITH_TRACING"] = "true"
# os.environ["LANGSMITH_API_KEY"] = getpass.getpass()

实例化

接下来,使用所需的输出格式实例化 WRITER PDF 解析器:

from langchain_writer.pdf_parser import PDFParser

parser = PDFParser(format="markdown")

用法

使用 PDF 解析器有两种方式:同步或异步。在任一情况下,PDF 解析器都将返回一个 Document 对象列表,每个对象包含 PDF 文件一页的解析内容。

同步用法

要同步调用 PDF 解析器,请将 Blob 对象传递给 parse 方法,引用您想要解析的 PDF 文件:

from langchain_core.documents.base import Blob

file = Blob.from_path("../example_data/layout-parser-paper.pdf")

parsed_pages = parser.parse(blob=file)
parsed_pages

异步用法

要异步调用 PDF 解析器,请将 Blob 对象传递给 aparse 方法,引用您想要解析的 PDF 文件:

parsed_pages_async = await parser.aparse(blob=file)
parsed_pages_async

其他资源

您可以在 WRITER 文档中找到有关 WRITER 模型(包括成本、上下文窗口和支持的输入类型)及工具的信息 WRITER 文档.