以编程方式使用文档

Browserbase 是一个开发者平台,用于可靠地运行、管理和监控无头浏览器。

为您的 AI 数据检索提供动力:

安装和设置

  • - 从 browserbase.com 获取 API 密钥和项目 ID,并将其设置为环境变量(BROWSERBASE_API_KEY, BROWSERBASE_PROJECT_ID).
  • - 安装 Browserbase SDK:
pip install browserbase

加载文档

使用 BrowserbaseLoader将网页加载到 LangChain。加载器读取 BROWSERBASE_API_KEYBROWSERBASE_PROJECT_ID 从环境变量中获取 当参数省略时。设置 text_content=True 以仅返回纯文本 内容,而不是完整的 HTML。

from langchain_community.document_loaders import BrowserbaseLoader

loader = BrowserbaseLoader(
    urls=["https://example.com"],
    text_content=False,
)

docs = loader.load()
print(docs[0].page_content[:61])

加载器选项

  • - urls 必填。要获取的 URL 列表。
  • - text_content 仅检索文本内容。默认为 False.
  • - api_key Browserbase API 密钥。默认为 BROWSERBASE_API_KEY 环境变量。
  • - project_id Browserbase 项目 ID。默认为 BROWSERBASE_PROJECT_ID 环境变量。
  • - session_id 可选。提供一个现有的会话 ID。
  • - proxy Optional. Enable/Disable Proxies.