以编程方式使用文档

只需两行代码即可赋予 AI 代理浏览网站、搜索 Google 和 Amazon 的能力。

langchain-scraperapi 包添加了三个由 ScraperAPI service:

工具类用于
ScraperAPIToolGrab the HTML/text/markdown of any web page
ScraperAPIGoogleSearchTool获取结构化的 Google 搜索 SERP 数据
ScraperAPIAmazonSearchTool获取结构化的 Amazon 产品搜索数据

概述

集成详情

可序列化JS 支持最新包版本
langchain-scraperapi!PyPI - 版本

设置

安装 langchain-scraperapi package:

pip install -qU langchain-scraperapi

凭证

在以下网址创建账户 ScraperAPI 并获取 API 密钥:

if not os.environ.get("SCRAPERAPI_API_KEY"):
    os.environ["SCRAPERAPI_API_KEY"] = "your-api-key"

实例化

from langchain_scraperapi.tools import ScraperAPITool

tool = ScraperAPITool()

调用

使用参数直接调用

output = tool.invoke(
    {
        "url": "https://langchain.com",
        "output_format": "markdown",
        "render": True,
    }
)
print(output)

功能

1. ScraperAPITool — 浏览任意网站

调用原始 ScraperAPI 端点并获取 HTML、渲染后的 DOM、文本或 Markdown。

调用参数:

  • * **url** **(必需)** – 目标页面 URL
  • * **可选(镜像 ScraperAPI 查询参数):**
  • * output_format: "text" | "markdown" (默认返回原始 HTML)
  • * country_code: e.g. "us", "de"
  • * device_type: "desktop" | "mobile"
  • * premium: bool – 使用高级代理
  • * render: bool – 返回 HTML 前运行 JS
  • * keep_headers: bool – 包含响应头

完整参数修饰符集请参阅 ScraperAPI 请求自定义文档.

from langchain_scraperapi.tools import ScraperAPITool

tool = ScraperAPITool()

html_text = tool.invoke(
    {
        "url": "https://langchain.com",
        "output_format": "markdown",
        "render": True,
    }
)
print(html_text[:300], "…")

2. ScraperAPIGoogleSearchTool — 结构化 Google 搜索

通过 /structured/google/search.

调用参数:

  • * **query** **(必需)** – 自然语言搜索字符串
  • * **Optional:** country_code, tld, uule, hl, gl, ie, oe, start, num
  • * output_format: "json" (默认)或 "csv"
from langchain_scraperapi.tools import ScraperAPIGoogleSearchTool

google_search = ScraperAPIGoogleSearchTool()

results = google_search.invoke(
    {
        "query": "what is langchain",
        "num": 20,
        "output_format": "json",
    }
)
print(results)

3. ScraperAPIAmazonSearchTool — 结构化 Amazon 搜索

通过 /structured/amazon/search.

调用参数:

  • * **query** **(必需)** – 产品搜索词
  • * **Optional:** country_code, tld, page
  • * output_format: "json" (默认)或 "csv"
from langchain_scraperapi.tools import ScraperAPIAmazonSearchTool

amazon_search = ScraperAPIAmazonSearchTool()

products = amazon_search.invoke(
    {
        "query": "noise cancelling headphones",
        "tld": "co.uk",
        "page": 2,
    }
)
print(products)

在代理中使用

以下是在 AI 代理中使用这些工具的示例。该 ScraperAPITool 使 AI 能够浏览任意网站、摘要文章,并点击链接在页面间导航。

pip install -qU langchain-openai langchain
from langchain.agents import create_agent
from langchain_openai import ChatOpenAI
from langchain_scraperapi.tools import ScraperAPITool


os.environ["SCRAPERAPI_API_KEY"] = "your-api-key"
os.environ["OPENAI_API_KEY"] = "your-api-key"

tools = [ScraperAPITool(output_format="markdown")]
model = ChatOpenAI(model="gpt-5.5", temperature=0)

agent = create_agent(
    model=model,
    tools=tools,
    system_prompt="You are a helpful assistant that can browse websites for users. When asked to browse a website or a link, do so with the ScraperAPITool, then provide information based on the website based on the user's needs.",
)

response = agent.invoke(
    {"messages": [{"role": "user", "content": "can you browse hacker news and summarize the first website"}]}
)
print(response["messages"][-1].content)

API 参考

以下是可自定义请求的更多工具参数信息:

LangChain 包装器直接暴露这些参数。