Decodo

官方

轻松访问网页数据。简化从网站和在线来源获取信息的过程。

你可以用 Decodo MCP 做什么?

  • 将任意网页抓取为 Markdown — 让您的助手通过 scrape_as_markdown 获取 URL,并返回干净、适合 LLM 使用的内容,即使网站重度依赖 JavaScript 也能处理。
  • 捕获页面截图 — 使用 screenshot 请求任意网页的视觉快照,并支持地理位置和设备模拟选项。
  • 执行搜索引擎查询 — 使用 google_searchbing_searchgoogle_ai_mode 等工具,从 Google、Bing 或 Google AI 模式获取解析后的结果。
  • 跟踪电商产品和价格 — 使用 amazon_pricingwalmart_search 等工具,监控 Amazon、Walmart、Target 和 TikTok Shop 上的商品、价格和卖家信息。
  • 收集社交媒体数据 — 通过 reddit_subreddityoutube_subtitles 等工具,从 Reddit、TikTok 和 YouTube 获取帖子、频道信息、字幕和互动数据。
  • 查询 AI 搜索引擎 — 直接在您的工作流程中,从 chatgptperplexity 获取 AI 生成的答案和对话内容。

文档

Decodo MCP 服务器

Install MCP Server

使用 MCP(模型上下文协议)将 LLM 和 AI 代理连接到实时网络数据。Decodo MCP 服务器让您可以直接从 Claude、Cursor 和 Windsurf 等 AI 工具中抓取网站、搜索引擎、电子商务平台和社交媒体, 无需从头构建抓取基础设施。

  • 结构化输出,支持 JSON、Markdown 和截图
  • 服务端 JavaScript 渲染和反机器人处理
  • 覆盖 195+ 个地区的 1.25 亿+ IP

什么是 Decodo MCP 服务器?

Decodo MCP 服务器是面向 AI 代理的网络抓取层。它将兼容 MCP 的客户端连接到 Decodo 的网页抓取 API,支持:

  • 面向 LLM 的网页抓取
  • 用于 RAG 的实时数据检索
  • AI 代理浏览和研究
  • 从动态网站提取结构化数据

无需维护代理、解析器和重试逻辑,您只需一个集成点即可获得可靠的网络数据访问。

为什么使用 MCP 进行网页抓取?

模型上下文协议(MCP)是将 AI 代理连接到外部工具和数据源的新兴标准。使用 MCP:

  • 代理可以动态调用工具
  • 集成保持标准化
  • 工作流可跨环境扩展

Decodo MCP 服务器通过这一标准为您的代理提供可靠、生产级的网络访问能力。

主要特性

面向 AI 代理的网页抓取,无需基础设施。 抓取任何网站,包括 JavaScript 密集型页面,无需处理代理轮换、CAPTCHA 验证或反机器人系统。

面向 LLM 工作流的结构化输出。 Markdown(适合 LLM)、JSON(适合结构化管道)和 截图(用于视觉上下文),专为 RAG 管道、AI 研究代理和自动化流程而构建。

内置对热门目标的支持。 为 Google 和 Bing(搜索引擎结果页)、Amazon、 Walmart 和 Target(电子商务)、Reddit、TikTok 和 YouTube(社交媒体)以及 ChatGPT 和 Perplexity(AI 搜索)提供现成工具。

全球代理基础设施。 1.25 亿+ 住宅 IP、195+ 个地理位置,即使面对保护最严格的目标 也能达到 99.99% 的成功率。

模块化 MCP 工具集。 只启用您需要的功能:websearchecommercesocial_mediaai,以获得更简洁的工具选择和更好的代理性能。

快速见效。 从获取 API 密钥到首次抓取只需几分钟,无需额外设置。

使用场景

当您需要面向 AI 代理的网页抓取、大规模结构化数据提取、对动态网站的可靠访问、用于 RAG 的实时数据, 或希望替代从头构建抓取基础设施时,可以使用 Decodo MCP 服务器。常见场景:

  • AI 驱动的网页抓取 – 让 LLM 能够收集最新数据,而不是依赖 静态训练数据。
  • 带实时数据的 RAG – 将实时的 Google、Bing 和 AI 搜索结果引入检索 管道。
  • 电子商务情报 – 跨市场平台跟踪产品价格、列表和卖家, 而不会被屏蔽。
  • 社交媒体数据收集 – 从 Reddit、TikTok 和 YouTube 收集帖子、频道和互动数据。
  • 旅行和价格聚合 – 构建跨网站收集实时价格和可用性信息的工具。

快速开始

  1. 创建免费账户,访问 dashboard.decodo.com – 最高 2K 次免费请求,无需信用卡。
  2. 获取您的 API 密钥。 从仪表板获取网页抓取 API 基本认证令牌。
  3. 下载 Node.js 18+,从 https://nodejs.org.
  4. 获取 MCP 客户端,如 Claude Desktop、Cursor、Windsurf 或其他兼容 MCP 的 工具。
  5. 在您的 AI 客户端中配置 MCP 服务器(参见下面的配置示例)。

连接到 Decodo 的 MCP 服务器

打开您首选的 MCP 客户端并添加以下配置(参见下面 Claude Code、Cursor、Windsurf 的示例):

{
  "mcpServers": {
    "Decodo": {
      "url": "https://mcp.decodo.com/mcp",
      "headers": {
        "Authorization": "Basic <basic_auth_token>"
      }
    }
  }
}

Claude Desktop

  1. 打开 Claude Desktop → 设置 → 开发者 → 编辑配置。
  2. 添加到 claude_desktop_config.json:
{
  "mcpServers": {
    "Decodo": {
      "command": "npx",
      "args": ["-y", "@decodo/mcp-server"],
      "env": {
        "SCRAPER_API_TOKEN": "<basic_auth_token>",
        "TOOLSETS": "web,ai"
      }
    }
  }
}
  1. 保存并重启 Claude Desktop。

Cursor

  1. 打开设置 → MCP。
  2. 点击添加新的全局 MCP 服务器(打开 mcp.json)。
  3. 添加上面相同的配置。
  4. 保存 — 查看 Decodo 旁边是否有绿色状态指示器。

Windsurf

  1. 打开设置 → Windsurf 设置。
  2. 滚动到 Cascade → 添加自定义服务器 +(打开 mcp_config.json)。
  3. 添加上面相同的配置。
  4. 保存并重启 Windsurf。

测试您的设置

连接后,在您的客户端中尝试以下提示:

▎ "抓取 Hacker News 前 5 篇文章的标题"

您应该在几秒钟内收到结构化列表。如果看到认证错误,请从仪表板仔细检查您的令牌。

可选:启用特定工具集

本地运行 MCP 服务器

前提条件

分步指南

  1. 克隆此仓库:
git clone https://github.com/Decodo/mcp-server
  1. 在终端中运行以下命令:
cd decodo-mcp-server
npm install
npm run build
  1. 记下您的构建位置:
cd build/
pwd

在此目录末尾添加 index.js,您的构建文件位置应该类似于:

/Users/your.user/projects/decodo-mcp/build/index.js
  1. 使用服务器信息更新您的 MCP 客户端:
{
  "mcpServers": {
    "decodo-mcp": {
      "command": "node",
      "args": ["/Users/your.user/projects/decodo-mcp/build/index.js"],
      "env": {
        "SCRAPER_API_TOKEN": "<web_scraping_api_base64_token>"
      }
    }
  }
}

工具集

工具按工具集组织。您可以通过 toolsets 查询参数传递逗号分隔的列表来选择性启用特定工具集:

    "Decodo MCP Server": {
      "url": "https://mcp.decodo.com/mcp?toolsets=web,ai",
      "headers": {
        "Authorization": "Basic <your_auth_token>"
      }
    }

当未指定工具集时,将注册所有工具。

工具集工具
webscrape_as_markdownscreenshot
searchgoogle_searchgoogle_adsgoogle_lensgoogle_travel_hotelsbing_search
ecommerceamazon_searchamazon_productamazon_pricingamazon_sellersamazon_bestsellerswalmart_searchwalmart_producttarget_searchtarget_producttiktok_shop_searchtiktok_shop_producttiktok_shop_url
social_mediareddit_postreddit_subredditreddit_usertiktok_postyoutube_metadatayoutube_channelyoutube_subtitlesyoutube_search
aichatgptperplexitygoogle_ai_mode

工具

服务器公开以下工具:

工具描述示例提示词
scrape_as_markdown抓取任意目标 URL,需要通过提示词提供 URL。以 Markdown 格式返回结果。从美国 IP 抓取 peacock.com 并告诉我定价。
screenshot捕获任意网页的截图,并以 PNG 图片形式返回。从美国 IP 截取 github.com 的截图。
google_search抓取 Google 搜索指定查询词,并返回解析后的结果。抓取 Google 搜索“鞋子”并告诉我排名第一的结果。
google_ads抓取 Google Ads 搜索结果。抓取 Google Ads 中“笔记本电脑”的广告并展示排名靠前的广告。
google_lens抓取 Google Lens 图片搜索结果。用这张图片搜索 Google Lens:https://example.com/image.jpg
google_ai_mode抓取 Google AI 模式(AI 搜索)结果。询问 Google AI 模式:最受欢迎的三种犬类是什么?
google_travel_hotels抓取 Google Travel Hotels 搜索结果。搜索 Google Travel Hotels 查找巴黎的酒店。
amazon_search抓取 Amazon 搜索指定查询词,并返回解析后的结果。抓取 Amazon 搜索“无线键盘”。
amazon_product抓取 Amazon 商品页面。抓取 Amazon 商品 B09H74FXNW 并展示详情。
amazon_pricing抓取 Amazon 商品定价信息。获取 Amazon 商品 B09H74FXNW 的定价。
amazon_sellers抓取 Amazon 卖家信息。获取 Amazon 卖家 A1R0Z7FJGTKESH 的信息。
amazon_bestsellers抓取 Amazon 畅销榜列表。展示电子产品类目的 Amazon 畅销榜。
walmart_search抓取 Walmart 搜索指定查询词,并返回解析后的结果。抓取 Walmart 搜索“露营帐篷”。
walmart_product抓取 Walmart 商品页面。抓取 Walmart 商品 15296401808。
target_search抓取 Target 搜索指定查询词,并返回解析后的结果。抓取 Target 搜索“厨房电器”。
target_product抓取 Target 商品页面。抓取 Target 商品 92186007。
tiktok_post抓取 TikTok 帖子 URL 以获取结构化数据(如互动量、标题、话题标签)。抓取这条 TikTok 帖子:https://www.tiktok.com/@nba/video/7393013274725403950
tiktok_shop_search抓取 TikTok Shop 搜索指定查询词,并返回解析后的结果。抓取 TikTok Shop 搜索“手机壳”。
tiktok_shop_product抓取 TikTok Shop 商品页面。抓取 TikTok Shop 商品 1731541214379741272。
tiktok_shop_url通过 URL 抓取 TikTok Shop 页面。抓取这个 TikTok Shop URL:https://www.tiktok.com/shop/s?q=HEADPHONES
youtube_metadata抓取 YouTube 视频元数据。获取 YouTube 视频 dFu9aKJoqGg 的元数据。
youtube_channel抓取 YouTube 频道视频。抓取 YouTube 频道 @decodo_official。
youtube_subtitles抓取 YouTube 视频字幕。获取 YouTube 视频 L8zSWbQN-v8 的字幕。
youtube_search搜索 YouTube 视频。在 YouTube 搜索“如何照顾龙猫”。
reddit_post抓取指定的 Reddit 帖子。抓取以下 Reddit 帖子:https://www.reddit.com/r/horseracing/comments/1nsrn3/
reddit_subreddit抓取 Reddit 子版块结果。抓取本周 r/Python 排名前 5 的帖子。
reddit_user抓取 Reddit 用户主页及其帖子和评论。抓取这个 Reddit 用户:https://www.reddit.com/user/IWasRightOnce/
bing_search抓取 Bing 搜索结果。在 Bing 搜索“笔记本电脑评测”。
chatgpt搜索并与 ChatGPT 交互,获取 AI 驱动的回复和对话。让 ChatGPT 用简单的话解释量子计算。
perplexity搜索并与 Perplexity 交互,获取 AI 驱动的回复和对话。询问 Perplexity 网页开发的最新趋势是什么。

参数

以下参数会根据用户提示词自动推断:

参数描述
jsRender在无头浏览器中渲染目标 URL。
geo设置请求来源的国家/地区。
locale设置请求的语言区域。
tokenLimit将响应内容截断到此限制长度。当上下文窗口较小时很有用。
prompt发送给 AI 工具的提示词(chatgptperplexity)。
search激活 ChatGPT 的联网搜索功能(仅限 chatgpt)。
xhr为 true 时,在支持的场景下将 XHR 或 fetch 响应包含在抓取结果中(例如 tiktok_post)。
deviceType请求模拟的设备类型(desktopmobiletablet)。
domain请求使用的域名(例如 amazon.comamazon.co.ukbing.com)。
pageFrom分页的起始页码。
deliveryZip配送地址的邮政编码(Target、Walmart)。
storeId本地库存的门店 ID(Target、Walmart)。
countryTikTok Shop 请求的国家/地区。
limit返回的最大结果数(例如 YouTube 频道视频)。
language_code字幕的语言代码(例如 enes)。

示例

抓取受地域限制的内容

向你的 AI 代理发送以下提示词:

Scrape peacock.com from a German IP address and tell me the pricing.

该提示词会提示 peacock.com 受地域限制。要绕过地域限制:

Scrape peacock.com from a US IP address and tell me the pricing.

限制响应 token 数量

如果你的代理上下文窗口较小,抓取返回的内容会被自动截断,以避免上下文溢出。你可以在提示词中增加返回的 token 数量:

Scrape hacker news, return 50k tokens.

如果你的代理上下文窗口较大,告诉它返回 full content

Scrape hacker news, return full content.

与 Decodo 代理技能配合使用

此服务器为你的代理提供抓取工具Decodo/agent-skills 教它何时使用这些工具、使用哪个抓取目标,以及如何调用——这样代理就能自行选择正确的工具和参数,而不是靠猜测。

这些技能可跨 decodo CLI、本托管的 MCP 服务器以及原始 HTTP API 路由,并在没有可用 shell 时自动回退到 MCP 服务器。将两者结合,你的代理就能在单一设置中同时获得执行层(此服务器)和决策层(技能)。

快速开始(Claude Code):

/plugin marketplace add Decodo/agent-skills
/plugin install decodo@decodo-skills

有关手动安装和其他代理(Cursor、Codex、Gemini CLI、Windsurf),请参阅 agent-skills README

相关仓库

Web Scraping APIDecodo agent skillsDecodo OpenClaw skill

立即体验

只需几次点击,即可将 Decodo MCP Server 接入你的 AI 工作流,让你的 AI 代理实时获取任意网站的数据。

免费开始 | 文档 | Discord

许可证

所有代码均以 MIT 许可证 发布。