Decodo
官方轻松访问网页数据。简化从网站和在线来源获取信息的过程。
你可以用 Decodo MCP 做什么?
- 将任意网页抓取为 Markdown — 让您的助手通过
scrape_as_markdown获取 URL,并返回干净、适合 LLM 使用的内容,即使网站重度依赖 JavaScript 也能处理。 - 捕获页面截图 — 使用
screenshot请求任意网页的视觉快照,并支持地理位置和设备模拟选项。 - 执行搜索引擎查询 — 使用
google_search、bing_search或google_ai_mode等工具,从 Google、Bing 或 Google AI 模式获取解析后的结果。 - 跟踪电商产品和价格 — 使用
amazon_pricing和walmart_search等工具,监控 Amazon、Walmart、Target 和 TikTok Shop 上的商品、价格和卖家信息。 - 收集社交媒体数据 — 通过
reddit_subreddit和youtube_subtitles等工具,从 Reddit、TikTok 和 YouTube 获取帖子、频道信息、字幕和互动数据。 - 查询 AI 搜索引擎 — 直接在您的工作流程中,从
chatgpt或perplexity获取 AI 生成的答案和对话内容。
文档
Decodo MCP 服务器
使用 MCP(模型上下文协议)将 LLM 和 AI 代理连接到实时网络数据。Decodo MCP 服务器让您可以直接从 Claude、Cursor 和 Windsurf 等 AI 工具中抓取网站、搜索引擎、电子商务平台和社交媒体, 无需从头构建抓取基础设施。
- 结构化输出,支持 JSON、Markdown 和截图
- 服务端 JavaScript 渲染和反机器人处理
- 覆盖 195+ 个地区的 1.25 亿+ IP
什么是 Decodo MCP 服务器?
Decodo MCP 服务器是面向 AI 代理的网络抓取层。它将兼容 MCP 的客户端连接到 Decodo 的网页抓取 API,支持:
- 面向 LLM 的网页抓取
- 用于 RAG 的实时数据检索
- AI 代理浏览和研究
- 从动态网站提取结构化数据
无需维护代理、解析器和重试逻辑,您只需一个集成点即可获得可靠的网络数据访问。
为什么使用 MCP 进行网页抓取?
模型上下文协议(MCP)是将 AI 代理连接到外部工具和数据源的新兴标准。使用 MCP:
- 代理可以动态调用工具
- 集成保持标准化
- 工作流可跨环境扩展
Decodo MCP 服务器通过这一标准为您的代理提供可靠、生产级的网络访问能力。
主要特性
面向 AI 代理的网页抓取,无需基础设施。 抓取任何网站,包括 JavaScript 密集型页面,无需处理代理轮换、CAPTCHA 验证或反机器人系统。
面向 LLM 工作流的结构化输出。 Markdown(适合 LLM)、JSON(适合结构化管道)和 截图(用于视觉上下文),专为 RAG 管道、AI 研究代理和自动化流程而构建。
内置对热门目标的支持。 为 Google 和 Bing(搜索引擎结果页)、Amazon、 Walmart 和 Target(电子商务)、Reddit、TikTok 和 YouTube(社交媒体)以及 ChatGPT 和 Perplexity(AI 搜索)提供现成工具。
全球代理基础设施。 1.25 亿+ 住宅 IP、195+ 个地理位置,即使面对保护最严格的目标 也能达到 99.99% 的成功率。
模块化 MCP 工具集。 只启用您需要的功能:web、search、ecommerce、social_media、
ai,以获得更简洁的工具选择和更好的代理性能。
快速见效。 从获取 API 密钥到首次抓取只需几分钟,无需额外设置。
使用场景
当您需要面向 AI 代理的网页抓取、大规模结构化数据提取、对动态网站的可靠访问、用于 RAG 的实时数据, 或希望替代从头构建抓取基础设施时,可以使用 Decodo MCP 服务器。常见场景:
- AI 驱动的网页抓取 – 让 LLM 能够收集最新数据,而不是依赖 静态训练数据。
- 带实时数据的 RAG – 将实时的 Google、Bing 和 AI 搜索结果引入检索 管道。
- 电子商务情报 – 跨市场平台跟踪产品价格、列表和卖家, 而不会被屏蔽。
- 社交媒体数据收集 – 从 Reddit、TikTok 和 YouTube 收集帖子、频道和互动数据。
- 旅行和价格聚合 – 构建跨网站收集实时价格和可用性信息的工具。
快速开始
- 创建免费账户,访问 dashboard.decodo.com – 最高 2K 次免费请求,无需信用卡。
- 获取您的 API 密钥。 从仪表板获取网页抓取 API 基本认证令牌。
- 下载 Node.js 18+,从 https://nodejs.org.
- 获取 MCP 客户端,如 Claude Desktop、Cursor、Windsurf 或其他兼容 MCP 的 工具。
- 在您的 AI 客户端中配置 MCP 服务器(参见下面的配置示例)。
连接到 Decodo 的 MCP 服务器
打开您首选的 MCP 客户端并添加以下配置(参见下面 Claude Code、Cursor、Windsurf 的示例):
{
"mcpServers": {
"Decodo": {
"url": "https://mcp.decodo.com/mcp",
"headers": {
"Authorization": "Basic <basic_auth_token>"
}
}
}
}
Claude Desktop
- 打开 Claude Desktop → 设置 → 开发者 → 编辑配置。
- 添加到 claude_desktop_config.json:
{
"mcpServers": {
"Decodo": {
"command": "npx",
"args": ["-y", "@decodo/mcp-server"],
"env": {
"SCRAPER_API_TOKEN": "<basic_auth_token>",
"TOOLSETS": "web,ai"
}
}
}
}
- 保存并重启 Claude Desktop。
Cursor
- 打开设置 → MCP。
- 点击添加新的全局 MCP 服务器(打开 mcp.json)。
- 添加上面相同的配置。
- 保存 — 查看 Decodo 旁边是否有绿色状态指示器。
Windsurf
- 打开设置 → Windsurf 设置。
- 滚动到 Cascade → 添加自定义服务器 +(打开 mcp_config.json)。
- 添加上面相同的配置。
- 保存并重启 Windsurf。
测试您的设置
连接后,在您的客户端中尝试以下提示:
▎ "抓取 Hacker News 前 5 篇文章的标题"
您应该在几秒钟内收到结构化列表。如果看到认证错误,请从仪表板仔细检查您的令牌。
可选:启用特定工具集
本地运行 MCP 服务器
前提条件
- Node.js 18.0+
- 一个 MCP 客户端 - 热门选择包括 Claude Desktop 和 Cursor
分步指南
- 克隆此仓库:
git clone https://github.com/Decodo/mcp-server
- 在终端中运行以下命令:
cd decodo-mcp-server
npm install
npm run build
- 记下您的构建位置:
cd build/
pwd
在此目录末尾添加 index.js,您的构建文件位置应该类似于:
/Users/your.user/projects/decodo-mcp/build/index.js
- 使用服务器信息更新您的 MCP 客户端:
{
"mcpServers": {
"decodo-mcp": {
"command": "node",
"args": ["/Users/your.user/projects/decodo-mcp/build/index.js"],
"env": {
"SCRAPER_API_TOKEN": "<web_scraping_api_base64_token>"
}
}
}
}
工具集
工具按工具集组织。您可以通过 toolsets 查询参数传递逗号分隔的列表来选择性启用特定工具集:
"Decodo MCP Server": {
"url": "https://mcp.decodo.com/mcp?toolsets=web,ai",
"headers": {
"Authorization": "Basic <your_auth_token>"
}
}
当未指定工具集时,将注册所有工具。
| 工具集 | 工具 |
|---|---|
web | scrape_as_markdown、screenshot |
search | google_search、google_ads、google_lens、google_travel_hotels、bing_search |
ecommerce | amazon_search、amazon_product、amazon_pricing、amazon_sellers、amazon_bestsellers、walmart_search、walmart_product、target_search、target_product、tiktok_shop_search、tiktok_shop_product、tiktok_shop_url |
social_media | reddit_post、reddit_subreddit、reddit_user、tiktok_post、youtube_metadata、youtube_channel、youtube_subtitles、youtube_search |
ai | chatgpt、perplexity、google_ai_mode |
工具
服务器公开以下工具:
| 工具 | 描述 | 示例提示词 |
|---|---|---|
scrape_as_markdown | 抓取任意目标 URL,需要通过提示词提供 URL。以 Markdown 格式返回结果。 | 从美国 IP 抓取 peacock.com 并告诉我定价。 |
screenshot | 捕获任意网页的截图,并以 PNG 图片形式返回。 | 从美国 IP 截取 github.com 的截图。 |
google_search | 抓取 Google 搜索指定查询词,并返回解析后的结果。 | 抓取 Google 搜索“鞋子”并告诉我排名第一的结果。 |
google_ads | 抓取 Google Ads 搜索结果。 | 抓取 Google Ads 中“笔记本电脑”的广告并展示排名靠前的广告。 |
google_lens | 抓取 Google Lens 图片搜索结果。 | 用这张图片搜索 Google Lens:https://example.com/image.jpg |
google_ai_mode | 抓取 Google AI 模式(AI 搜索)结果。 | 询问 Google AI 模式:最受欢迎的三种犬类是什么? |
google_travel_hotels | 抓取 Google Travel Hotels 搜索结果。 | 搜索 Google Travel Hotels 查找巴黎的酒店。 |
amazon_search | 抓取 Amazon 搜索指定查询词,并返回解析后的结果。 | 抓取 Amazon 搜索“无线键盘”。 |
amazon_product | 抓取 Amazon 商品页面。 | 抓取 Amazon 商品 B09H74FXNW 并展示详情。 |
amazon_pricing | 抓取 Amazon 商品定价信息。 | 获取 Amazon 商品 B09H74FXNW 的定价。 |
amazon_sellers | 抓取 Amazon 卖家信息。 | 获取 Amazon 卖家 A1R0Z7FJGTKESH 的信息。 |
amazon_bestsellers | 抓取 Amazon 畅销榜列表。 | 展示电子产品类目的 Amazon 畅销榜。 |
walmart_search | 抓取 Walmart 搜索指定查询词,并返回解析后的结果。 | 抓取 Walmart 搜索“露营帐篷”。 |
walmart_product | 抓取 Walmart 商品页面。 | 抓取 Walmart 商品 15296401808。 |
target_search | 抓取 Target 搜索指定查询词,并返回解析后的结果。 | 抓取 Target 搜索“厨房电器”。 |
target_product | 抓取 Target 商品页面。 | 抓取 Target 商品 92186007。 |
tiktok_post | 抓取 TikTok 帖子 URL 以获取结构化数据(如互动量、标题、话题标签)。 | 抓取这条 TikTok 帖子:https://www.tiktok.com/@nba/video/7393013274725403950 |
tiktok_shop_search | 抓取 TikTok Shop 搜索指定查询词,并返回解析后的结果。 | 抓取 TikTok Shop 搜索“手机壳”。 |
tiktok_shop_product | 抓取 TikTok Shop 商品页面。 | 抓取 TikTok Shop 商品 1731541214379741272。 |
tiktok_shop_url | 通过 URL 抓取 TikTok Shop 页面。 | 抓取这个 TikTok Shop URL:https://www.tiktok.com/shop/s?q=HEADPHONES |
youtube_metadata | 抓取 YouTube 视频元数据。 | 获取 YouTube 视频 dFu9aKJoqGg 的元数据。 |
youtube_channel | 抓取 YouTube 频道视频。 | 抓取 YouTube 频道 @decodo_official。 |
youtube_subtitles | 抓取 YouTube 视频字幕。 | 获取 YouTube 视频 L8zSWbQN-v8 的字幕。 |
youtube_search | 搜索 YouTube 视频。 | 在 YouTube 搜索“如何照顾龙猫”。 |
reddit_post | 抓取指定的 Reddit 帖子。 | 抓取以下 Reddit 帖子:https://www.reddit.com/r/horseracing/comments/1nsrn3/ |
reddit_subreddit | 抓取 Reddit 子版块结果。 | 抓取本周 r/Python 排名前 5 的帖子。 |
reddit_user | 抓取 Reddit 用户主页及其帖子和评论。 | 抓取这个 Reddit 用户:https://www.reddit.com/user/IWasRightOnce/ |
bing_search | 抓取 Bing 搜索结果。 | 在 Bing 搜索“笔记本电脑评测”。 |
chatgpt | 搜索并与 ChatGPT 交互,获取 AI 驱动的回复和对话。 | 让 ChatGPT 用简单的话解释量子计算。 |
perplexity | 搜索并与 Perplexity 交互,获取 AI 驱动的回复和对话。 | 询问 Perplexity 网页开发的最新趋势是什么。 |
参数
以下参数会根据用户提示词自动推断:
| 参数 | 描述 |
|---|---|
jsRender | 在无头浏览器中渲染目标 URL。 |
geo | 设置请求来源的国家/地区。 |
locale | 设置请求的语言区域。 |
tokenLimit | 将响应内容截断到此限制长度。当上下文窗口较小时很有用。 |
prompt | 发送给 AI 工具的提示词(chatgpt、perplexity)。 |
search | 激活 ChatGPT 的联网搜索功能(仅限 chatgpt)。 |
xhr | 为 true 时,在支持的场景下将 XHR 或 fetch 响应包含在抓取结果中(例如 tiktok_post)。 |
deviceType | 请求模拟的设备类型(desktop、mobile、tablet)。 |
domain | 请求使用的域名(例如 amazon.com、amazon.co.uk、bing.com)。 |
pageFrom | 分页的起始页码。 |
deliveryZip | 配送地址的邮政编码(Target、Walmart)。 |
storeId | 本地库存的门店 ID(Target、Walmart)。 |
country | TikTok Shop 请求的国家/地区。 |
limit | 返回的最大结果数(例如 YouTube 频道视频)。 |
language_code | 字幕的语言代码(例如 en、es)。 |
示例
抓取受地域限制的内容
向你的 AI 代理发送以下提示词:
Scrape peacock.com from a German IP address and tell me the pricing.
该提示词会提示 peacock.com 受地域限制。要绕过地域限制:
Scrape peacock.com from a US IP address and tell me the pricing.
限制响应 token 数量
如果你的代理上下文窗口较小,抓取返回的内容会被自动截断,以避免上下文溢出。你可以在提示词中增加返回的 token 数量:
Scrape hacker news, return 50k tokens.
如果你的代理上下文窗口较大,告诉它返回 full content:
Scrape hacker news, return full content.
与 Decodo 代理技能配合使用
此服务器为你的代理提供抓取工具。Decodo/agent-skills
教它何时使用这些工具、使用哪个抓取目标,以及如何调用——这样代理就能自行选择正确的工具和参数,而不是靠猜测。
这些技能可跨 decodo CLI、本托管的 MCP 服务器以及原始 HTTP API 路由,并在没有可用 shell 时自动回退到 MCP 服务器。将两者结合,你的代理就能在单一设置中同时获得执行层(此服务器)和决策层(技能)。
快速开始(Claude Code):
/plugin marketplace add Decodo/agent-skills
/plugin install decodo@decodo-skills
有关手动安装和其他代理(Cursor、Codex、Gemini CLI、Windsurf),请参阅 agent-skills README。
相关仓库
Web Scraping API、 Decodo agent skills、 Decodo OpenClaw skill
立即体验
只需几次点击,即可将 Decodo MCP Server 接入你的 AI 工作流,让你的 AI 代理实时获取任意网站的数据。
许可证
所有代码均以 MIT 许可证 发布。