Decodo
官方簡化網頁資料存取,輕鬆從網站與線上來源擷取資訊。
你可以用 Decodo MCP 做什麼?
- 將任何網頁擷取為 Markdown — 透過
scrape_as_markdown從網址提取乾淨、適合大型語言模型使用的內容。 - 擷取網頁螢幕截圖 — 使用
screenshot為任何網站拍攝視覺快照。 - 搜尋 Google 與 Bing — 經由
google_search和bing_search取得解析後的搜尋引擎結果頁面資料。 - 提取電子商務產品資料 — 在 Amazon、Walmart 或 Target 查詢價格、賣家及暢銷商品。
- 收集社群媒體內容 — 擷取 Reddit 貼文、TikTok 影片或 YouTube 中繼資料與字幕。
- 查詢 AI 搜尋工具 — 與 ChatGPT、Perplexity 或 Google AI Mode 互動,取得 AI 驅動的答案。
文件
Decodo MCP 伺服器
使用 MCP(模型上下文協定)將 LLM 和 AI 代理程式連接到即時網路資料。Decodo MCP 伺服器讓您可以直接從 Claude、Cursor 和 Windsurf 等 AI 工具中抓取網站、搜尋引擎、電子商務平台和社群媒體,完全無需從頭開始建置抓取基礎架構。
- 結構化輸出:JSON、Markdown 和螢幕截圖
- 伺服器端 JavaScript 渲染和反機器人處理
- 遍佈 195+ 個地點的 1.25 億+ IP
什麼是 Decodo MCP 伺服器?
Decodo MCP 伺服器是 AI 代理程式的網頁抓取層。它將相容於 MCP 的用戶端連接到 Decodo 的網頁抓取 API,從而實現:
- 適用於 LLM 的網頁抓取
- 用於 RAG 的即時資料擷取
- AI 代理程式瀏覽和研究
- 從動態網站進行結構化資料提取
您無需維護代理、解析器和重試邏輯,即可獲得一個可靠的網頁資料存取整合點。
為什麼要使用 MCP 進行網頁抓取?
模型上下文協定(MCP)是將 AI 代理程式連接到外部工具和資料來源的新興標準。透過 MCP:
- 代理程式可以動態呼叫工具
- 整合保持標準化
- 工作流程可跨環境擴展
Decodo MCP 伺服器透過此標準為您的代理程式提供可靠、可立即投入生產的網頁存取。
主要功能
適用於 AI 代理程式的網頁抓取,無需基礎架構。 抓取任何網站,包括大量使用 JavaScript 的頁面,無需處理代理輪換、CAPTCHA 破解或反機器人系統。
適用於 LLM 工作流程的結構化輸出。 Markdown(LLM 就緒)、JSON(用於結構化管線)和螢幕截圖(用於視覺化上下文),專為 RAG 管線、AI 研究代理程式和自動化流程而建置。
內建支援熱門目標。 為 Google 和 Bing(SERP)、Amazon、Walmart 和 Target(電子商務)、Reddit、TikTok 和 YouTube(社群媒體),以及 ChatGPT 和 Perplexity(AI 搜尋)提供現成工具。
全球代理基礎架構。 1.25 億+ 住宅 IP、195+ 個地理位置,即使在最受保護的目標上也能達到 99.99% 的成功率。
模組化 MCP 工具集。 僅啟用您需要的功能:web、search、ecommerce、social_media、ai,以實現更清晰的工具選擇和更好的代理程式效能。
快速實現價值。 從 API 金鑰到首次抓取只需幾分鐘,無設定開銷。
使用案例
當您需要為 AI 代理程式進行網頁抓取、大規模結構化資料提取、可靠地存取動態網站、用於 RAG 的即時資料,或作為從頭開始建置抓取基礎架構的替代方案時,請使用 Decodo MCP 伺服器。常見情境:
- AI 驅動的網頁抓取 – 讓 LLM 能夠收集最新資料,而不是依賴靜態訓練資料。
- 使用即時資料的 RAG – 將即時的 Google、Bing 和 AI 搜尋結果拉取到擷取管線中。
- 電子商務情報 – 在不被封鎖的情況下,追蹤各市場的產品價格、清單和賣家。
- 社群媒體資料收集 – 從 Reddit、TikTok 和 YouTube 收集貼文、頻道和互動資料。
- 旅遊和價格聚合 – 建置能跨網站收集即時定價和可用性的工具。
快速入門
- 建立免費帳戶,網址為 dashboard.decodo.com – 高達 2K 次免費請求,無需信用卡。
- 取得您的 API 金鑰。 從儀表板獲取 Web Scraping API 的基本驗證權杖。
- 下載 Node.js 18+,網址為 https://nodejs.org.
- 取得 MCP 用戶端,例如 Claude Desktop、Cursor、Windsurf 或其他相容於 MCP 的工具。
- 在您的 AI 用戶端中設定 MCP 伺服器(請參閱下方的設定範例)。
連接到 Decodo 的 MCP 伺服器
開啟您偏好的 MCP 用戶端並新增以下設定(請參閱下方 Claude Code、Cursor、Windsurf 的範例):
{
"mcpServers": {
"Decodo": {
"url": "https://mcp.decodo.com/mcp",
"headers": {
"Authorization": "Basic <basic_auth_token>"
}
}
}
}
Claude Desktop
- 開啟 Claude Desktop → 設定 → 開發人員 → 編輯設定。
- 新增至 claude_desktop_config.json:
{
"mcpServers": {
"Decodo": {
"command": "npx",
"args": ["-y", "@decodo/mcp-server"],
"env": {
"SCRAPER_API_TOKEN": "<basic_auth_token>",
"TOOLSETS": "web,ai"
}
}
}
}
- 儲存並重新啟動 Claude Desktop。
Cursor
- 開啟設定 → MCP。
- 點擊「新增全域 MCP 伺服器」(開啟 mcp.json)。
- 新增與上述相同的設定。
- 儲存 — 尋找 Decodo 旁邊的綠色狀態指示燈。
Windsurf
- 開啟設定 → Windsurf 設定。
- 捲動至 Cascade → 新增自訂伺服器 +(開啟 mcp_config.json)。
- 新增與上述相同的設定。
- 儲存並重新啟動 Windsurf。
測試您的設定
連接後,在您的用戶端中嘗試此提示:
▎ "抓取 Hacker News 前 5 篇文章的標題"
您應該在幾秒鐘內收到結構化清單。如果您看到驗證錯誤,請仔細檢查儀表板中的權杖。
選用:啟用特定工具集
在本機執行 MCP 伺服器
先決條件
- Node.js 18.0+
- 一個 MCP 用戶端 - 熱門選擇有 Claude Desktop 和 Cursor
逐步指南
- 複製此儲存庫:
git clone https://github.com/Decodo/mcp-server
- 在終端機中執行以下指令:
cd decodo-mcp-server
npm install
npm run build
- 記下您的建置位置:
cd build/
pwd
將 index.js 新增至此目錄的末尾,您的建置檔案位置應類似於:
/Users/your.user/projects/decodo-mcp/build/index.js
- 使用伺服器資訊更新您的 MCP 用戶端:
{
"mcpServers": {
"decodo-mcp": {
"command": "node",
"args": ["/Users/your.user/projects/decodo-mcp/build/index.js"],
"env": {
"SCRAPER_API_TOKEN": "<web_scraping_api_base64_token>"
}
}
}
}
工具集
工具被組織成工具集。您可以透過 toolsets 查詢參數傳遞逗號分隔的清單,來選擇性地啟用特定工具集:
"Decodo MCP Server": {
"url": "https://mcp.decodo.com/mcp?toolsets=web,ai",
"headers": {
"Authorization": "Basic <your_auth_token>"
}
}
若未指定工具集,則會註冊所有工具。
| 工具集 | 工具 |
|---|---|
web | scrape_as_markdown、screenshot |
search | google_search、google_ads、google_lens、google_travel_hotels、bing_search |
ecommerce | amazon_search、amazon_product、amazon_pricing、amazon_sellers、amazon_bestsellers、walmart_search、walmart_product、target_search、target_product、tiktok_shop_search、tiktok_shop_product、tiktok_shop_url |
social_media | reddit_post、reddit_subreddit、reddit_user、tiktok_post、youtube_metadata、youtube_channel、youtube_subtitles、youtube_search |
ai | chatgpt、perplexity、google_ai_mode |
工具
伺服器公開以下工具:
| 工具 | 描述 | 範例提示 |
|---|---|---|
scrape_as_markdown | 抓取任何目標網址,預期透過提示提供網址。以 Markdown 格式回傳結果。 | 從美國 IP 位址抓取 peacock.com,並告訴我定價。 |
screenshot | 擷取任何網頁的螢幕截圖,並以 PNG 圖片格式回傳。 | 從美國 IP 位址擷取 github.com 的螢幕截圖。 |
google_search | 針對給定的查詢抓取 Google 搜尋,並回傳解析後的結果。 | 抓取 Google 搜尋「鞋子」,並告訴我排名最高的結果。 |
google_ads | 抓取 Google Ads 搜尋結果。 | 抓取 Google Ads 搜尋「筆電」,並顯示頂部廣告。 |
google_lens | 抓取 Google Lens 圖片搜尋結果。 | 用 Google Lens 搜尋這張圖片:https://example.com/image.jpg |
google_ai_mode | 抓取 Google AI 模式(AI 搜尋)結果。 | 詢問 Google AI 模式:排名前三的犬種是什麼? |
google_travel_hotels | 抓取 Google Travel 飯店搜尋結果。 | 搜尋 Google Travel 飯店,尋找巴黎的飯店。 |
amazon_search | 針對給定的查詢抓取 Amazon 搜尋,並回傳解析後的結果。 | 抓取 Amazon 搜尋「無線鍵盤」。 |
amazon_product | 抓取 Amazon 產品頁面。 | 抓取 Amazon 產品 B09H74FXNW,並顯示詳細資訊。 |
amazon_pricing | 抓取 Amazon 產品定價資訊。 | 取得 Amazon 產品 B09H74FXNW 的定價。 |
amazon_sellers | 抓取 Amazon 賣家資訊。 | 取得 Amazon 賣家 A1R0Z7FJGTKESH 的資訊。 |
amazon_bestsellers | 抓取 Amazon 暢銷商品清單。 | 顯示 Amazon 電子產品類別的暢銷商品。 |
walmart_search | 針對給定的查詢抓取 Walmart 搜尋,並回傳解析後的結果。 | 抓取 Walmart 搜尋「露營帳篷」。 |
walmart_product | 抓取 Walmart 產品頁面。 | 抓取 Walmart 產品 15296401808。 |
target_search | 針對給定的查詢抓取 Target 搜尋,並回傳解析後的結果。 | 抓取 Target 搜尋「廚房家電」。 |
target_product | 抓取 Target 產品頁面。 | 抓取 Target 產品 92186007。 |
tiktok_post | 抓取 TikTok 貼文網址以取得結構化資料(例如互動數、說明、主題標籤)。 | 抓取這則 TikTok 貼文:https://www.tiktok.com/@nba/video/7393013274725403950 |
tiktok_shop_search | 針對給定的查詢抓取 TikTok Shop 搜尋,並回傳解析後的結果。 | 抓取 TikTok Shop 搜尋「手機殼」。 |
tiktok_shop_product | 抓取 TikTok Shop 產品頁面。 | 抓取 TikTok Shop 產品 1731541214379741272。 |
tiktok_shop_url | 透過網址抓取 TikTok Shop 頁面。 | 抓取這個 TikTok Shop 網址:https://www.tiktok.com/shop/s?q=HEADPHONES |
youtube_metadata | 抓取 YouTube 影片中繼資料。 | 取得 YouTube 影片 dFu9aKJoqGg 的中繼資料。 |
youtube_channel | 抓取 YouTube 頻道影片。 | 抓取 YouTube 頻道 @decodo_official。 |
youtube_subtitles | 抓取 YouTube 影片字幕。 | 取得 YouTube 影片 L8zSWbQN-v8 的字幕。 |
youtube_search | 搜尋 YouTube 影片。 | 在 YouTube 搜尋「如何照顧龍貓」。 |
reddit_post | 抓取特定的 Reddit 貼文。 | 抓取以下 Reddit 貼文:https://www.reddit.com/r/horseracing/comments/1nsrn3/ |
reddit_subreddit | 抓取 Reddit 子版塊結果。 | 抓取本週 r/Python 的前 5 則熱門貼文。 |
reddit_user | 抓取 Reddit 使用者個人資料及其貼文/留言。 | 抓取這位 Reddit 使用者:https://www.reddit.com/user/IWasRightOnce/ |
bing_search | 抓取 Bing 搜尋結果。 | 搜尋 Bing 尋找筆電評論。 |
chatgpt | 搜尋並與 ChatGPT 互動,以獲得 AI 驅動的回應和對話。 | 要求 ChatGPT 用簡單的術語解釋量子運算。 |
perplexity | 搜尋並與 Perplexity 互動,以獲得 AI 驅動的回應和對話。 | 詢問 Perplexity 網頁開發的最新趨勢是什麼。 |
參數
以下參數是從使用者提示中推斷出來的:
| 參數 | 描述 |
|---|---|
jsRender | 在無頭瀏覽器中呈現目標網址。 |
geo | 設定請求的來源國家。 |
locale | 設定請求的語言地區。 |
tokenLimit | 將回應內容截斷至此上限。當上下文視窗較小時很有用。 |
prompt | 傳送給 AI 工具的提示(chatgpt、perplexity)。 |
search | 啟用 ChatGPT 的網頁搜尋功能(僅限 chatgpt)。 |
xhr | 設為 true 時,在支援的情況下(例如 tiktok_post),將 XHR 或 fetch 回應包含在抓取結果中。 |
deviceType | 為請求模擬的裝置類型(desktop、mobile、tablet)。 |
domain | 用於請求的網域(例如 amazon.com、amazon.co.uk、bing.com)。 |
pageFrom | 分頁的起始頁碼。 |
deliveryZip | 配送地點的郵遞區號(Target、Walmart)。 |
storeId | 用於本地庫存的商店 ID(Target、Walmart)。 |
country | TikTok Shop 請求的國家/地區。 |
limit | 要回傳的結果數量上限(例如 YouTube 頻道影片)。 |
language_code | 字幕的語言代碼(例如 en、es)。 |
範例
抓取受地理限制的內容
使用以下提示查詢您的 AI 代理:
Scrape peacock.com from a German IP address and tell me the pricing.
此提示將顯示 peacock.com 受到地理限制。若要繞過地理限制:
Scrape peacock.com from a US IP address and tell me the pricing.
限制回應 token 數量
如果您的代理上下文視窗較小,從抓取回傳的內容將自動 截斷,以避免上下文溢出。您可以在提示中增加回傳的 token 數量:
Scrape hacker news, return 50k tokens.
如果您的代理具有較大的上下文視窗,請告訴它回傳 full content:
Scrape hacker news, return full content.
與 Decodo 代理技能搭配使用
此伺服器為您的代理提供抓取工具。Decodo/agent-skills
教導它何時使用這些工具、使用哪個介面,以及如何呼叫——因此代理
能自行選擇正確的工具和參數,而不是靠猜測。
這些技能會透過 decodo CLI、此託管的 MCP 伺服器和原始 HTTP API 進行路由,並在
沒有可用的 shell 時自動退回到 MCP 伺服器。將兩者配對,可在單一設定中為您的代理提供
執行層(此伺服器)和決策層(技能)。
快速入門(Claude Code):
/plugin marketplace add Decodo/agent-skills
/plugin install decodo@decodo-skills
有關手動安裝和其他代理(Cursor、Codex、Gemini CLI、Windsurf),請參閱 agent-skills README。
相關儲存庫
Web Scraping API、 Decodo agent skills、 Decodo OpenClaw skill
立即試用
只需點擊幾下,即可將 Decodo MCP Server 整合到您的 AI 工作流程中,並為您的 AI 代理配備 來自任何網站的即時資料。
授權
所有程式碼均依據 MIT 授權 發布。