Decodo

官方

簡化網頁資料存取,輕鬆從網站與線上來源擷取資訊。

你可以用 Decodo MCP 做什麼?

  • 將任何網頁擷取為 Markdown — 透過 scrape_as_markdown 從網址提取乾淨、適合大型語言模型使用的內容。
  • 擷取網頁螢幕截圖 — 使用 screenshot 為任何網站拍攝視覺快照。
  • 搜尋 Google 與 Bing — 經由 google_searchbing_search 取得解析後的搜尋引擎結果頁面資料。
  • 提取電子商務產品資料 — 在 Amazon、Walmart 或 Target 查詢價格、賣家及暢銷商品。
  • 收集社群媒體內容 — 擷取 Reddit 貼文、TikTok 影片或 YouTube 中繼資料與字幕。
  • 查詢 AI 搜尋工具 — 與 ChatGPT、Perplexity 或 Google AI Mode 互動,取得 AI 驅動的答案。

文件

Decodo MCP 伺服器

Install MCP Server

使用 MCP(模型上下文協定)將 LLM 和 AI 代理程式連接到即時網路資料。Decodo MCP 伺服器讓您可以直接從 Claude、Cursor 和 Windsurf 等 AI 工具中抓取網站、搜尋引擎、電子商務平台和社群媒體,完全無需從頭開始建置抓取基礎架構。

  • 結構化輸出:JSON、Markdown 和螢幕截圖
  • 伺服器端 JavaScript 渲染和反機器人處理
  • 遍佈 195+ 個地點的 1.25 億+ IP

什麼是 Decodo MCP 伺服器?

Decodo MCP 伺服器是 AI 代理程式的網頁抓取層。它將相容於 MCP 的用戶端連接到 Decodo 的網頁抓取 API,從而實現:

  • 適用於 LLM 的網頁抓取
  • 用於 RAG 的即時資料擷取
  • AI 代理程式瀏覽和研究
  • 從動態網站進行結構化資料提取

您無需維護代理、解析器和重試邏輯,即可獲得一個可靠的網頁資料存取整合點。

為什麼要使用 MCP 進行網頁抓取?

模型上下文協定(MCP)是將 AI 代理程式連接到外部工具和資料來源的新興標準。透過 MCP:

  • 代理程式可以動態呼叫工具
  • 整合保持標準化
  • 工作流程可跨環境擴展

Decodo MCP 伺服器透過此標準為您的代理程式提供可靠、可立即投入生產的網頁存取。

主要功能

適用於 AI 代理程式的網頁抓取,無需基礎架構。 抓取任何網站,包括大量使用 JavaScript 的頁面,無需處理代理輪換、CAPTCHA 破解或反機器人系統。

適用於 LLM 工作流程的結構化輸出。 Markdown(LLM 就緒)、JSON(用於結構化管線)和螢幕截圖(用於視覺化上下文),專為 RAG 管線、AI 研究代理程式和自動化流程而建置。

內建支援熱門目標。 為 Google 和 Bing(SERP)、Amazon、Walmart 和 Target(電子商務)、Reddit、TikTok 和 YouTube(社群媒體),以及 ChatGPT 和 Perplexity(AI 搜尋)提供現成工具。

全球代理基礎架構。 1.25 億+ 住宅 IP、195+ 個地理位置,即使在最受保護的目標上也能達到 99.99% 的成功率。

模組化 MCP 工具集。 僅啟用您需要的功能:websearchecommercesocial_mediaai,以實現更清晰的工具選擇和更好的代理程式效能。

快速實現價值。 從 API 金鑰到首次抓取只需幾分鐘,無設定開銷。

使用案例

當您需要為 AI 代理程式進行網頁抓取、大規模結構化資料提取、可靠地存取動態網站、用於 RAG 的即時資料,或作為從頭開始建置抓取基礎架構的替代方案時,請使用 Decodo MCP 伺服器。常見情境:

  • AI 驅動的網頁抓取 – 讓 LLM 能夠收集最新資料,而不是依賴靜態訓練資料。
  • 使用即時資料的 RAG – 將即時的 Google、Bing 和 AI 搜尋結果拉取到擷取管線中。
  • 電子商務情報 – 在不被封鎖的情況下,追蹤各市場的產品價格、清單和賣家。
  • 社群媒體資料收集 – 從 Reddit、TikTok 和 YouTube 收集貼文、頻道和互動資料。
  • 旅遊和價格聚合 – 建置能跨網站收集即時定價和可用性的工具。

快速入門

  1. 建立免費帳戶,網址為 dashboard.decodo.com – 高達 2K 次免費請求,無需信用卡。
  2. 取得您的 API 金鑰。 從儀表板獲取 Web Scraping API 的基本驗證權杖。
  3. 下載 Node.js 18+,網址為 https://nodejs.org.
  4. 取得 MCP 用戶端,例如 Claude Desktop、Cursor、Windsurf 或其他相容於 MCP 的工具。
  5. 在您的 AI 用戶端中設定 MCP 伺服器(請參閱下方的設定範例)。

連接到 Decodo 的 MCP 伺服器

開啟您偏好的 MCP 用戶端並新增以下設定(請參閱下方 Claude Code、Cursor、Windsurf 的範例):

{
  "mcpServers": {
    "Decodo": {
      "url": "https://mcp.decodo.com/mcp",
      "headers": {
        "Authorization": "Basic <basic_auth_token>"
      }
    }
  }
}

Claude Desktop

  1. 開啟 Claude Desktop → 設定 → 開發人員 → 編輯設定。
  2. 新增至 claude_desktop_config.json:
{
  "mcpServers": {
    "Decodo": {
      "command": "npx",
      "args": ["-y", "@decodo/mcp-server"],
      "env": {
        "SCRAPER_API_TOKEN": "<basic_auth_token>",
        "TOOLSETS": "web,ai"
      }
    }
  }
}
  1. 儲存並重新啟動 Claude Desktop。

Cursor

  1. 開啟設定 → MCP。
  2. 點擊「新增全域 MCP 伺服器」(開啟 mcp.json)。
  3. 新增與上述相同的設定。
  4. 儲存 — 尋找 Decodo 旁邊的綠色狀態指示燈。

Windsurf

  1. 開啟設定 → Windsurf 設定。
  2. 捲動至 Cascade → 新增自訂伺服器 +(開啟 mcp_config.json)。
  3. 新增與上述相同的設定。
  4. 儲存並重新啟動 Windsurf。

測試您的設定

連接後,在您的用戶端中嘗試此提示:

▎ "抓取 Hacker News 前 5 篇文章的標題"

您應該在幾秒鐘內收到結構化清單。如果您看到驗證錯誤,請仔細檢查儀表板中的權杖。

選用:啟用特定工具集

在本機執行 MCP 伺服器

先決條件

逐步指南

  1. 複製此儲存庫:
git clone https://github.com/Decodo/mcp-server
  1. 在終端機中執行以下指令:
cd decodo-mcp-server
npm install
npm run build
  1. 記下您的建置位置:
cd build/
pwd

index.js 新增至此目錄的末尾,您的建置檔案位置應類似於:

/Users/your.user/projects/decodo-mcp/build/index.js
  1. 使用伺服器資訊更新您的 MCP 用戶端:
{
  "mcpServers": {
    "decodo-mcp": {
      "command": "node",
      "args": ["/Users/your.user/projects/decodo-mcp/build/index.js"],
      "env": {
        "SCRAPER_API_TOKEN": "<web_scraping_api_base64_token>"
      }
    }
  }
}

工具集

工具被組織成工具集。您可以透過 toolsets 查詢參數傳遞逗號分隔的清單,來選擇性地啟用特定工具集:

    "Decodo MCP Server": {
      "url": "https://mcp.decodo.com/mcp?toolsets=web,ai",
      "headers": {
        "Authorization": "Basic <your_auth_token>"
      }
    }

若未指定工具集,則會註冊所有工具。

工具集工具
webscrape_as_markdownscreenshot
searchgoogle_searchgoogle_adsgoogle_lensgoogle_travel_hotelsbing_search
ecommerceamazon_searchamazon_productamazon_pricingamazon_sellersamazon_bestsellerswalmart_searchwalmart_producttarget_searchtarget_producttiktok_shop_searchtiktok_shop_producttiktok_shop_url
social_mediareddit_postreddit_subredditreddit_usertiktok_postyoutube_metadatayoutube_channelyoutube_subtitlesyoutube_search
aichatgptperplexitygoogle_ai_mode

工具

伺服器公開以下工具:

工具描述範例提示
scrape_as_markdown抓取任何目標網址,預期透過提示提供網址。以 Markdown 格式回傳結果。從美國 IP 位址抓取 peacock.com,並告訴我定價。
screenshot擷取任何網頁的螢幕截圖,並以 PNG 圖片格式回傳。從美國 IP 位址擷取 github.com 的螢幕截圖。
google_search針對給定的查詢抓取 Google 搜尋,並回傳解析後的結果。抓取 Google 搜尋「鞋子」,並告訴我排名最高的結果。
google_ads抓取 Google Ads 搜尋結果。抓取 Google Ads 搜尋「筆電」,並顯示頂部廣告。
google_lens抓取 Google Lens 圖片搜尋結果。用 Google Lens 搜尋這張圖片:https://example.com/image.jpg
google_ai_mode抓取 Google AI 模式(AI 搜尋)結果。詢問 Google AI 模式:排名前三的犬種是什麼?
google_travel_hotels抓取 Google Travel 飯店搜尋結果。搜尋 Google Travel 飯店,尋找巴黎的飯店。
amazon_search針對給定的查詢抓取 Amazon 搜尋,並回傳解析後的結果。抓取 Amazon 搜尋「無線鍵盤」。
amazon_product抓取 Amazon 產品頁面。抓取 Amazon 產品 B09H74FXNW,並顯示詳細資訊。
amazon_pricing抓取 Amazon 產品定價資訊。取得 Amazon 產品 B09H74FXNW 的定價。
amazon_sellers抓取 Amazon 賣家資訊。取得 Amazon 賣家 A1R0Z7FJGTKESH 的資訊。
amazon_bestsellers抓取 Amazon 暢銷商品清單。顯示 Amazon 電子產品類別的暢銷商品。
walmart_search針對給定的查詢抓取 Walmart 搜尋,並回傳解析後的結果。抓取 Walmart 搜尋「露營帳篷」。
walmart_product抓取 Walmart 產品頁面。抓取 Walmart 產品 15296401808。
target_search針對給定的查詢抓取 Target 搜尋,並回傳解析後的結果。抓取 Target 搜尋「廚房家電」。
target_product抓取 Target 產品頁面。抓取 Target 產品 92186007。
tiktok_post抓取 TikTok 貼文網址以取得結構化資料(例如互動數、說明、主題標籤)。抓取這則 TikTok 貼文:https://www.tiktok.com/@nba/video/7393013274725403950
tiktok_shop_search針對給定的查詢抓取 TikTok Shop 搜尋,並回傳解析後的結果。抓取 TikTok Shop 搜尋「手機殼」。
tiktok_shop_product抓取 TikTok Shop 產品頁面。抓取 TikTok Shop 產品 1731541214379741272。
tiktok_shop_url透過網址抓取 TikTok Shop 頁面。抓取這個 TikTok Shop 網址:https://www.tiktok.com/shop/s?q=HEADPHONES
youtube_metadata抓取 YouTube 影片中繼資料。取得 YouTube 影片 dFu9aKJoqGg 的中繼資料。
youtube_channel抓取 YouTube 頻道影片。抓取 YouTube 頻道 @decodo_official。
youtube_subtitles抓取 YouTube 影片字幕。取得 YouTube 影片 L8zSWbQN-v8 的字幕。
youtube_search搜尋 YouTube 影片。在 YouTube 搜尋「如何照顧龍貓」。
reddit_post抓取特定的 Reddit 貼文。抓取以下 Reddit 貼文:https://www.reddit.com/r/horseracing/comments/1nsrn3/
reddit_subreddit抓取 Reddit 子版塊結果。抓取本週 r/Python 的前 5 則熱門貼文。
reddit_user抓取 Reddit 使用者個人資料及其貼文/留言。抓取這位 Reddit 使用者:https://www.reddit.com/user/IWasRightOnce/
bing_search抓取 Bing 搜尋結果。搜尋 Bing 尋找筆電評論。
chatgpt搜尋並與 ChatGPT 互動,以獲得 AI 驅動的回應和對話。要求 ChatGPT 用簡單的術語解釋量子運算。
perplexity搜尋並與 Perplexity 互動,以獲得 AI 驅動的回應和對話。詢問 Perplexity 網頁開發的最新趨勢是什麼。

參數

以下參數是從使用者提示中推斷出來的:

參數描述
jsRender在無頭瀏覽器中呈現目標網址。
geo設定請求的來源國家。
locale設定請求的語言地區。
tokenLimit將回應內容截斷至此上限。當上下文視窗較小時很有用。
prompt傳送給 AI 工具的提示(chatgptperplexity)。
search啟用 ChatGPT 的網頁搜尋功能(僅限 chatgpt)。
xhr設為 true 時,在支援的情況下(例如 tiktok_post),將 XHR 或 fetch 回應包含在抓取結果中。
deviceType為請求模擬的裝置類型(desktopmobiletablet)。
domain用於請求的網域(例如 amazon.comamazon.co.ukbing.com)。
pageFrom分頁的起始頁碼。
deliveryZip配送地點的郵遞區號(Target、Walmart)。
storeId用於本地庫存的商店 ID(Target、Walmart)。
countryTikTok Shop 請求的國家/地區。
limit要回傳的結果數量上限(例如 YouTube 頻道影片)。
language_code字幕的語言代碼(例如 enes)。

範例

抓取受地理限制的內容

使用以下提示查詢您的 AI 代理:

Scrape peacock.com from a German IP address and tell me the pricing.

此提示將顯示 peacock.com 受到地理限制。若要繞過地理限制:

Scrape peacock.com from a US IP address and tell me the pricing.

限制回應 token 數量

如果您的代理上下文視窗較小,從抓取回傳的內容將自動 截斷,以避免上下文溢出。您可以在提示中增加回傳的 token 數量:

Scrape hacker news, return 50k tokens.

如果您的代理具有較大的上下文視窗,請告訴它回傳 full content

Scrape hacker news, return full content.

與 Decodo 代理技能搭配使用

此伺服器為您的代理提供抓取工具Decodo/agent-skills 教導它何時使用這些工具、使用哪個介面,以及如何呼叫——因此代理 能自行選擇正確的工具和參數,而不是靠猜測。

這些技能會透過 decodo CLI、此託管的 MCP 伺服器和原始 HTTP API 進行路由,並在 沒有可用的 shell 時自動退回到 MCP 伺服器。將兩者配對,可在單一設定中為您的代理提供 執行層(此伺服器)和決策層(技能)。

快速入門(Claude Code):

/plugin marketplace add Decodo/agent-skills
/plugin install decodo@decodo-skills

有關手動安裝和其他代理(Cursor、Codex、Gemini CLI、Windsurf),請參閱 agent-skills README

相關儲存庫

Web Scraping APIDecodo agent skillsDecodo OpenClaw skill

立即試用

只需點擊幾下,即可將 Decodo MCP Server 整合到您的 AI 工作流程中,並為您的 AI 代理配備 來自任何網站的即時資料。

免費開始 | 文件 | Discord

授權

所有程式碼均依據 MIT 授權 發布。