Scrapeless

官方

將即時 Scrapeless Google SERP(Google 搜尋、Google 航班、Google 地圖、Google 職缺等)結果整合至您的 LLM 應用程式中。此伺服器可為 AI 工作流程、聊天機器人及研究工具提供動態上下文檢索功能。

你可以用 Scrapeless MCP 做什麼?

  • Google 搜尋與趨勢 — 透過 google_search 和 google_trends 詢問即時搜尋結果或趨勢資料。
  • 瀏覽器自動化 — 使用 browser_goto 和 browser_click 等工具,指揮雲端瀏覽器進行導覽、點擊、輸入、捲動及擷取螢幕截圖。
  • 抓取任何 URL — 使用 scrape_html、scrape_markdown 或 scrape_screenshot 取得頁面的 HTML、Markdown 或螢幕截圖。
  • 爬取整個網站 — 使用 crawl_start 啟動非同步爬蟲任務,再透過 crawl_result 輪詢取得結果。
  • AI 驅動的擷取 — 使用 ai_scraper 為 ChatGPT、Gemini 或 Perplexity 等引擎建立結構化的抓取任務。

文件

preview

Scrapeless MCP 伺服器

歡迎使用官方 Scrapeless 模型上下文協定(MCP)伺服器 — 這是一個強大的整合層,讓 LLM、AI 代理程式與 AI 應用程式能夠即時與網路互動。

Scrapeless MCP 伺服器建構於開放的 MCP 標準之上,可無縫連接 ChatGPT、Claude 等模型,以及 Cursor 和 Windsurf 等工具,提供多種外部能力,包括:

  • Google 服務整合(搜尋、趨勢)
  • 瀏覽器自動化,用於頁面層級的導覽與互動
  • 抓取動態、JavaScript 密集型網站 — 匯出為 HTML、Markdown 或螢幕截圖
  • 爬取整個網站,透過追蹤連結並以多種格式擷取每個頁面
  • AI 抓取器 為 ChatGPT、Gemini、Perplexity、Copilot、Google AI 模式、Google AI 概覽、Grok 或 Alexa 建立 AI 抓取任務

無論您正在建構 AI 研究助理、程式設計輔助工具,還是自主網路代理程式,此伺服器都能提供您工作流程所需的動態上下文與真實世界資料 — 且不會被封鎖。

使用範例

  1. 使用 Claude 進行自動化網路互動與資料擷取

使用 Scrapeless MCP 瀏覽器,Claude 可以透過對話指令執行複雜任務,例如網頁導覽、點擊、捲動與抓取,並透過 live sessions 即時預覽網路互動結果。

preview

  1. 繞過 Cloudflare 以取得目標頁面內容

使用 Scrapeless MCP 瀏覽器服務,自動存取 Cloudflare 頁面,流程完成後,頁面內容會以 Markdown 格式擷取並回傳。

preview

  1. 擷取動態渲染的頁面內容並寫入檔案

使用 Scrapeless MCP 通用 API,抓取上述目標頁面的 JavaScript 渲染內容,匯出為 Markdown 格式,最後寫入名為 text.md 的本地檔案。

preview

  1. 自動化 SERP 抓取

使用 Scrapeless MCP 伺服器,在 Google 搜尋中查詢關鍵字「web scraping」,取得前 10 筆搜尋結果(包含標題、連結與摘要),並將內容寫入名為 serp.text 的檔案。

preview

以下是一些使用這些伺服器的額外範例:

範例
使用 Google 搜尋搜尋 scrapeless。
查詢「AI」在過去一年的搜尋興趣。
使用瀏覽器造訪 chatgpt.com,搜尋「今天天氣如何?」,並總結結果。
抓取 scrapeless.com 頁面的 HTML 內容。
抓取 scrapeless.com 頁面的 Markdown 內容。
取得 scrapeless.com 的螢幕截圖。

設定指南

  1. 取得 Scrapeless 金鑰
  • 登入 Scrapeless 儀表板(提供免費試用)
  • 然後點擊左側的「設定」-> 選擇「API 金鑰管理」-> 點擊「建立 API 金鑰」。最後,點擊您建立的金鑰以複製它。

preview

  1. 設定您的 MCP 用戶端

Scrapeless MCP 伺服器支援 Stdio 與 Streamable HTTP 兩種傳輸模式。

🖥️ Stdio(本機執行)

{
  "mcpServers": {
    "Scrapeless MCP Server": {
      "command": "npx",
      "args": ["-y", "scrapeless-mcp-server"],
      "env": {
        "SCRAPELESS_API_KEY": "YOUR_SCRAPELESS_KEY"
      }
    }
  }
}

🌐 Streamable HTTP(託管 API 模式)

{
  "mcpServers": {
    "Scrapeless MCP Server": {
      "type": "streamable-http",
      "url": "https://api.scrapeless.com/mcp",
      "headers": {
        "x-api-token": "YOUR_SCRAPELESS_KEY"
      },
      "disabled": false,
      "alwaysAllow": []
    }
  }
}

進階選項

使用選用參數自訂瀏覽器工作階段行為。這些參數可透過環境變數(適用於 Stdio)或 HTTP 標頭(適用於 Streamable HTTP)設定:

Stdio(環境變數)Streamable HTTP(HTTP 標頭)說明
BROWSER_PROFILE_IDx-browser-profile-id指定可重複使用的瀏覽器設定檔 ID,以維持工作階段連續性。
BROWSER_PROFILE_PERSISTx-browser-profile-persist啟用 Cookie、本地儲存空間等的持久化儲存。
BROWSER_SESSION_TTLx-browser-session-ttl定義最大工作階段逾時(以秒為單位)。工作階段將在此閒置時間後自動過期。

與 Claude Desktop 整合

  1. 開啟 Claude Desktop
  2. 導覽至:Settings → Tools → MCP Servers
  3. 點擊 「新增 MCP 伺服器」
  4. 貼上上述的 Stdio 或 Streamable HTTP 設定
  5. 儲存並啟用伺服器
  6. Claude 現在將能夠使用 Scrapeless 發出網路查詢、擷取內容並與頁面互動

與 Cursor IDE 整合

  1. 開啟 Cursor
  2. 按下 Cmd + Shift + P 並搜尋:Configure MCP Servers
  3. 使用上述格式新增 Scrapeless MCP 設定
  4. 儲存檔案並重新啟動 Cursor(如有需要)
  5. 現在您可以向 Cursor 提出類似以下要求:
    1. "Search StackOverflow for a solution to this error"
    2. "Scrape the HTML from this page"
  6. 它將在背景使用 Scrapeless。

支援的 MCP 工具

名稱說明
google_search通用資訊搜尋引擎。
google_trends從 Google Trends 取得熱門搜尋資料。
browser_create使用 Scrapeless 建立或重複使用雲端瀏覽器工作階段。
browser_close透過中斷雲端瀏覽器連線來關閉目前工作階段。
browser_goto將瀏覽器導覽至指定的 URL。
browser_go_back在瀏覽器歷史記錄中向後一步。
browser_go_forward在瀏覽器歷史記錄中向前一步。
browser_click點擊頁面上的特定元素。
browser_type在指定的輸入欄位中輸入文字。
browser_press_key模擬按鍵操作。
browser_wait_for等待特定頁面元素出現。
browser_wait暫停執行一段固定時間。
browser_screenshot擷取目前頁面的螢幕截圖。
browser_get_html取得目前頁面的完整 HTML。
browser_get_text取得目前頁面的所有可見文字。
browser_scroll捲動至頁面底部。
browser_scroll_to將特定元素捲動至可見範圍。
scrape_html抓取 URL 並回傳其完整 HTML 內容。
scrape_markdown抓取 URL 並將其內容回傳為 Markdown。
scrape_screenshot擷取任何網頁的高品質螢幕截圖。
crawl_start從基礎 URL 啟動非同步爬取任務並回傳其任務 ID。
crawl_cancel依 ID 取消進行中的爬取任務。
crawl_result依 ID 輪詢爬取任務直到完成,並回傳爬取的資料。
ai_scraper為 ChatGPT、Gemini、Perplexity、Copilot、Google AI 模式、Google AI 概覽、Grok 或 Alexa 建立 AI 抓取任務。

安全最佳實務

在使用 Scrapeless MCP 伺服器搭配 LLM(如 ChatGPT、Claude 或 Cursor)時,務必謹慎處理所有抓取或擷取的網路內容。網路資料預設為不可信任,不當處理可能使您的應用程式暴露於提示注入或其他安全漏洞。

✅ 建議做法

  • 切勿將原始抓取內容直接傳入 LLM 提示。 原始 HTML、JavaScript 或使用者產生的文字可能包含隱藏的注入負載。
  • 淨化並驗證所有擷取的內容。 在下游邏輯或 AI 模型中使用內容前,先移除或跳脫潛在有害的標籤與指令碼。
  • 優先使用結構化擷取而非自由格式文字。 使用 scrape_html、scrape_markdown 或具已知安全選擇器的目標性 browser_get_text,僅擷取您信任的內容。
  • 在抓取動態產生的頁面時套用網域或選擇器白名單,以限制資料流向已知且受信任的來源。
  • 記錄並監控所有透過瀏覽器或抓取工具發出的對外請求,尤其是當您處理敏感資料、權杖或內部網路存取時。

🚫 應避免

  • 將抓取的 HTML 直接注入提示
  • 允許使用者指定任意 URL 或 CSS 選擇器而未經驗證
  • 儲存未過濾的抓取內容以供未來提示使用

社群

聯絡我們

如有問題、建議或合作洽詢,歡迎透過以下方式聯絡我們: