Scrapeless

公式

リアルタイムのScrapeless Google SERP(Google検索、Googleフライト、Googleマップ、Google求人など)の結果をLLMアプリケーションに統合します。このサーバーは、AIワークフロー、チャットボット、リサーチツールに動的なコンテキスト取得を可能にします。

Scrapeless MCPで何ができますか?

  • Google検索とトレンド — google_search と google_trends を使って、ライブの検索結果やトレンドデータをリクエストします。
  • ブラウザ自動化 — クラウドブラウザを操作して、browser_goto や browser_click などのツールでナビゲート、クリック、入力、スクロール、スクリーンショットの取得を行います。
  • 任意のURLをスクレイピング — scrape_html、scrape_markdown、または scrape_screenshot でページのHTML、Markdown、スクリーンショットを取得します。
  • サイト全体をクロール — crawl_start で非同期クロールジョブを開始し、crawl_result で結果をポーリングします。
  • AIを活用した抽出 — ai_scraper を使用して、ChatGPT、Gemini、Perplexity などのエンジン向けの構造化スクレイピングタスクを作成します。

ドキュメント

preview

Scrapeless MCP サーバー

Scrapeless Model Context Protocol(MCP)サーバーへようこそ — LLM、AIエージェント、AIアプリケーションがリアルタイムでウェブと対話できるようにする強力な統合レイヤーです。

オープンなMCP標準に基づいて構築されたScrapeless MCPサーバーは、ChatGPT、Claudeなどのモデルや、Cursor、Windsurfなどのツールを、以下の幅広い外部機能にシームレスに接続します:

  • Googleサービス統合(検索、トレンド)
  • ページレベルのナビゲーションと操作のためのブラウザ自動化
  • 動的でJS主体のサイトをスクレイピング — HTML、Markdown、またはスクリーンショットとしてエクスポート
  • リンクを辿ってウェブサイト全体をクロールし、各ページを複数の形式でキャプチャ
  • AIスクレイパー ChatGPT、Gemini、Perplexity、Copilot、Google AI Mode、Google AI Overview、Grok、またはAlexa向けのAIスクレイパータスクを作成

AIリサーチアシスタント、コーディングコパイロット、自律型ウェブエージェントのいずれを構築している場合でも、このサーバーはワークフローに必要な動的コンテキストと実世界のデータを提供します — ブロックされることなく。

使用例

  1. Claudeによる自動ウェブ操作とデータ抽出

Scrapeless MCPブラウザを使用すると、Claudeは会話形式のコマンドでウェブナビゲーション、クリック、スクロール、スクレイピングなどの複雑なタスクを実行でき、live sessionsを介してウェブ操作結果のリアルタイムプレビューが可能です。

preview

  1. Cloudflareをバイパスしてターゲットページのコンテンツを取得

Scrapeless MCPブラウザサービスを使用すると、Cloudflareページに自動的にアクセスし、プロセス完了後にページコンテンツを抽出してMarkdown形式で返します。

preview

  1. 動的にレンダリングされたページコンテンツの抽出とファイルへの書き込み

Scrapeless MCPユニバーサルAPIを使用して、上記のターゲットページのJavaScriptレンダリングコンテンツをスクレイピングし、Markdown形式でエクスポートし、最後に**text.md**という名前のローカルファイルに書き込みます。

preview

  1. 自動SERPスクレイピング

Scrapeless MCPサーバーを使用して、Google検索でキーワード「web scraping」をクエリし、最初の10件の検索結果(タイトル、リンク、概要を含む)を取得し、serp.textという名前のファイルにコンテンツを書き込みます。

preview

これらのサーバーの使用方法の追加例をいくつか示します:

例
Google検索でscrapelessを検索します。
過去1年間の「AI」の検索関心を調べます。
ブラウザを使用してchatgpt.comにアクセスし、「今日の天気は?」を検索して、結果を要約します。
scrapeless.comページのHTMLコンテンツをスクレイピングします。
scrapeless.comページのMarkdownコンテンツをスクレイピングします。
scrapeless.comのスクリーンショットを取得します。

セットアップガイド

  1. Scrapelessキーを取得
  • Scrapelessダッシュボードにログインします(無料トライアルあり)
  • 左側の「設定」をクリック → 「APIキー管理」を選択 → 「APIキーを作成」をクリックします。最後に、作成したAPIキーをクリックしてコピーします。

preview

  1. MCPクライアントを設定

Scrapeless MCPサーバーは、StdioとStreamable HTTPの両方のトランスポートモードをサポートしています。

🖥️ Stdio(ローカル実行)

{
  "mcpServers": {
    "Scrapeless MCP Server": {
      "command": "npx",
      "args": ["-y", "scrapeless-mcp-server"],
      "env": {
        "SCRAPELESS_API_KEY": "YOUR_SCRAPELESS_KEY"
      }
    }
  }
}

🌐 Streamable HTTP(ホステッドAPIモード)

{
  "mcpServers": {
    "Scrapeless MCP Server": {
      "type": "streamable-http",
      "url": "https://api.scrapeless.com/mcp",
      "headers": {
        "x-api-token": "YOUR_SCRAPELESS_KEY"
      },
      "disabled": false,
      "alwaysAllow": []
    }
  }
}

詳細オプション

オプションのパラメータでブラウザセッションの動作をカスタマイズします。これらは環境変数(Stdioの場合)またはHTTPヘッダー(Streamable HTTPの場合)で設定できます:

Stdio(環境変数)Streamable HTTP(HTTPヘッダー)説明
BROWSER_PROFILE_IDx-browser-profile-idセッション継続のための再利用可能なブラウザプロファイルIDを指定します。
BROWSER_PROFILE_PERSISTx-browser-profile-persistCookie、ローカルストレージなどの永続ストレージを有効にします。
BROWSER_SESSION_TTLx-browser-session-ttl最大セッションタイムアウトを秒単位で定義します。この非アクティブ期間の後、セッションは自動的に期限切れになります。

Claude Desktopとの統合

  1. Claude Desktopを開きます
  2. 次の場所に移動します:Settings → Tools → MCP Servers
  3. **「MCPサーバーを追加」**をクリックします
  4. 上記のStdioまたはStreamable HTTP設定を貼り付けます
  5. 保存してサーバーを有効にします
  6. ClaudeはScrapelessを使用してウェブクエリの発行、コンテンツの抽出、ページとの対話ができるようになります

Cursor IDEとの統合

  1. Cursorを開きます
  2. Cmd + Shift + Pを押して、Configure MCP Serversを検索します
  3. 上記の形式でScrapeless MCP設定を追加します
  4. ファイルを保存し、Cursorを再起動します(必要に応じて)
  5. これでCursorに次のようなことを依頼できます:
    1. "Search StackOverflow for a solution to this error"
    2. "Scrape the HTML from this page"
  6. バックグラウンドでScrapelessが使用されます。

サポートされているMCPツール

名前説明
google_searchユニバーサル情報検索エンジン。
google_trendsGoogleトレンドからトレンド検索データを取得します。
browser_createScrapelessを使用してクラウドブラウザセッションを作成または再利用します。
browser_closeクラウドブラウザを切断して現在のセッションを閉じます。
browser_gotoブラウザを指定されたURLに移動します。
browser_go_backブラウザ履歴で1つ戻ります。
browser_go_forwardブラウザ履歴で1つ進みます。
browser_clickページ上の特定の要素をクリックします。
browser_type指定された入力フィールドにテキストを入力します。
browser_press_keyキー押下をシミュレートします。
browser_wait_for特定のページ要素が表示されるまで待機します。
browser_wait固定時間実行を一時停止します。
browser_screenshot現在のページのスクリーンショットをキャプチャします。
browser_get_html現在のページの完全なHTMLを取得します。
browser_get_text現在のページからすべての表示テキストを取得します。
browser_scrollページの下部までスクロールします。
browser_scroll_to特定の要素が表示されるまでスクロールします。
scrape_htmlURLをスクレイピングし、完全なHTMLコンテンツを返します。
scrape_markdownURLをスクレイピングし、コンテンツをMarkdownとして返します。
scrape_screenshot任意のウェブページの高品質スクリーンショットをキャプチャします。
crawl_startベースURLから非同期クロールジョブを開始し、そのジョブIDを返します。
crawl_cancel進行中のクロールジョブをIDでキャンセルします。
crawl_resultクロールジョブをIDでポーリングし、完了するまで待ってクロールデータを返します。
ai_scraperChatGPT、Gemini、Perplexity、Copilot、Google AI Mode、Google AI Overview、Grok、またはAlexa向けのAIスクレイパータスクを作成します。

セキュリティのベストプラクティス

Scrapeless MCPサーバーをLLM(ChatGPT、Claude、Cursorなど)で使用する場合、スクレイピングまたは抽出されたすべてのウェブコンテンツを慎重に扱うことが重要です。ウェブデータはデフォルトで信頼できないものであり、不適切な処理はアプリケーションをプロンプトインジェクションやその他のセキュリティ脆弱性にさらす可能性があります。

✅ 推奨されるプラクティス

  • スクレイピングされた生のコンテンツをLLMプロンプトに直接渡さないでください。 生のHTML、JavaScript、またはユーザー生成テキストには、隠れたインジェクションペイロードが含まれている可能性があります。
  • 抽出されたすべてのコンテンツをサニタイズして検証します。 ダウンストリームロジックやAIモデルでコンテンツを使用する前に、潜在的に有害なタグやスクリプトを削除またはエスケープします。
  • 自由形式のテキストよりも構造化抽出を優先します。 scrape_html、scrape_markdown、または既知の安全なセレクタを使用したターゲット指定のbrowser_get_textなどのツールを使用して、信頼できるコンテンツのみを抽出します。
  • 動的に生成されたページをスクレイピングする場合は、ドメインまたはセレクタのホワイトリストを適用して、データフローを既知の信頼できるソースに制限します。
  • ブラウザまたはスクレイピングツールを介して行われたすべての送信リクエストをログに記録して監視します。特に機密データ、トークン、または内部ネットワークアクセスを扱う場合は重要です。

🚫 避けるべきこと

  • スクレイピングされたHTMLをプロンプトに直接注入する
  • 検証なしでユーザーに任意のURLやCSSセレクタを指定させる
  • 将来のプロンプト使用のためにフィルタリングされていないスクレイピングコンテンツを保存する

コミュニティ

お問い合わせ

質問、提案、コラボレーションのお問い合わせは、以下の方法でお気軽にご連絡ください: