Scrapeless

officiel

Intégrez les résultats en temps réel de Scrapeless Google SERP (Google Search, Google Flight, Google Map, Google Jobs...) dans vos applications LLM. Ce serveur permet la récupération dynamique de contexte pour les workflows IA, chatbots et outils de recherche.

Que pouvez-vous faire avec Scrapeless MCP ?

  • Recherche Google et tendances — Demandez des résultats de recherche en direct ou des données de tendances via google_search et google_trends.
  • Automatisation du navigateur — Dirigez un navigateur cloud pour naviguer, cliquer, saisir, faire défiler et capturer des captures d'écran à l'aide d'outils comme browser_goto et browser_click.
  • Extraire n'importe quelle URL — Récupérez le HTML, le Markdown ou une capture d'écran d'une page avec scrape_html, scrape_markdown ou scrape_screenshot.
  • Explorer des sites entiers — Lancez un travail d'exploration asynchrone avec crawl_start, puis interrogez les résultats via crawl_result.
  • Extraction basée sur l'IA — Utilisez ai_scraper pour créer des tâches d'extraction structurées pour des moteurs comme ChatGPT, Gemini ou Perplexity.

Documentation

preview

Serveur MCP Scrapeless

Bienvenue sur le serveur officiel Scrapeless Model Context Protocol (MCP) — une couche d'intégration puissante qui permet aux LLM, aux agents IA et aux applications d'IA d'interagir avec le web en temps réel.

Construit sur le standard ouvert MCP, le serveur MCP Scrapeless connecte de manière transparente des modèles comme ChatGPT, Claude, et des outils comme Cursor et Windsurf à un large éventail de capacités externes, notamment :

  • Intégration des services Google (Search, Trends)
  • Automatisation du navigateur pour la navigation et l'interaction au niveau des pages
  • Scrape de sites dynamiques et riches en JavaScript — exportez en HTML, Markdown ou captures d'écran
  • Crawl de sites web entiers en suivant les liens et capturez chaque page dans plusieurs formats
  • AI Scraper Créez une tâche AI Scraper pour ChatGPT, Gemini, Perplexity, Copilot, Google AI Mode, Google AI Overview, Grok ou Alexa

Que vous construisiez un assistant de recherche IA, un copilote de codage ou des agents web autonomes, ce serveur fournit le contexte dynamique et les données réelles dont vos workflows ont besoin—sans être bloqué.

Exemples d'utilisation

  1. Interaction web automatisée et extraction de données avec Claude

En utilisant Scrapeless MCP Browser, Claude peut effectuer des tâches complexes telles que la navigation web, les clics, le défilement et le scraping via des commandes conversationnelles, avec un aperçu en temps réel des résultats d'interaction web via live sessions.

preview

  1. Contourner Cloudflare pour récupérer le contenu de la page cible

En utilisant le service Scrapeless MCP Browser, la page Cloudflare est automatiquement accédée, et après la fin du processus, le contenu de la page est extrait et renvoyé au format Markdown.

preview

  1. Extraction du contenu de page rendu dynamiquement et écriture dans un fichier

En utilisant l'API universelle Scrapeless MCP, le contenu rendu en JavaScript de la page cible ci-dessus est scrapé, exporté au format Markdown, puis écrit dans un fichier local nommé text.md.

preview

  1. Scraping SERP automatisé

En utilisant le serveur MCP Scrapeless, interrogez le mot-clé « web scraping » sur Google Search, récupérez les 10 premiers résultats de recherche (y compris le titre, le lien et le résumé), et écrivez le contenu dans le fichier nommé serp.text.

preview

Voici quelques exemples supplémentaires d'utilisation de ces serveurs :

Exemple
Recherchez scrapeless via Google Search.
Trouvez l'intérêt de recherche pour « AI » au cours de la dernière année.
Utilisez un navigateur pour visiter chatgpt.com, recherchez « Quel temps fait-il aujourd'hui ? », et résumez les résultats.
Scrapez le contenu HTML de la page scrapeless.com.
Scrapez le contenu Markdown de la page scrapeless.com.
Obtenez des captures d'écran de scrapeless.com.

Guide de configuration

  1. Obtenez la clé Scrapeless
  • Connectez-vous au tableau de bord Scrapeless (essai gratuit disponible)
  • Cliquez ensuite sur « Setting » à gauche -> sélectionnez « API Key Management » -> cliquez sur « Create API Key ». Enfin, cliquez sur la clé API que vous avez créée pour la copier.

preview

  1. Configurez votre client MCP

Le serveur MCP Scrapeless prend en charge les modes de transport Stdio et Streamable HTTP.

🖥️ Stdio (exécution locale)

{
  "mcpServers": {
    "Scrapeless MCP Server": {
      "command": "npx",
      "args": ["-y", "scrapeless-mcp-server"],
      "env": {
        "SCRAPELESS_API_KEY": "YOUR_SCRAPELESS_KEY"
      }
    }
  }
}

🌐 Streamable HTTP (mode API hébergé)

{
  "mcpServers": {
    "Scrapeless MCP Server": {
      "type": "streamable-http",
      "url": "https://api.scrapeless.com/mcp",
      "headers": {
        "x-api-token": "YOUR_SCRAPELESS_KEY"
      },
      "disabled": false,
      "alwaysAllow": []
    }
  }
}

Options avancées

Personnalisez le comportement de la session navigateur avec des paramètres optionnels. Ceux-ci peuvent être définis via des variables d'environnement (pour Stdio) ou des en-têtes HTTP (pour Streamable HTTP) :

Stdio (variable d'environnement)Streamable HTTP (en-tête HTTP)Description
BROWSER_PROFILE_IDx-browser-profile-idSpécifie un ID de profil navigateur réutilisable pour la continuité de session.
BROWSER_PROFILE_PERSISTx-browser-profile-persistActive le stockage persistant pour les cookies, le stockage local, etc.
BROWSER_SESSION_TTLx-browser-session-ttlDéfinit le délai d'expiration maximal de session en secondes. La session expirera automatiquement après cette durée d'inactivité.

Intégration avec Claude Desktop

  1. Ouvrez Claude Desktop
  2. Naviguez vers : Settings → Tools → MCP Servers
  3. Cliquez sur « Add MCP Server »
  4. Collez la configuration Stdio ou Streamable HTTP ci-dessus
  5. Enregistrez et activez le serveur
  6. Claude pourra désormais émettre des requêtes web, extraire du contenu et interagir avec les pages en utilisant Scrapeless

Intégration avec l'IDE Cursor

  1. Ouvrez Cursor
  2. Appuyez sur Cmd + Shift + P et recherchez : Configure MCP Servers
  3. Ajoutez la configuration MCP Scrapeless en utilisant le format ci-dessus
  4. Enregistrez le fichier et redémarrez Cursor (si nécessaire)
  5. Vous pouvez maintenant demander à Cursor des choses comme :
    1. "Search StackOverflow for a solution to this error"
    2. "Scrape the HTML from this page"
  6. Et il utilisera Scrapeless en arrière-plan.

Outils MCP pris en charge

NomDescription
google_searchMoteur de recherche d'informations universel.
google_trendsObtenez les données de recherche tendance de Google Trends.
browser_createCréez ou réutilisez une session navigateur cloud en utilisant Scrapeless.
browser_closeFerme la session actuelle en déconnectant le navigateur cloud.
browser_gotoNaviguez le navigateur vers une URL spécifiée.
browser_go_backRevenez d'une étape dans l'historique du navigateur.
browser_go_forwardAvancez d'une étape dans l'historique du navigateur.
browser_clickCliquez sur un élément spécifique de la page.
browser_typeSaisissez du texte dans un champ de saisie spécifié.
browser_press_keySimulez une pression de touche.
browser_wait_forAttendez l'apparition d'un élément de page spécifique.
browser_waitPausez l'exécution pendant une durée fixe.
browser_screenshotCapturez une capture d'écran de la page actuelle.
browser_get_htmlObtenez le HTML complet de la page actuelle.
browser_get_textObtenez tout le texte visible de la page actuelle.
browser_scrollFaites défiler jusqu'en bas de la page.
browser_scroll_toFaites défiler un élément spécifique dans la vue.
scrape_htmlScrapez une URL et renvoyez son contenu HTML complet.
scrape_markdownScrapez une URL et renvoyez son contenu au format Markdown.
scrape_screenshotCapturez une capture d'écran de haute qualité de n'importe quelle page web.
crawl_startDémarrez un travail de crawl asynchrone à partir d'une URL de base et renvoyez son ID de travail.
crawl_cancelAnnulez un travail de crawl en cours par son ID.
crawl_resultInterrogez un travail de crawl par son ID jusqu'à son achèvement et renvoyez les données crawlées.
ai_scraperCréez une tâche AI Scraper pour ChatGPT, Gemini, Perplexity, Copilot, Google AI Mode, Google AI Overview, Grok ou Alexa.

Bonnes pratiques de sécurité

Lorsque vous utilisez le serveur MCP Scrapeless avec des LLM (comme ChatGPT, Claude ou Cursor), il est essentiel de traiter tout contenu web scrapé ou extrait avec soin. Les données web ne sont pas fiables par défaut, et une manipulation inappropriée peut exposer votre application à des injections de prompts ou à d'autres vulnérabilités de sécurité.

✅ Pratiques recommandées

  • Ne transmettez jamais de contenu scrapé brut directement dans les prompts LLM. Le HTML brut, le JavaScript ou le texte généré par l'utilisateur peuvent contenir des charges utiles d'injection cachées.
  • Assainissez et validez tout le contenu extrait. Supprimez ou échappez les balises et scripts potentiellement dangereux avant d'utiliser le contenu dans la logique en aval ou les modèles IA.
  • Préférez l'extraction structurée au texte libre. Utilisez des outils comme scrape_html, scrape_markdown, ou des browser_get_text ciblés avec des sélecteurs connus et sûrs pour extraire uniquement le contenu auquel vous faites confiance.
  • Appliquez une liste blanche de domaines ou de sélecteurs lors du scraping de pages générées dynamiquement, pour limiter le flux de données à des sources connues et fiables.
  • Journalisez et surveillez toutes les requêtes sortantes effectuées via le navigateur ou les outils de scraping, surtout si vous manipulez des données sensibles, des jetons ou un accès réseau interne.

🚫 À éviter

  • Injecter du HTML scrapé directement dans les prompts
  • Laisser les utilisateurs spécifier des URL ou des sélecteurs CSS arbitraires sans validation
  • Stocker du contenu scrapé non filtré pour une utilisation future dans les prompts

Communauté

Contactez-nous

Pour toute question, suggestion ou demande de collaboration, n'hésitez pas à nous contacter via :