Scrapeless

oficial

Integra resultados en tiempo real de Scrapeless Google SERP (Google Search, Google Flight, Google Map, Google Jobs...) en tus aplicaciones LLM. Este servidor permite la recuperación dinámica de contexto para flujos de trabajo de IA, chatbots y herramientas de investigación.

¿Qué puedes hacer con Scrapeless MCP?

  • Búsqueda y tendencias de Google — Solicita resultados de búsqueda en vivo o datos de tendencias mediante google_search y google_trends.
  • Automatización del navegador — Dirige un navegador en la nube para navegar, hacer clic, escribir, desplazarse y capturar capturas de pantalla usando herramientas como browser_goto y browser_click.
  • Extraer cualquier URL — Recupera el HTML, Markdown o una captura de pantalla de una página con scrape_html, scrape_markdown o scrape_screenshot.
  • Rastrear sitios completos — Inicia un trabajo de rastreo asíncrono con crawl_start y luego consulta los resultados mediante crawl_result.
  • Extracción impulsada por IA — Usa ai_scraper para crear tareas de extracción estructuradas para motores como ChatGPT, Gemini o Perplexity.

Documentación

preview

Servidor MCP de Scrapeless

Bienvenido al servidor oficial de Scrapeless Model Context Protocol (MCP) — una capa de integración potente que permite a los LLMs, Agentes de IA y aplicaciones de IA interactuar con la web en tiempo real.

Construido sobre el estándar abierto MCP, el Servidor MCP de Scrapeless conecta sin problemas modelos como ChatGPT, Claude, y herramientas como Cursor y Windsurf a una amplia gama de capacidades externas, incluyendo:

  • Integración con servicios de Google (Búsqueda, Tendencias)
  • Automatización de navegador para navegación e interacción a nivel de página
  • Scrape de sitios dinámicos y con mucho JavaScript—exporta como HTML, Markdown o capturas de pantalla
  • Crawl de sitios web completos siguiendo enlaces y capturando cada página en múltiples formatos
  • AI Scraper Crea una tarea de AI Scraper para ChatGPT, Gemini, Perplexity, Copilot, Google AI Mode, Google AI Overview, Grok o Alexa

Ya sea que estés construyendo un asistente de investigación con IA, un copiloto de codificación o agentes web autónomos, este servidor proporciona el contexto dinámico y los datos del mundo real que tus flujos de trabajo necesitan—sin ser bloqueado.

Ejemplos de Uso

  1. Interacción Web Automatizada y Extracción de Datos con Claude

Usando el Navegador MCP de Scrapeless, Claude puede realizar tareas complejas como navegación web, clics, desplazamiento y scraping a través de comandos conversacionales, con vista previa en tiempo real de los resultados de interacción web vía live sessions.

preview

  1. Evadiendo Cloudflare para Recuperar el Contenido de la Página Objetivo

Usando el servicio de Navegador MCP de Scrapeless, se accede automáticamente a la página de Cloudflare, y después de que el proceso se completa, el contenido de la página se extrae y se devuelve en formato Markdown.

preview

  1. Extrayendo Contenido de Página Renderizado Dinámicamente y Escribiéndolo en un Archivo

Usando la API Universal MCP de Scrapeless, se extrae el contenido renderizado por JavaScript de la página objetivo anterior, se exporta en formato Markdown y finalmente se escribe en un archivo local llamado text.md.

preview

  1. Scraping Automatizado de SERP

Usando el Servidor MCP de Scrapeless, consulta la palabra clave "web scraping" en Google Search, recupera los primeros 10 resultados de búsqueda (incluyendo título, enlace y resumen), y escribe el contenido en el archivo llamado serp.text.

preview

Aquí hay algunos ejemplos adicionales de cómo usar estos servidores:

Ejemplo
Busca scrapeless mediante la búsqueda de Google.
Encuentra el interés de búsqueda de "IA" durante el último año.
Usa un navegador para visitar chatgpt.com, busca "¿Cómo está el clima hoy?" y resume los resultados.
Extrae el contenido HTML de la página scrapeless.com.
Extrae el contenido Markdown de la página scrapeless.com.
Obtén capturas de pantalla de scrapeless.com.

Guía de Configuración

  1. Obtén tu Clave de Scrapeless
  • Inicia sesión en el Panel de Scrapeless (Prueba gratuita disponible)
  • Luego haz clic en "Configuración" a la izquierda -> selecciona "Gestión de Claves API" -> haz clic en "Crear Clave API". Finalmente, haz clic en la Clave API que creaste para copiarla.

preview

  1. Configura tu Cliente MCP

El Servidor MCP de Scrapeless soporta tanto los modos de transporte Stdio como Streamable HTTP.

🖥️ Stdio (Ejecución Local)

{
  "mcpServers": {
    "Scrapeless MCP Server": {
      "command": "npx",
      "args": ["-y", "scrapeless-mcp-server"],
      "env": {
        "SCRAPELESS_API_KEY": "YOUR_SCRAPELESS_KEY"
      }
    }
  }
}

🌐 Streamable HTTP (Modo API Alojado)

{
  "mcpServers": {
    "Scrapeless MCP Server": {
      "type": "streamable-http",
      "url": "https://api.scrapeless.com/mcp",
      "headers": {
        "x-api-token": "YOUR_SCRAPELESS_KEY"
      },
      "disabled": false,
      "alwaysAllow": []
    }
  }
}

Opciones Avanzadas

Personaliza el comportamiento de la sesión del navegador con parámetros opcionales. Estos se pueden configurar mediante variables de entorno (para Stdio) o encabezados HTTP (para Streamable HTTP):

Stdio (Variable de Entorno)Streamable HTTP (Encabezado HTTP)Descripción
BROWSER_PROFILE_IDx-browser-profile-idEspecifica un ID de perfil de navegador reutilizable para la continuidad de la sesión.
BROWSER_PROFILE_PERSISTx-browser-profile-persistHabilita el almacenamiento persistente para cookies, almacenamiento local, etc.
BROWSER_SESSION_TTLx-browser-session-ttlDefine el tiempo de espera máximo de sesión en segundos. La sesión expirará automáticamente después de este período de inactividad.

Integración con Claude Desktop

  1. Abre Claude Desktop
  2. Navega a: Settings → Tools → MCP Servers
  3. Haz clic en "Agregar Servidor MCP"
  4. Pega la configuración de Stdio o Streamable HTTP de arriba
  5. Guarda y habilita el servidor
  6. Claude ahora podrá emitir consultas web, extraer contenido e interactuar con páginas usando Scrapeless

Integración con el IDE Cursor

  1. Abre Cursor
  2. Presiona Cmd + Shift + P y busca: Configure MCP Servers
  3. Agrega la configuración MCP de Scrapeless usando el formato anterior
  4. Guarda el archivo y reinicia Cursor (si es necesario)
  5. Ahora puedes preguntarle a Cursor cosas como:
    1. "Search StackOverflow for a solution to this error"
    2. "Scrape the HTML from this page"
  6. Y usará Scrapeless en segundo plano.

Herramientas MCP Soportadas

NombreDescripción
google_searchMotor de búsqueda de información universal.
google_trendsObtén datos de búsqueda de tendencias de Google Trends.
browser_createCrea o reutiliza una sesión de navegador en la nube usando Scrapeless.
browser_closeCierra la sesión actual desconectando el navegador en la nube.
browser_gotoNavega el navegador a una URL especificada.
browser_go_backRetrocede un paso en el historial del navegador.
browser_go_forwardAvanza un paso en el historial del navegador.
browser_clickHaz clic en un elemento específico de la página.
browser_typeEscribe texto en un campo de entrada especificado.
browser_press_keySimula la pulsación de una tecla.
browser_wait_forEspera a que aparezca un elemento específico de la página.
browser_waitPausa la ejecución durante una duración fija.
browser_screenshotCaptura una captura de pantalla de la página actual.
browser_get_htmlObtén el HTML completo de la página actual.
browser_get_textObtén todo el texto visible de la página actual.
browser_scrollDesplázate hasta el final de la página.
browser_scroll_toDesplaza un elemento específico a la vista.
scrape_htmlExtrae una URL y devuelve su contenido HTML completo.
scrape_markdownExtrae una URL y devuelve su contenido como Markdown.
scrape_screenshotCaptura una captura de pantalla de alta calidad de cualquier página web.
crawl_startInicia un trabajo de crawl asíncrono desde una URL base y devuelve su ID de trabajo.
crawl_cancelCancela un trabajo de crawl en curso por su ID.
crawl_resultConsulta un trabajo de crawl por su ID hasta que se complete y devuelve los datos extraídos.
ai_scraperCrea una tarea de AI Scraper para ChatGPT, Gemini, Perplexity, Copilot, Google AI Mode, Google AI Overview, Grok o Alexa.

Mejores Prácticas de Seguridad

Al usar el Servidor MCP de Scrapeless con LLMs (como ChatGPT, Claude o Cursor), es fundamental manejar todo el contenido web extraído o raspado con cuidado. Los datos web no son confiables por defecto, y un manejo inadecuado puede exponer tu aplicación a inyección de prompts u otras vulnerabilidades de seguridad.

✅ Prácticas Recomendadas

  • Nunca pases contenido raspado crudo directamente a los prompts de LLM. El HTML crudo, JavaScript o texto generado por usuarios puede contener cargas útiles de inyección ocultas.
  • Sanea y valida todo el contenido extraído. Elimina o escapa etiquetas y scripts potencialmente dañinos antes de usar el contenido en lógica posterior o modelos de IA.
  • Prefiere la extracción estructurada al texto de forma libre. Usa herramientas como scrape_html, scrape_markdown o browser_get_text dirigidos con selectores conocidos y seguros para extraer solo el contenido en el que confías.
  • Aplica listas blancas de dominios o selectores al extraer páginas generadas dinámicamente, para restringir el flujo de datos a fuentes conocidas y confiables.
  • Registra y monitorea todas las solicitudes salientes realizadas a través del navegador o herramientas de scraping, especialmente si manejas datos sensibles, tokens o acceso a redes internas.

🚫 Evita

  • Inyectar HTML raspado directamente en los prompts
  • Permitir que los usuarios especifiquen URLs arbitrarias o selectores CSS sin validación
  • Almacenar contenido raspado sin filtrar para uso futuro en prompts

Comunidad

Contáctanos

Para preguntas, sugerencias o consultas de colaboración, no dudes en contactarnos a través de: