Decodo

oficial

Acceso sencillo a datos web. Recuperación simplificada de información de sitios web y fuentes en línea.

¿Qué puedes hacer con Decodo MCP?

  • Extraer cualquier página web como Markdown — extrae contenido limpio y listo para LLM desde una URL usando scrape_as_markdown.
  • Capturar capturas de pantalla de páginas web — toma una instantánea visual de cualquier sitio con screenshot.
  • Buscar en Google y Bing — recupera resultados de SERP analizados mediante google_search y bing_search.
  • Obtener datos de productos de comercio electrónico — consulta precios, vendedores y más vendidos en Amazon, Walmart o Target.
  • Recopilar contenido de redes sociales — extrae publicaciones de Reddit, videos de TikTok o metadatos y subtítulos de YouTube.
  • Consultar herramientas de búsqueda con IA — interactúa con ChatGPT, Perplexity o Google AI Mode para obtener respuestas impulsadas por IA.

Documentación

Servidor MCP Decodo

Install MCP Server

Conecta LLMs y agentes de IA a datos web en vivo usando MCP (Model Context Protocol). El Servidor MCP Decodo te permite extraer datos de sitios web, motores de búsqueda, plataformas de comercio electrónico y redes sociales directamente desde herramientas de IA como Claude, Cursor y Windsurf, sin necesidad de construir infraestructura de scraping desde cero.

  • Salidas estructuradas en JSON, Markdown y capturas de pantalla
  • Renderizado de JavaScript del lado del servidor y manejo anti-bot
  • Más de 125 millones de IPs en más de 195 ubicaciones

¿Qué es el servidor MCP Decodo?

El Servidor MCP Decodo es una capa de web scraping para agentes de IA. Conecta clientes compatibles con MCP a la API de Web Scraping de Decodo, permitiendo:

  • Web scraping para LLMs
  • Recuperación de datos en tiempo real para RAG
  • Navegación e investigación de agentes de IA
  • Extracción de datos estructurados de sitios web dinámicos

En lugar de mantener proxies, analizadores y lógica de reintentos, obtienes un único punto de integración para un acceso fiable a datos web.

¿Por qué usar MCP para web scraping?

Model Context Protocol (MCP) es el estándar emergente para conectar agentes de IA a herramientas y fuentes de datos externas. Con MCP:

  • Los agentes pueden llamar herramientas dinámicamente
  • Las integraciones se mantienen estandarizadas
  • Los flujos de trabajo escalan en todos los entornos

El Servidor MCP Decodo proporciona a tus agentes acceso web fiable y listo para producción a través de este estándar.

Características principales

Web scraping para agentes de IA, sin infraestructura necesaria. Extrae datos de cualquier sitio web, incluidas páginas con mucho JavaScript, sin gestionar la rotación de proxies, la resolución de CAPTCHAs o los sistemas anti-bot.

Salidas estructuradas para flujos de trabajo de LLM. Markdown (listo para LLM), JSON (para pipelines estructurados) y capturas de pantalla (para contexto visual), diseñado para pipelines RAG, agentes de investigación de IA y flujos de automatización.

Soporte integrado para objetivos populares. Herramientas listas para usar para Google y Bing (SERPs), Amazon, Walmart y Target (comercio electrónico), Reddit, TikTok y YouTube (redes sociales), y ChatGPT y Perplexity (búsqueda con IA).

Infraestructura de proxy global. Más de 125 millones de IPs residenciales, más de 195 ubicaciones geográficas y una tasa de éxito del 99.99% incluso en los objetivos más protegidos.

Conjuntos de herramientas MCP modulares. Habilita solo lo que necesitas: web, search, ecommerce, social_media, ai para una selección de herramientas más limpia y un mejor rendimiento del agente.

Rápido tiempo de puesta en marcha. Desde la clave API hasta el primer scraping en minutos, sin sobrecarga de configuración.

Casos de uso

Usa el Servidor MCP Decodo cuando necesites web scraping para agentes de IA, extracción de datos estructurados a escala, acceso fiable a sitios web dinámicos, datos en tiempo real para RAG o una alternativa a construir infraestructura de scraping desde cero. Escenarios comunes:

  • Web scraping potenciado por IA – da a los LLMs la capacidad de recopilar datos frescos en lugar de depender de datos de entrenamiento estáticos.
  • RAG con datos en vivo – incorpora resultados de búsqueda en tiempo real de Google, Bing y búsquedas con IA en pipelines de recuperación.
  • Inteligencia de comercio electrónico – rastrea precios de productos, listados y vendedores en distintos mercados sin ser bloqueado.
  • Recopilación de datos de redes sociales – reúne publicaciones, canales y datos de interacción de Reddit, TikTok y YouTube.
  • Agregación de viajes y precios – construye herramientas que recopilen precios y disponibilidad en vivo en distintos sitios web.

Inicio rápido

  1. Crea una cuenta gratuita en dashboard.decodo.com – hasta 2K solicitudes gratuitas, sin tarjeta de crédito requerida.
  2. Obtén tu clave API. Consigue un token de autenticación básica de la API de Web Scraping desde el panel de control.
  3. Descarga Node.js 18+ desde https://nodejs.org.
  4. Consigue un cliente MCP como Claude Desktop, Cursor, Windsurf u otras herramientas compatibles con MCP.
  5. Configura el servidor MCP en tu cliente de IA (ver ejemplos de configuración a continuación).

Conexión al servidor MCP de Decodo

Abre tu cliente MCP preferido y añade la siguiente configuración (ver ejemplos para Claude Code, Cursor, Windsurf a continuación):

{
  "mcpServers": {
    "Decodo": {
      "url": "https://mcp.decodo.com/mcp",
      "headers": {
        "Authorization": "Basic <basic_auth_token>"
      }
    }
  }
}

Claude Desktop

  1. Abre Claude Desktop → Configuración → Desarrollador → Editar Config.
  2. Añade a claude_desktop_config.json:
{
  "mcpServers": {
    "Decodo": {
      "command": "npx",
      "args": ["-y", "@decodo/mcp-server"],
      "env": {
        "SCRAPER_API_TOKEN": "<basic_auth_token>",
        "TOOLSETS": "web,ai"
      }
    }
  }
}
  1. Guarda y reinicia Claude Desktop.

Cursor

  1. Abre Configuración → MCP.
  2. Haz clic en Añadir un nuevo servidor MCP global (abre mcp.json).
  3. Añade la misma configuración que arriba.
  4. Guarda — busca un indicador de estado verde junto a Decodo.

Windsurf

  1. Abre Configuración → Ajustes de Windsurf.
  2. Desplázate a Cascade → Añadir servidor personalizado + (abre mcp_config.json).
  3. Añade la misma configuración que arriba.
  4. Guarda y reinicia Windsurf.

Prueba tu configuración

Una vez conectado, prueba este prompt en tu cliente:

▎ "Extrae los títulos de los 5 artículos principales de Hacker News"

Deberías recibir una lista estructurada en segundos. Si ves un error de autenticación, verifica tu token en el panel de control.

Opcional: habilitar conjuntos de herramientas específicos

Ejecutar el servidor MCP localmente

Requisitos previos

Guía paso a paso

  1. Clona este repositorio:
git clone https://github.com/Decodo/mcp-server
  1. Ejecuta los siguientes comandos en la terminal:
cd decodo-mcp-server
npm install
npm run build
  1. Toma nota de la ubicación de tu compilación:
cd build/
pwd

Añadiendo index.js al final de este directorio, la ubicación de tu archivo de compilación debería verse algo así:

/Users/your.user/projects/decodo-mcp/build/index.js
  1. Actualiza tu cliente MCP con la información del servidor:
{
  "mcpServers": {
    "decodo-mcp": {
      "command": "node",
      "args": ["/Users/your.user/projects/decodo-mcp/build/index.js"],
      "env": {
        "SCRAPER_API_TOKEN": "<web_scraping_api_base64_token>"
      }
    }
  }
}

Conjuntos de herramientas

Las herramientas están organizadas en conjuntos. Puedes habilitar selectivamente conjuntos específicos pasando una lista separada por comas a través del parámetro de consulta toolsets:

    "Decodo MCP Server": {
      "url": "https://mcp.decodo.com/mcp?toolsets=web,ai",
      "headers": {
        "Authorization": "Basic <your_auth_token>"
      }
    }

Cuando no se especifican conjuntos de herramientas, se registran todas las herramientas.

Conjunto de herramientasHerramientas
webscrape_as_markdown, screenshot
searchgoogle_search, google_ads, google_lens, google_travel_hotels, bing_search
ecommerceamazon_search, amazon_product, amazon_pricing, amazon_sellers, amazon_bestsellers, walmart_search, walmart_product, target_search, target_product, tiktok_shop_search, tiktok_shop_product, tiktok_shop_url
social_mediareddit_post, reddit_subreddit, reddit_user, tiktok_post, youtube_metadata, youtube_channel, youtube_subtitles, youtube_search
aichatgpt, perplexity, google_ai_mode

Herramientas

El servidor expone las siguientes herramientas:

HerramientaDescripciónEjemplo de prompt
scrape_as_markdownExtrae datos de cualquier URL objetivo; espera que se proporcione una URL mediante el prompt. Devuelve resultados en Markdown.Extrae datos de peacock.com desde una IP de EE. UU. y dime los precios.
screenshotCaptura una captura de pantalla de cualquier página web y la devuelve como imagen PNG.Toma una captura de pantalla de github.com desde una IP de EE. UU.
google_searchExtrae datos de Google Search para una consulta dada y devuelve resultados analizados.Extrae datos de Google Search para "zapatos" y dime la primera posición.
google_adsExtrae resultados de búsqueda de Google Ads.Extrae datos de Google Ads para "portátil" y muéstrame los anuncios principales.
google_lensExtrae resultados de búsqueda de imágenes de Google Lens.Busca en Google Lens esta imagen: https://example.com/image.jpg
google_ai_modeExtrae resultados del Modo IA de Google (Búsqueda con IA).Pregunta al Modo IA de Google: ¿Cuáles son las tres mejores razas de perros?
google_travel_hotelsExtrae resultados de búsqueda de Google Travel Hotels.Busca en Google Travel Hotels hoteles en París.
amazon_searchExtrae datos de Amazon Search para una consulta dada y devuelve resultados analizados.Extrae datos de Amazon Search para "teclado inalámbrico".
amazon_productExtrae datos de la página de un producto de Amazon.Extrae datos del producto de Amazon B09H74FXNW y muéstrame los detalles.
amazon_pricingExtrae información de precios de un producto de Amazon.Obtén el precio del producto de Amazon B09H74FXNW.
amazon_sellersExtrae información de un vendedor de Amazon.Obtén información sobre el vendedor de Amazon A1R0Z7FJGTKESH.
amazon_bestsellersExtrae la lista de los más vendidos de Amazon.Muéstrame los más vendidos de Amazon en electrónica.
walmart_searchExtrae datos de Walmart Search para una consulta dada y devuelve resultados analizados.Extrae datos de Walmart Search para "tienda de campaña".
walmart_productExtrae datos de la página de un producto de Walmart.Extrae datos del producto de Walmart 15296401808.
target_searchExtrae datos de Target Search para una consulta dada y devuelve resultados analizados.Extrae datos de Target Search para "electrodomésticos de cocina".
target_productExtrae datos de la página de un producto de Target.Extrae datos del producto de Target 92186007.
tiktok_postExtrae datos estructurados de una URL de publicación de TikTok (p. ej., interacciones, descripción, hashtags).Extrae datos de esta publicación de TikTok: https://www.tiktok.com/@nba/video/7393013274725403950
tiktok_shop_searchExtrae datos de TikTok Shop Search para una consulta dada y devuelve resultados analizados.Extrae datos de TikTok Shop Search para "fundas de teléfono".
tiktok_shop_productExtrae datos de la página de un producto de TikTok Shop.Extrae datos del producto de TikTok Shop 1731541214379741272.
tiktok_shop_urlExtrae datos de una página de TikTok Shop por URL.Extrae datos de esta URL de TikTok Shop: https://www.tiktok.com/shop/s?q=HEADPHONES
youtube_metadataExtrae metadatos de un video de YouTube.Obtén metadatos del video de YouTube dFu9aKJoqGg.
youtube_channelExtrae videos de un canal de YouTube.Extrae datos del canal de YouTube @decodo_official.
youtube_subtitlesExtrae subtítulos de un video de YouTube.Obtén subtítulos del video de YouTube L8zSWbQN-v8.
youtube_searchBusca videos en YouTube.Busca en YouTube "Cómo cuidar chinchillas".
reddit_postExtrae datos de una publicación específica de Reddit.Extrae datos de la siguiente publicación de Reddit: https://www.reddit.com/r/horseracing/comments/1nsrn3/
reddit_subredditExtrae resultados de un subreddit.Extrae las 5 publicaciones principales de r/Python esta semana.
reddit_userExtrae el perfil de un usuario de Reddit y sus publicaciones/comentarios.Extrae datos de este usuario de Reddit: https://www.reddit.com/user/IWasRightOnce/
bing_searchExtrae resultados de Bing Search.Busca en Bing "reseñas de portátiles".
chatgptBusca e interactúa con ChatGPT para obtener respuestas y conversaciones potenciadas por IA.Pregunta a ChatGPT que explique la computación cuántica en términos sencillos.
perplexityBusca e interactúa con Perplexity para obtener respuestas y conversaciones potenciadas por IA.Pregunta a Perplexity cuáles son las últimas tendencias en desarrollo web.

Parámetros

Los siguientes parámetros se infieren de los prompts del usuario:

ParámetroDescripción
jsRenderRenderiza la URL objetivo en un navegador sin interfaz gráfica.
geoEstablece el país desde el cual se originará la solicitud.
localeEstablece la configuración regional de la solicitud.
tokenLimitTrunca el contenido de la respuesta hasta este límite. Útil si la ventana de contexto es pequeña.
promptPrompt para enviar a herramientas de IA (chatgpt, perplexity).
searchActiva la funcionalidad de búsqueda web de ChatGPT (solo chatgpt).
xhrCuando es verdadero, incluye respuestas XHR o fetch en el resultado del scraping donde sea compatible (p. ej., tiktok_post).
deviceTypeTipo de dispositivo a emular para la solicitud (desktop, mobile, tablet).
domainDominio a usar para la solicitud (p. ej., amazon.com, amazon.co.uk, bing.com).
pageFromNúmero de página inicial para la paginación.
deliveryZipCódigo postal para la ubicación de entrega (Target, Walmart).
storeIdID de tienda para inventario local (Target, Walmart).
countryPaís para solicitudes de TikTok Shop.
limitNúmero máximo de resultados a devolver (p. ej., videos de canal de YouTube).
language_codeCódigo de idioma para subtítulos (p. ej., en, es).

Ejemplos

Extracción de contenido con restricción geográfica

Consulta a tu agente de IA con el siguiente prompt:

Scrape peacock.com from a German IP address and tell me the pricing.

Este prompt indicará que peacock.com tiene restricción geográfica. Para eludir la restricción geográfica:

Scrape peacock.com from a US IP address and tell me the pricing.

Limitación del número de tokens de respuesta

Si tu agente tiene una ventana de contexto pequeña, el contenido devuelto del scraping se truncará automáticamente para evitar el desbordamiento del contexto. Puedes aumentar el número de tokens devueltos dentro de tu prompt:

Scrape hacker news, return 50k tokens.

Si tu agente tiene una ventana de contexto grande, indícale que devuelva full content:

Scrape hacker news, return full content.

Uso con las habilidades de agente de Decodo

Este servidor proporciona a tu agente las herramientas de scraping. Decodo/agent-skills le enseña cuándo recurrir a ellas, qué superficie usar y cómo llamarla, para que el agente elija la herramienta y los parámetros correctos por sí mismo en lugar de adivinar.

Las habilidades enrutan a través de la CLI de decodo, este servidor MCP alojado y la API HTTP sin procesar, y recurren al servidor MCP automáticamente cuando no hay un shell disponible. Combinar ambos le da a tu agente tanto la capa de ejecución (este servidor) como la capa de decisión (las habilidades) en una sola configuración.

Inicio rápido (Claude Code):

/plugin marketplace add Decodo/agent-skills
/plugin install decodo@decodo-skills

Consulta el README de agent-skills para instalación manual y otros agentes (Cursor, Codex, Gemini CLI, Windsurf).

Repositorios relacionados

API de Web Scraping, Habilidades de agente de Decodo, Habilidad OpenClaw de Decodo

Pruébalo

Integra Decodo MCP Server en tu flujo de trabajo de IA con solo unos clics y equipa a tus agentes de IA con datos en tiempo real de cualquier sitio web.

Comienza gratis | Documentación | Discord

Licencia

Todo el código se publica bajo la Licencia MIT.