Decodo
oficialAcceso sencillo a datos web. Recuperación simplificada de información de sitios web y fuentes en línea.
¿Qué puedes hacer con Decodo MCP?
- Extraer cualquier página web como Markdown — extrae contenido limpio y listo para LLM desde una URL usando
scrape_as_markdown. - Capturar capturas de pantalla de páginas web — toma una instantánea visual de cualquier sitio con
screenshot. - Buscar en Google y Bing — recupera resultados de SERP analizados mediante
google_searchybing_search. - Obtener datos de productos de comercio electrónico — consulta precios, vendedores y más vendidos en Amazon, Walmart o Target.
- Recopilar contenido de redes sociales — extrae publicaciones de Reddit, videos de TikTok o metadatos y subtítulos de YouTube.
- Consultar herramientas de búsqueda con IA — interactúa con ChatGPT, Perplexity o Google AI Mode para obtener respuestas impulsadas por IA.
Documentación
Servidor MCP Decodo
Conecta LLMs y agentes de IA a datos web en vivo usando MCP (Model Context Protocol). El Servidor MCP Decodo te permite extraer datos de sitios web, motores de búsqueda, plataformas de comercio electrónico y redes sociales directamente desde herramientas de IA como Claude, Cursor y Windsurf, sin necesidad de construir infraestructura de scraping desde cero.
- Salidas estructuradas en JSON, Markdown y capturas de pantalla
- Renderizado de JavaScript del lado del servidor y manejo anti-bot
- Más de 125 millones de IPs en más de 195 ubicaciones
¿Qué es el servidor MCP Decodo?
El Servidor MCP Decodo es una capa de web scraping para agentes de IA. Conecta clientes compatibles con MCP a la API de Web Scraping de Decodo, permitiendo:
- Web scraping para LLMs
- Recuperación de datos en tiempo real para RAG
- Navegación e investigación de agentes de IA
- Extracción de datos estructurados de sitios web dinámicos
En lugar de mantener proxies, analizadores y lógica de reintentos, obtienes un único punto de integración para un acceso fiable a datos web.
¿Por qué usar MCP para web scraping?
Model Context Protocol (MCP) es el estándar emergente para conectar agentes de IA a herramientas y fuentes de datos externas. Con MCP:
- Los agentes pueden llamar herramientas dinámicamente
- Las integraciones se mantienen estandarizadas
- Los flujos de trabajo escalan en todos los entornos
El Servidor MCP Decodo proporciona a tus agentes acceso web fiable y listo para producción a través de este estándar.
Características principales
Web scraping para agentes de IA, sin infraestructura necesaria. Extrae datos de cualquier sitio web, incluidas páginas con mucho JavaScript, sin gestionar la rotación de proxies, la resolución de CAPTCHAs o los sistemas anti-bot.
Salidas estructuradas para flujos de trabajo de LLM. Markdown (listo para LLM), JSON (para pipelines estructurados) y capturas de pantalla (para contexto visual), diseñado para pipelines RAG, agentes de investigación de IA y flujos de automatización.
Soporte integrado para objetivos populares. Herramientas listas para usar para Google y Bing (SERPs), Amazon, Walmart y Target (comercio electrónico), Reddit, TikTok y YouTube (redes sociales), y ChatGPT y Perplexity (búsqueda con IA).
Infraestructura de proxy global. Más de 125 millones de IPs residenciales, más de 195 ubicaciones geográficas y una tasa de éxito del 99.99% incluso en los objetivos más protegidos.
Conjuntos de herramientas MCP modulares. Habilita solo lo que necesitas: web, search, ecommerce, social_media, ai para una selección de herramientas más limpia y un mejor rendimiento del agente.
Rápido tiempo de puesta en marcha. Desde la clave API hasta el primer scraping en minutos, sin sobrecarga de configuración.
Casos de uso
Usa el Servidor MCP Decodo cuando necesites web scraping para agentes de IA, extracción de datos estructurados a escala, acceso fiable a sitios web dinámicos, datos en tiempo real para RAG o una alternativa a construir infraestructura de scraping desde cero. Escenarios comunes:
- Web scraping potenciado por IA – da a los LLMs la capacidad de recopilar datos frescos en lugar de depender de datos de entrenamiento estáticos.
- RAG con datos en vivo – incorpora resultados de búsqueda en tiempo real de Google, Bing y búsquedas con IA en pipelines de recuperación.
- Inteligencia de comercio electrónico – rastrea precios de productos, listados y vendedores en distintos mercados sin ser bloqueado.
- Recopilación de datos de redes sociales – reúne publicaciones, canales y datos de interacción de Reddit, TikTok y YouTube.
- Agregación de viajes y precios – construye herramientas que recopilen precios y disponibilidad en vivo en distintos sitios web.
Inicio rápido
- Crea una cuenta gratuita en dashboard.decodo.com – hasta 2K solicitudes gratuitas, sin tarjeta de crédito requerida.
- Obtén tu clave API. Consigue un token de autenticación básica de la API de Web Scraping desde el panel de control.
- Descarga Node.js 18+ desde https://nodejs.org.
- Consigue un cliente MCP como Claude Desktop, Cursor, Windsurf u otras herramientas compatibles con MCP.
- Configura el servidor MCP en tu cliente de IA (ver ejemplos de configuración a continuación).
Conexión al servidor MCP de Decodo
Abre tu cliente MCP preferido y añade la siguiente configuración (ver ejemplos para Claude Code, Cursor, Windsurf a continuación):
{
"mcpServers": {
"Decodo": {
"url": "https://mcp.decodo.com/mcp",
"headers": {
"Authorization": "Basic <basic_auth_token>"
}
}
}
}
Claude Desktop
- Abre Claude Desktop → Configuración → Desarrollador → Editar Config.
- Añade a claude_desktop_config.json:
{
"mcpServers": {
"Decodo": {
"command": "npx",
"args": ["-y", "@decodo/mcp-server"],
"env": {
"SCRAPER_API_TOKEN": "<basic_auth_token>",
"TOOLSETS": "web,ai"
}
}
}
}
- Guarda y reinicia Claude Desktop.
Cursor
- Abre Configuración → MCP.
- Haz clic en Añadir un nuevo servidor MCP global (abre mcp.json).
- Añade la misma configuración que arriba.
- Guarda — busca un indicador de estado verde junto a Decodo.
Windsurf
- Abre Configuración → Ajustes de Windsurf.
- Desplázate a Cascade → Añadir servidor personalizado + (abre mcp_config.json).
- Añade la misma configuración que arriba.
- Guarda y reinicia Windsurf.
Prueba tu configuración
Una vez conectado, prueba este prompt en tu cliente:
▎ "Extrae los títulos de los 5 artículos principales de Hacker News"
Deberías recibir una lista estructurada en segundos. Si ves un error de autenticación, verifica tu token en el panel de control.
Opcional: habilitar conjuntos de herramientas específicos
Ejecutar el servidor MCP localmente
Requisitos previos
- Node.js 18.0+
- Un cliente MCP - opciones populares son Claude Desktop y Cursor
Guía paso a paso
- Clona este repositorio:
git clone https://github.com/Decodo/mcp-server
- Ejecuta los siguientes comandos en la terminal:
cd decodo-mcp-server
npm install
npm run build
- Toma nota de la ubicación de tu compilación:
cd build/
pwd
Añadiendo index.js al final de este directorio, la ubicación de tu archivo de compilación debería verse algo así:
/Users/your.user/projects/decodo-mcp/build/index.js
- Actualiza tu cliente MCP con la información del servidor:
{
"mcpServers": {
"decodo-mcp": {
"command": "node",
"args": ["/Users/your.user/projects/decodo-mcp/build/index.js"],
"env": {
"SCRAPER_API_TOKEN": "<web_scraping_api_base64_token>"
}
}
}
}
Conjuntos de herramientas
Las herramientas están organizadas en conjuntos. Puedes habilitar selectivamente conjuntos específicos pasando una lista separada por comas a través del parámetro de consulta toolsets:
"Decodo MCP Server": {
"url": "https://mcp.decodo.com/mcp?toolsets=web,ai",
"headers": {
"Authorization": "Basic <your_auth_token>"
}
}
Cuando no se especifican conjuntos de herramientas, se registran todas las herramientas.
| Conjunto de herramientas | Herramientas |
|---|---|
web | scrape_as_markdown, screenshot |
search | google_search, google_ads, google_lens, google_travel_hotels, bing_search |
ecommerce | amazon_search, amazon_product, amazon_pricing, amazon_sellers, amazon_bestsellers, walmart_search, walmart_product, target_search, target_product, tiktok_shop_search, tiktok_shop_product, tiktok_shop_url |
social_media | reddit_post, reddit_subreddit, reddit_user, tiktok_post, youtube_metadata, youtube_channel, youtube_subtitles, youtube_search |
ai | chatgpt, perplexity, google_ai_mode |
Herramientas
El servidor expone las siguientes herramientas:
| Herramienta | Descripción | Ejemplo de prompt |
|---|---|---|
scrape_as_markdown | Extrae datos de cualquier URL objetivo; espera que se proporcione una URL mediante el prompt. Devuelve resultados en Markdown. | Extrae datos de peacock.com desde una IP de EE. UU. y dime los precios. |
screenshot | Captura una captura de pantalla de cualquier página web y la devuelve como imagen PNG. | Toma una captura de pantalla de github.com desde una IP de EE. UU. |
google_search | Extrae datos de Google Search para una consulta dada y devuelve resultados analizados. | Extrae datos de Google Search para "zapatos" y dime la primera posición. |
google_ads | Extrae resultados de búsqueda de Google Ads. | Extrae datos de Google Ads para "portátil" y muéstrame los anuncios principales. |
google_lens | Extrae resultados de búsqueda de imágenes de Google Lens. | Busca en Google Lens esta imagen: https://example.com/image.jpg |
google_ai_mode | Extrae resultados del Modo IA de Google (Búsqueda con IA). | Pregunta al Modo IA de Google: ¿Cuáles son las tres mejores razas de perros? |
google_travel_hotels | Extrae resultados de búsqueda de Google Travel Hotels. | Busca en Google Travel Hotels hoteles en París. |
amazon_search | Extrae datos de Amazon Search para una consulta dada y devuelve resultados analizados. | Extrae datos de Amazon Search para "teclado inalámbrico". |
amazon_product | Extrae datos de la página de un producto de Amazon. | Extrae datos del producto de Amazon B09H74FXNW y muéstrame los detalles. |
amazon_pricing | Extrae información de precios de un producto de Amazon. | Obtén el precio del producto de Amazon B09H74FXNW. |
amazon_sellers | Extrae información de un vendedor de Amazon. | Obtén información sobre el vendedor de Amazon A1R0Z7FJGTKESH. |
amazon_bestsellers | Extrae la lista de los más vendidos de Amazon. | Muéstrame los más vendidos de Amazon en electrónica. |
walmart_search | Extrae datos de Walmart Search para una consulta dada y devuelve resultados analizados. | Extrae datos de Walmart Search para "tienda de campaña". |
walmart_product | Extrae datos de la página de un producto de Walmart. | Extrae datos del producto de Walmart 15296401808. |
target_search | Extrae datos de Target Search para una consulta dada y devuelve resultados analizados. | Extrae datos de Target Search para "electrodomésticos de cocina". |
target_product | Extrae datos de la página de un producto de Target. | Extrae datos del producto de Target 92186007. |
tiktok_post | Extrae datos estructurados de una URL de publicación de TikTok (p. ej., interacciones, descripción, hashtags). | Extrae datos de esta publicación de TikTok: https://www.tiktok.com/@nba/video/7393013274725403950 |
tiktok_shop_search | Extrae datos de TikTok Shop Search para una consulta dada y devuelve resultados analizados. | Extrae datos de TikTok Shop Search para "fundas de teléfono". |
tiktok_shop_product | Extrae datos de la página de un producto de TikTok Shop. | Extrae datos del producto de TikTok Shop 1731541214379741272. |
tiktok_shop_url | Extrae datos de una página de TikTok Shop por URL. | Extrae datos de esta URL de TikTok Shop: https://www.tiktok.com/shop/s?q=HEADPHONES |
youtube_metadata | Extrae metadatos de un video de YouTube. | Obtén metadatos del video de YouTube dFu9aKJoqGg. |
youtube_channel | Extrae videos de un canal de YouTube. | Extrae datos del canal de YouTube @decodo_official. |
youtube_subtitles | Extrae subtítulos de un video de YouTube. | Obtén subtítulos del video de YouTube L8zSWbQN-v8. |
youtube_search | Busca videos en YouTube. | Busca en YouTube "Cómo cuidar chinchillas". |
reddit_post | Extrae datos de una publicación específica de Reddit. | Extrae datos de la siguiente publicación de Reddit: https://www.reddit.com/r/horseracing/comments/1nsrn3/ |
reddit_subreddit | Extrae resultados de un subreddit. | Extrae las 5 publicaciones principales de r/Python esta semana. |
reddit_user | Extrae el perfil de un usuario de Reddit y sus publicaciones/comentarios. | Extrae datos de este usuario de Reddit: https://www.reddit.com/user/IWasRightOnce/ |
bing_search | Extrae resultados de Bing Search. | Busca en Bing "reseñas de portátiles". |
chatgpt | Busca e interactúa con ChatGPT para obtener respuestas y conversaciones potenciadas por IA. | Pregunta a ChatGPT que explique la computación cuántica en términos sencillos. |
perplexity | Busca e interactúa con Perplexity para obtener respuestas y conversaciones potenciadas por IA. | Pregunta a Perplexity cuáles son las últimas tendencias en desarrollo web. |
Parámetros
Los siguientes parámetros se infieren de los prompts del usuario:
| Parámetro | Descripción |
|---|---|
jsRender | Renderiza la URL objetivo en un navegador sin interfaz gráfica. |
geo | Establece el país desde el cual se originará la solicitud. |
locale | Establece la configuración regional de la solicitud. |
tokenLimit | Trunca el contenido de la respuesta hasta este límite. Útil si la ventana de contexto es pequeña. |
prompt | Prompt para enviar a herramientas de IA (chatgpt, perplexity). |
search | Activa la funcionalidad de búsqueda web de ChatGPT (solo chatgpt). |
xhr | Cuando es verdadero, incluye respuestas XHR o fetch en el resultado del scraping donde sea compatible (p. ej., tiktok_post). |
deviceType | Tipo de dispositivo a emular para la solicitud (desktop, mobile, tablet). |
domain | Dominio a usar para la solicitud (p. ej., amazon.com, amazon.co.uk, bing.com). |
pageFrom | Número de página inicial para la paginación. |
deliveryZip | Código postal para la ubicación de entrega (Target, Walmart). |
storeId | ID de tienda para inventario local (Target, Walmart). |
country | País para solicitudes de TikTok Shop. |
limit | Número máximo de resultados a devolver (p. ej., videos de canal de YouTube). |
language_code | Código de idioma para subtítulos (p. ej., en, es). |
Ejemplos
Extracción de contenido con restricción geográfica
Consulta a tu agente de IA con el siguiente prompt:
Scrape peacock.com from a German IP address and tell me the pricing.
Este prompt indicará que peacock.com tiene restricción geográfica. Para eludir la restricción geográfica:
Scrape peacock.com from a US IP address and tell me the pricing.
Limitación del número de tokens de respuesta
Si tu agente tiene una ventana de contexto pequeña, el contenido devuelto del scraping se truncará automáticamente para evitar el desbordamiento del contexto. Puedes aumentar el número de tokens devueltos dentro de tu prompt:
Scrape hacker news, return 50k tokens.
Si tu agente tiene una ventana de contexto grande, indícale que devuelva full content:
Scrape hacker news, return full content.
Uso con las habilidades de agente de Decodo
Este servidor proporciona a tu agente las herramientas de scraping. Decodo/agent-skills
le enseña cuándo recurrir a ellas, qué superficie usar y cómo llamarla, para que el agente
elija la herramienta y los parámetros correctos por sí mismo en lugar de adivinar.
Las habilidades enrutan a través de la CLI de decodo, este servidor MCP alojado y la API HTTP sin procesar, y recurren
al servidor MCP automáticamente cuando no hay un shell disponible. Combinar ambos le da a tu agente tanto la
capa de ejecución (este servidor) como la capa de decisión (las habilidades) en una sola configuración.
Inicio rápido (Claude Code):
/plugin marketplace add Decodo/agent-skills
/plugin install decodo@decodo-skills
Consulta el README de agent-skills para instalación manual y otros agentes (Cursor, Codex, Gemini CLI, Windsurf).
Repositorios relacionados
API de Web Scraping, Habilidades de agente de Decodo, Habilidad OpenClaw de Decodo
Pruébalo
Integra Decodo MCP Server en tu flujo de trabajo de IA con solo unos clics y equipa a tus agentes de IA con datos en tiempo real de cualquier sitio web.
Comienza gratis | Documentación | Discord
Licencia
Todo el código se publica bajo la Licencia MIT.