Decodo
oficialAcceso sencillo a datos web. Recuperación simplificada de información de sitios web y fuentes en línea.
¿Qué puedes hacer con Decodo MCP?
- Scrape any webpage as Markdown — Pídele a tu asistente que obtenga una URL mediante
scrape_as_markdowny devuelva contenido limpio y listo para LLM desde sitios con mucho JavaScript. - Capture page screenshots — Solicita una captura visual de cualquier página web usando
screenshot, con opciones de geolocalización y emulación de dispositivos. - Run search engine queries — Obtén resultados parseados de Google, Bing o Google AI Mode usando herramientas como
google_search,bing_searchogoogle_ai_mode. - Track eCommerce products and pricing — Supervisa listados, precios y vendedores en Amazon, Walmart, Target y TikTok Shop con herramientas como
amazon_pricingywalmart_search. - Collect social media data — Recopila publicaciones, información de canales, subtítulos y participación de Reddit, TikTok y YouTube mediante herramientas como
reddit_subreddityyoutube_subtitles. - Query AI search engines — Obtén respuestas y conversaciones generadas por IA desde
chatgptoperplexitydirectamente en tu flujo de trabajo.
Documentación
Servidor MCP de Decodo
Conecta LLMs y agentes de IA a datos web en vivo usando MCP (Protocolo de Contexto de Modelos). El servidor MCP de Decodo te permite extraer datos de sitios web, motores de búsqueda, plataformas de comercio electrónico y redes sociales directamente desde herramientas de IA como Claude, Cursor y Windsurf, todo sin necesidad de construir infraestructura de scraping desde cero.
- Salidas estructuradas en JSON, Markdown y capturas de pantalla
- Renderizado de JavaScript del lado del servidor y manejo anti-bots
- Más de 125 millones de IPs en más de 195 ubicaciones
¿Qué es el servidor MCP de Decodo?
El servidor MCP de Decodo es una capa de scraping web para agentes de IA. Conecta clientes compatibles con MCP a la API de Scraping Web de Decodo, permitiendo:
- Scraping web para LLMs
- Recuperación de datos en tiempo real para RAG
- Navegación e investigación de agentes de IA
- Extracción de datos estructurados de sitios web dinámicos
En lugar de mantener proxies, analizadores y lógica de reintentos, obtienes un único punto de integración para un acceso confiable a datos web.
¿Por qué usar MCP para scraping web?
El Protocolo de Contexto de Modelos (MCP) es el estándar emergente para conectar agentes de IA a herramientas externas y fuentes de datos. Con MCP:
- Los agentes pueden llamar herramientas dinámicamente
- Las integraciones se mantienen estandarizadas
- Los flujos de trabajo escalan entre entornos
El servidor MCP de Decodo brinda a tus agentes acceso web confiable y listo para producción a través de este estándar.
Características clave
Scraping web para agentes de IA, sin infraestructura requerida. Extrae datos de cualquier sitio web, incluidas páginas con mucho JavaScript, sin manejar rotación de proxies, resolución de CAPTCHA o sistemas anti-bots.
Salidas estructuradas para flujos de trabajo con LLM. Markdown (listo para LLM), JSON (para pipelines estructurados) y capturas de pantalla (para contexto visual), diseñados para pipelines RAG, agentes de investigación de IA y flujos de automatización.
Soporte integrado para objetivos populares. Herramientas listas para Google y Bing (SERPs), Amazon, Walmart y Target (comercio electrónico), Reddit, TikTok y YouTube (redes sociales), y ChatGPT y Perplexity (búsqueda con IA).
Infraestructura global de proxies. Más de 125 millones de IPs residenciales, más de 195 ubicaciones geográficas y una tasa de éxito del 99.99% incluso en los objetivos más protegidos.
Conjuntos de herramientas MCP modulares. Activa solo lo que necesitas: web, search, ecommerce, social_media, ai para una selección de herramientas más limpia y un mejor rendimiento del agente.
Rápido tiempo de implementación. Desde la clave API hasta el primer scraping en minutos, sin costos de configuración.
Casos de uso
Usa el servidor MCP de Decodo cuando necesites scraping web para agentes de IA, extracción de datos estructurados a escala, acceso confiable a sitios web dinámicos, datos en tiempo real para RAG, o una alternativa a construir infraestructura de scraping desde cero. Escenarios comunes:
- Scraping web impulsado por IA – da a los LLMs la capacidad de recopilar datos frescos en lugar de depender de datos de entrenamiento estáticos.
- RAG con datos en vivo – incorpora resultados de búsqueda en tiempo real de Google, Bing y búsqueda con IA en pipelines de recuperación.
- Inteligencia de comercio electrónico – rastrea precios de productos, listados y vendedores en marketplaces sin ser bloqueado.
- Recopilación de datos de redes sociales – recopila publicaciones, canales y datos de participación de Reddit, TikTok y YouTube.
- Agregación de viajes y precios – construye herramientas que recopilen precios y disponibilidad en vivo en sitios web.
Inicio rápido
- Crea una cuenta gratuita en dashboard.decodo.com – hasta 2K solicitudes gratuitas, sin tarjeta de crédito requerida.
- Obtén tu clave API. Obtén un token de autenticación básica de la API de Scraping Web desde el panel de control.
- Descarga Node.js 18+ desde https://nodejs.org.
- Consigue un cliente MCP como Claude Desktop, Cursor, Windsurf u otras herramientas compatibles con MCP.
- Configura el servidor MCP en tu cliente de IA (consulta ejemplos de configuración a continuación).
Conexión al servidor MCP de Decodo
Abre tu cliente MCP preferido y agrega la siguiente configuración (consulta ejemplos para Claude Code, Cursor y Windsurf a continuación):
{
"mcpServers": {
"Decodo": {
"url": "https://mcp.decodo.com/mcp",
"headers": {
"Authorization": "Basic <basic_auth_token>"
}
}
}
}
Claude Desktop
- Abre Claude Desktop → Configuración → Desarrollador → Editar Configuración.
- Agrega a claude_desktop_config.json:
{
"mcpServers": {
"Decodo": {
"command": "npx",
"args": ["-y", "@decodo/mcp-server"],
"env": {
"SCRAPER_API_TOKEN": "<basic_auth_token>",
"TOOLSETS": "web,ai"
}
}
}
}
- Guarda y reinicia Claude Desktop.
Cursor
- Abre Configuración → MCP.
- Haz clic en Agregar un nuevo servidor MCP global (abre mcp.json).
- Agrega la misma configuración que arriba.
- Guarda — busca un indicador de estado verde junto a Decodo.
Windsurf
- Abre Configuración → Configuración de Windsurf.
- Desplázate a Cascade → Agregar servidor personalizado + (abre mcp_config.json).
- Agrega la misma configuración que arriba.
- Guarda y reinicia Windsurf.
Prueba tu configuración
Una vez conectado, prueba este prompt en tu cliente:
▎ "Extrae los títulos de los 5 artículos principales de Hacker News"
Deberías obtener una lista estructurada en segundos. Si ves un error de autenticación, verifica tu token desde el panel de control.
Opcional: habilita conjuntos de herramientas específicos
Ejecutando el servidor MCP localmente
Requisitos previos
- Node.js 18.0+
- Un cliente MCP: las opciones populares son Claude Desktop y Cursor
Guía paso a paso
- Clona este repositorio:
git clone https://github.com/Decodo/mcp-server
- Ejecuta los siguientes comandos en la terminal:
cd decodo-mcp-server
npm install
npm run build
- Toma nota de tu ubicación de compilación:
cd build/
pwd
Agregando index.js al final de este directorio, la ubicación de tu archivo de compilación debería verse algo así:
/Users/your.user/projects/decodo-mcp/build/index.js
- Actualiza tu cliente MCP con la información del servidor:
{
"mcpServers": {
"decodo-mcp": {
"command": "node",
"args": ["/Users/your.user/projects/decodo-mcp/build/index.js"],
"env": {
"SCRAPER_API_TOKEN": "<web_scraping_api_base64_token>"
}
}
}
}
Conjuntos de herramientas
Las herramientas están organizadas en conjuntos de herramientas. Puedes habilitar selectivamente conjuntos específicos pasando una lista separada por comas a través del parámetro de consulta toolsets:
"Decodo MCP Server": {
"url": "https://mcp.decodo.com/mcp?toolsets=web,ai",
"headers": {
"Authorization": "Basic <your_auth_token>"
}
}
Cuando no se especifican conjuntos de herramientas, se registran todas las herramientas.
| Conjunto de herramientas | Herramientas |
|---|---|
web | scrape_as_markdown, screenshot |
search | google_search, google_ads, google_lens, google_travel_hotels, bing_search |
ecommerce | amazon_search, amazon_product, amazon_pricing, amazon_sellers, amazon_bestsellers, walmart_search, walmart_product, target_search, target_product, tiktok_shop_search, tiktok_shop_product, tiktok_shop_url |
social_media | reddit_post, reddit_subreddit, reddit_user, tiktok_post, youtube_metadata, youtube_channel, youtube_subtitles, youtube_search |
ai | chatgpt, perplexity, google_ai_mode |
Herramientas
El servidor expone las siguientes herramientas:
| Herramienta | Descripción | Ejemplo de prompt |
|---|---|---|
scrape_as_markdown | Extrae cualquier URL objetivo; espera que se proporcione una URL mediante el prompt. Devuelve resultados en Markdown. | Extrae peacock.com desde una IP de EE. UU. y dime los precios. |
screenshot | Captura una captura de pantalla de cualquier página web y la devuelve como imagen PNG. | Toma una captura de pantalla de github.com desde una IP de EE. UU. |
google_search | Extrae resultados de Google Search para una consulta dada y devuelve resultados analizados. | Extrae Google Search para zapatos y dime la primera posición. |
google_ads | Extrae resultados de búsqueda de Google Ads. | Extrae Google Ads para laptop y muéstrame los primeros anuncios. |
google_lens | Extrae resultados de búsqueda de imágenes de Google Lens. | Busca en Google Lens esta imagen: https://example.com/image.jpg |
google_ai_mode | Extrae resultados de Google AI Mode (Búsqueda con IA). | Pregunta a Google AI Mode: ¿Cuáles son las tres mejores razas de perros? |
google_travel_hotels | Extrae resultados de búsqueda de Google Travel Hotels. | Busca en Google Travel Hotels hoteles en París. |
amazon_search | Extrae resultados de Amazon Search para una consulta dada y devuelve resultados analizados. | Extrae Amazon Search para teclado inalámbrico. |
amazon_product | Extrae la página de producto de Amazon. | Extrae el producto de Amazon B09H74FXNW y muéstrame los detalles. |
amazon_pricing | Extrae información de precios de productos de Amazon. | Obtén el precio del producto de Amazon B09H74FXNW. |
amazon_sellers | Extrae información del vendedor de Amazon. | Obtén información sobre el vendedor de Amazon A1R0Z7FJGTKESH. |
amazon_bestsellers | Extrae la lista de más vendidos de Amazon. | Muéstrame los más vendidos de Amazon en electrónica. |
walmart_search | Extrae resultados de Walmart Search para una consulta dada y devuelve resultados analizados. | Extrae Walmart Search para tienda de campaña. |
walmart_product | Extrae la página de producto de Walmart. | Extrae el producto de Walmart 15296401808. |
target_search | Extrae resultados de Target Search para una consulta dada y devuelve resultados analizados. | Extrae Target Search para electrodomésticos de cocina. |
target_product | Extrae la página de producto de Target. | Extrae el producto de Target 92186007. |
tiktok_post | Extrae una URL de publicación de TikTok para datos estructurados (p. ej., interacción, subtítulo, hashtags). | Extrae esta publicación de TikTok: https://www.tiktok.com/@nba/video/7393013274725403950 |
tiktok_shop_search | Extrae resultados de TikTok Shop Search para una consulta dada y devuelve resultados analizados. | Extrae TikTok Shop Search para fundas de teléfono. |
tiktok_shop_product | Extrae la página de producto de TikTok Shop. | Extrae el producto de TikTok Shop 1731541214379741272. |
tiktok_shop_url | Extrae la página de TikTok Shop por URL. | Extrae esta URL de TikTok Shop: https://www.tiktok.com/shop/s?q=HEADPHONES |
youtube_metadata | Extrae metadatos de videos de YouTube. | Obtén metadatos del video de YouTube dFu9aKJoqGg. |
youtube_channel | Extrae videos de un canal de YouTube. | Extrae el canal de YouTube @decodo_official. |
youtube_subtitles | Extrae subtítulos de videos de YouTube. | Obtén subtítulos del video de YouTube L8zSWbQN-v8. |
youtube_search | Busca videos en YouTube. | Busca en YouTube "Cómo cuidar chinchillas". |
reddit_post | Extrae una publicación específica de Reddit. | Extrae la siguiente publicación de Reddit: https://www.reddit.com/r/horseracing/comments/1nsrn3/ |
reddit_subreddit | Extrae resultados de subreddits de Reddit. | Extrae las 5 publicaciones principales de r/Python esta semana. |
reddit_user | Extrae el perfil de un usuario de Reddit y sus publicaciones/comentarios. | Extrae este usuario de Reddit: https://www.reddit.com/user/IWasRightOnce/ |
bing_search | Extrae resultados de Bing Search. | Busca en Bing reseñas de laptops. |
chatgpt | Busca e interactúa con ChatGPT para respuestas y conversaciones impulsadas por IA. | Pide a ChatGPT que explique la computación cuántica en términos simples. |
perplexity | Busca e interactúa con Perplexity para respuestas y conversaciones impulsadas por IA. | Pregunta a Perplexity cuáles son las últimas tendencias en desarrollo web. |
Parámetros
Los siguientes parámetros se infieren de los prompts del usuario:
| Parámetro | Descripción |
|---|---|
jsRender | Renderiza la URL objetivo en un navegador sin interfaz gráfica. |
geo | Establece el país desde el que se originará la solicitud. |
locale | Establece la configuración regional de la solicitud. |
tokenLimit | Trunca el contenido de la respuesta hasta este límite. Útil si la ventana de contexto es pequeña. |
prompt | Prompt para enviar a herramientas de IA (chatgpt, perplexity). |
search | Activa la funcionalidad de búsqueda web de ChatGPT (solo chatgpt). |
xhr | Cuando es verdadero, incluye respuestas XHR o fetch en el resultado de extracción donde sea compatible (p. ej., tiktok_post). |
deviceType | Tipo de dispositivo a emular para la solicitud (desktop, mobile, tablet). |
domain | Dominio a usar para la solicitud (p. ej., amazon.com, amazon.co.uk, bing.com). |
pageFrom | Número de página inicial para la paginación. |
deliveryZip | Código postal para la ubicación de entrega (Target, Walmart). |
storeId | ID de tienda para inventario local (Target, Walmart). |
country | País para solicitudes de TikTok Shop. |
limit | Número máximo de resultados a devolver (p. ej., videos de canal de YouTube). |
language_code | Código de idioma para subtítulos (p. ej., en, es). |
Ejemplos
Extracción de contenido con restricción geográfica
Consulta a tu agente de IA con el siguiente prompt:
Scrape peacock.com from a German IP address and tell me the pricing.
Este prompt indicará que peacock.com tiene restricción geográfica. Para omitir la restricción geográfica:
Scrape peacock.com from a US IP address and tell me the pricing.
Limitación del número de tokens de respuesta
Si tu agente tiene una ventana de contexto pequeña, el contenido devuelto por la extracción se truncará automáticamente para evitar el desbordamiento de contexto. Puedes aumentar el número de tokens devueltos dentro de tu prompt:
Scrape hacker news, return 50k tokens.
Si tu agente tiene una ventana de contexto grande, indícale que devuelva full content:
Scrape hacker news, return full content.
Uso con las habilidades del agente Decodo
Este servidor le da a tu agente las herramientas de extracción. Decodo/agent-skills
le enseña cuándo usarlas, qué superficie utilizar y cómo llamarla, para que el agente
elija la herramienta y los parámetros correctos por sí mismo en lugar de adivinar.
Las habilidades se enrutan a través de la CLI de decodo, este servidor MCP alojado y la API HTTP
sin procesar, y recurren automáticamente al servidor MCP cuando no hay shell disponible. Combinar ambos le da
a tu agente tanto la capa de ejecución (este servidor) como la capa de decisión (las habilidades) en una
sola configuración.
Inicio rápido (Claude Code):
/plugin marketplace add Decodo/agent-skills
/plugin install decodo@decodo-skills
Consulta el README de agent-skills para la instalación manual y otros agentes (Cursor, Codex, Gemini CLI, Windsurf).
Repositorios relacionados
Web Scraping API, Decodo agent skills, Decodo OpenClaw skill
Pruébalo
Conecta Decodo MCP Server a tu flujo de trabajo de IA en solo unos clics y equipa a tus agentes de IA con datos en tiempo real de cualquier sitio web.
Comienza gratis | Documentación | Discord
Licencia
Todo el código se publica bajo la Licencia MIT.