Webclaw
Extracción de contenido web para pipelines de LLM: markdown limpio o JSON estructurado desde cualquier URL mediante huellas TLS de nivel de navegador, sin necesidad de navegador sin interfaz gráfica. CLI, API REST y servidor MCP.
Documentación
Español | 简体中文
webclaw
Convierte sitios web en markdown limpio, JSON y contexto listo para LLM.
CLI, servidor MCP, API REST y SDKs para agentes de IA y pipelines de RAG.
La mayoría de las herramientas de scraping web le dan a tu agente uno de dos malos resultados:
- una página bloqueada, un muro de inicio de sesión o un shell de aplicación vacío
- HTML crudo lleno de navegación, scripts, estilos, anuncios y plantillas duplicadas
webclaw.io es la API de extracción web alojada para webclaw. Este repositorio contiene el CLI de código abierto, el servidor MCP, el motor de extracción y el servidor autoalojable.
webclaw convierte una URL en contenido limpio que tus herramientas realmente pueden usar.
webclaw https://example.com --format markdown
# Example Domain
This domain is for use in illustrative examples in documents.
You may use this domain in literature without prior coordination or asking for permission.
Úsalo desde la terminal, conéctalo a Claude/Cursor a través de MCP, llama a la API alojada desde tu aplicación o autoaloja el servidor OSS.
Instalación
Configuración para agentes
La forma más rápida de conectar webclaw a Claude Code, Claude Desktop, Cursor, Windsurf, OpenCode, Codex CLI y otras herramientas compatibles con MCP:
npx create-webclaw
El instalador detecta los clientes compatibles y configura el servidor MCP por ti.
Homebrew
brew tap 0xMassi/webclaw
brew install webclaw
Binarios precompilados
Descarga binarios para macOS, Linux y Windows desde GitHub Releases.
Windows (x64)
El ZIP precompilado es la instalación más fácil y no requiere Rust. En la
página de la versión v0.6.22,
descarga webclaw-v0.6.22-x86_64-pc-windows-msvc.zip. Extráelo en el Explorador de archivos,
abre PowerShell en la carpeta extraída que contiene webclaw.exe y ejecuta:
.\webclaw.exe --version
.\webclaw.exe https://example.com --format markdown
PowerShell requiere el prefijo .\ para programas en el directorio actual.
Agrega ese directorio a tu PATH de usuario solo si quieres ejecutar webclaw desde
otras carpetas. Si Windows informa que falta un DLL de runtime de Visual C++, instala el
Microsoft Visual C++ Redistributable para x64. El ZIP contiene binarios x64;
Windows ARM64 no está cubierto por la verificación de instalación nativa.
Para compilar desde el código fuente en Windows, instala Rust con el
toolchain x86_64-pc-windows-msvc, Visual Studio Build Tools con Desarrollo de escritorio con C++ y
el Windows SDK, Git, CMake 3.22 o más reciente, LLVM (incluyendo libclang.dll) y
NASM. Abre un nuevo Developer PowerShell para Visual Studio después de la instalación.
Asegúrate de que CMake y NASM estén en el PATH y establece LIBCLANG_PATH a tu directorio bin
de LLVM si bindgen no puede encontrarlo, por ejemplo:
$env:LIBCLANG_PATH = "C:\Program Files\LLVM\bin"
cargo install --git https://github.com/0xMassi/webclaw.git --tag v0.6.22 --locked webclaw-cli
webclaw --version
El paquete de Cargo es webclaw-cli; el ejecutable es webclaw. Estos paquetes
se instalan desde Git, no desde crates.io. Una primera compilación desde el código fuente puede tardar
varios minutos. El flujo de trabajo de CI de Windows verifica la instalación de Git y el ZIP publicado
en un runner alojado con herramientas de compilación preinstaladas; no modela una PC limpia.
Los contenedores Linux, incluido Docker en macOS, no validan el soporte de Windows.
Docker
docker run --rm ghcr.io/0xmassi/webclaw https://example.com
Cargo
cargo install --git https://github.com/0xMassi/webclaw.git --tag v0.6.22 --locked webclaw-cli
cargo install --git https://github.com/0xMassi/webclaw.git --tag v0.6.22 --locked webclaw-mcp
Si la compilación desde el código fuente falla porque faltan herramientas de compilación nativas, instala los requisitos previos de la plataforma:
| SO | Comando |
|---|---|
| Debian / Ubuntu | sudo apt install -y pkg-config libssl-dev cmake clang git build-essential |
| Fedora / RHEL | sudo dnf install -y pkg-config openssl-devel cmake clang git make gcc |
| Arch | sudo pacman -S pkg-config openssl cmake clang git base-devel |
| macOS | xcode-select --install |
Inicio rápido
Extraer una página
webclaw https://stripe.com --format markdown
Devolver texto optimizado para LLM
webclaw https://docs.anthropic.com --format llm
Conservar solo el contenido principal
webclaw https://example.com/blog/post --only-main-content
Incluir o excluir selectores
webclaw https://example.com \
--include "article, main, .content" \
--exclude "nav, footer, .sidebar, .ad"
Rastrear un sitio de documentación
webclaw https://docs.rust-lang.org --crawl --depth 2 --max-pages 50
Ejemplos de flujos de trabajo
- HTML a Markdown para RAG
- API compatible con Firecrawl
- Scraping web con MCP
- Rastreo con proxy respaldado por ColdProxy
- Diagnósticos de Cloudflare
Extraer activos de marca
webclaw https://github.com --brand
Comparar una página a lo largo del tiempo
webclaw https://example.com/pricing --format json > pricing-old.json
webclaw https://example.com/pricing --diff-with pricing-old.json
Servidor MCP
webclaw incluye un servidor MCP para agentes de IA.
Sin instalación: apunta cualquier cliente MCP al lanzador de npx:
{
"mcpServers": {
"webclaw": {
"command": "npx",
"args": ["-y", "@webclaw/mcp"]
}
}
}
O ejecuta npx create-webclaw para detectar automáticamente tus herramientas de IA y escribir sus configuraciones por ti.
Luego pregúntale a tu agente cosas como:
Scrape these competitor pricing pages and summarize the differences.
Crawl this documentation site and prepare clean context for a RAG index.
Extract the brand colors, fonts, and logos from this company website.
Uso como habilidad de agente
Agrega webclaw a Claude Code, Cursor, Windsurf y otros agentes MCP con un solo comando:
npx skills add 0xMassi/webclaw-skill
Tu agente obtiene scrape, crawl, map, extract, summarize, diff, brand y search
como herramientas nativas. La mayoría de los sitios se extraen localmente sin clave de API. Establece WEBCLAW_API_KEY
para manejar páginas protegidas contra bots y renderizadas con JavaScript.
Encuéntralo en skills.sh.
Herramientas
| Herramienta | Qué hace | Local |
|---|---|---|
scrape | Extrae una URL como markdown, texto, JSON, formato LLM o HTML | Sí |
crawl | Sigue enlaces del mismo origen y extrae las páginas descubiertas | Sí |
map | Descubre URLs sin extraer cada página | Sí |
batch | Extrae múltiples URLs en paralelo | Sí |
extract | Convierte el contenido de la página en datos estructurados | Sí, con LLM local o configurado |
summarize | Resume una página | Sí, con LLM local o configurado |
diff | Compara instantáneas de contenido de páginas | Sí |
brand | Extrae colores, fuentes, logotipos y metadatos | Sí |
search | Busca en la web y extrae resultados | API alojada |
research | Flujo de trabajo de investigación con múltiples fuentes | API alojada |
SDKs
npm install @webclaw/sdk
pip install webclaw
go get github.com/0xMassi/webclaw-go
TypeScript
import { Webclaw } from "@webclaw/sdk";
const client = new Webclaw({ apiKey: process.env.WEBCLAW_API_KEY! });
const page = await client.scrape({
url: "https://example.com",
formats: ["markdown"],
only_main_content: true,
});
console.log(page.markdown);
Python
from webclaw import Webclaw
client = Webclaw(api_key="wc_your_key")
page = client.scrape(
"https://example.com",
formats=["markdown"],
only_main_content=True,
)
print(page.markdown)
cURL
curl -X POST https://api.webclaw.io/v1/scrape \
-H "Authorization: Bearer $WEBCLAW_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"url": "https://example.com",
"formats": ["markdown"],
"only_main_content": true
}'
Formatos de salida
| Formato | Úsalo cuando necesites |
|---|---|
markdown | Contenido de página limpio con estructura preservada |
llm | Contexto compacto para agentes y pipelines de RAG |
text | Texto plano con formato mínimo |
json | Metadatos estructurados, enlaces, imágenes y campos extraídos |
html | HTML limpio para procesamiento personalizado |
Local primero, alojado cuando sea necesario
El CLI y el servidor MCP funcionan localmente sin cuenta para la ruta de extracción principal.
Usa la API alojada en webclaw.io cuando necesites:
- acceso a sitios protegidos sin gestionar infraestructura
- renderizado de JavaScript
- trabajos asíncronos de rastreo e investigación
- búsqueda web
- monitoreo y seguimiento de uso en producción
- SDKs para código de aplicación
export WEBCLAW_API_KEY=wc_your_key
webclaw https://example.com --cloud
Lo que puedes construir
| Caso de uso | Ejemplo |
|---|---|
| Acceso web para agentes de IA | Dale a Claude, Cursor u otro cliente MCP contexto de página limpio |
| Ingestión de RAG | Rastrea documentación, centros de ayuda, blogs y bases de conocimiento |
| Monitoreo de competidores | Rastrea páginas de precios, changelogs, documentación y páginas de productos |
| Extracción estructurada | Convierte páginas desordenadas en JSON tipado para automatizaciones |
| Flujos de investigación | Busca, extrae, resume y cita múltiples fuentes |
| Inteligencia de marca | Extrae logotipos, colores, fuentes y metadatos sociales |
Arquitectura
webclaw/
crates/
webclaw-core HTML to markdown, text, JSON, and LLM-ready output
webclaw-fetch Fetching, crawling, batching, and mapping
webclaw-llm Local and hosted LLM provider support
webclaw-pdf PDF text extraction
webclaw-mcp MCP server for AI agents
webclaw-cli Command-line interface
webclaw-core es lógica de extracción pura: sin E/S de red, superficie pequeña y utilizable de forma independiente de la capa de obtención.
Configuración
| Variable | Descripción |
|---|---|
WEBCLAW_API_KEY | Clave de API alojada |
OLLAMA_HOST | URL de Ollama para funciones locales de LLM |
OPENAI_API_KEY | Clave de proveedor de LLM compatible con OpenAI |
OPENAI_BASE_URL | URL base compatible con OpenAI |
ANTHROPIC_API_KEY | Clave de proveedor de LLM compatible con Anthropic |
ANTHROPIC_BASE_URL | URL base compatible con Anthropic |
ORCAROUTER_API_KEY | Clave de proveedor de LLM de OrcaRouter |
ORCAROUTER_BASE_URL | URL base de OrcaRouter (por defecto https://api.orcarouter.ai/v1) |
WEBCLAW_PROXY | URL de proxy única |
WEBCLAW_PROXY_FILE | Archivo de pool de proxies |
Contribuciones
Las contribuciones más útiles en este momento son prácticas y pequeñas:
- agrega ejemplos para flujos de trabajo reales de agentes y RAG
- mejora los fragmentos de SDK
- reporta páginas que se extraen mal
- agrega fixtures que fallen para HTML desordenado
- mejora la documentación para clientes MCP y configuración local
- prueba el CLI en más entornos Linux/macOS
Buenos lugares para comenzar:
Si una página se extrae mal, incluye:
URL:
Command or API request:
Expected output:
Actual output:
Format used: markdown / llm / text / json / html
CLI, MCP, SDK, or API:
Por favor, elimina secretos, cookies, tokens privados y datos de clientes de los registros antes de publicar.
Socio estratégico
|
| SerpApi, la API de búsqueda web. Proporciona datos en tiempo real a tus agentes de IA y mejora sus respuestas con los resultados estructurados de motores de búsqueda de SerpApi. SerpApi apoya a webclaw como Socio Estratégico. |
Socio de infraestructura
|
ColdProxy apoya a webclaw como Socio de Infraestructura, proporcionando infraestructura de proxies
residenciales IPv4, residenciales IPv6 y de centro de datos IPv6 en más de 195 países para recopilación
de datos públicos, pruebas regionales, monitoreo y flujos de trabajo de scraping web. Explora
los planes y ofertas más recientes de ColdProxy directamente en el sitio web.
Usa el código webclaw8Off para obtener un 8% de descuento en tu primer pago.
Consulta la guía de rastreo con proxy respaldado
para un recorrido práctico de cómo conectar ColdProxy a webclaw.
|
Socios de estudio
|
NodeMaven: El proveedor de proxies más eficiente para Web Scraping y Automatización con la IP de mayor calidad del mercado.
Códigos especiales para usuarios de Webclaw:
|
|
MangoProxy ofrece proxies residenciales, ISP, de centro de datos y móviles en más de 200 ubicaciones, respaldados por un pool de más de 90 millones de IPs con soporte HTTP y SOCKS5 y alta estabilidad para web scraping y recopilación de datos a gran escala.
Usa el código 0XMASSI para obtener un 8% de descuento en proxies ISP (estáticos) en
mangoproxy.com.
|
|
Thordata: Proxies Residenciales Premium para Desarrolladores. Construye rastreadores confiables, agentes de IA y flujos de automatización con IPs residenciales limpias e infraestructura de proxy estable.
Oferta especial de Webclaw: Prueba gratuita de 3 días
|
Plugins de la Comunidad
Plugins de terceros que integran webclaw con plataformas de agentes de IA:
| Plugin | Plataforma | Qué hace |
|---|---|---|
| openclaw-webclaw | OpenClaw | Plugin nativo de la API v1 de webclaw con 9 herramientas: scrape, search, crawl, extract, summarize, diff, map, batch, brand |
| hermes-webclaw | Hermes Agent | Proveedor de búsqueda web y 9 herramientas dedicadas para toda la superficie de la API v1. Instalar con hermes plugins install jal-co/hermes-webclaw |
¿Construiste una integración de webclaw? Abre un PR para agregarla aquí.
Contribuidores
Gracias a todos los que mejoran webclaw a través de issues, ejemplos, documentación, reportes de errores y pull requests.