Webclaw

Extracción de contenido web para pipelines de LLM: markdown limpio o JSON estructurado desde cualquier URL mediante huellas TLS de nivel de navegador, sin necesidad de navegador sin interfaz gráfica. CLI, API REST y servidor MCP.

Documentación

Español | 简体中文

webclaw

webclaw

Convierte sitios web en markdown limpio, JSON y contexto listo para LLM.
CLI, servidor MCP, API REST y SDKs para agentes de IA y pipelines de RAG.

Stars Version License npm installs

Discord X / Twitter Hosted webclaw Docs

0xMassi/webclaw | Trendshift

webclaw extracting clean markdown from a page


La mayoría de las herramientas de scraping web le dan a tu agente uno de dos malos resultados:

  • una página bloqueada, un muro de inicio de sesión o un shell de aplicación vacío
  • HTML crudo lleno de navegación, scripts, estilos, anuncios y plantillas duplicadas

webclaw.io es la API de extracción web alojada para webclaw. Este repositorio contiene el CLI de código abierto, el servidor MCP, el motor de extracción y el servidor autoalojable.

webclaw convierte una URL en contenido limpio que tus herramientas realmente pueden usar.

webclaw https://example.com --format markdown
# Example Domain

This domain is for use in illustrative examples in documents.

You may use this domain in literature without prior coordination or asking for permission.

Úsalo desde la terminal, conéctalo a Claude/Cursor a través de MCP, llama a la API alojada desde tu aplicación o autoaloja el servidor OSS.


Instalación

Configuración para agentes

La forma más rápida de conectar webclaw a Claude Code, Claude Desktop, Cursor, Windsurf, OpenCode, Codex CLI y otras herramientas compatibles con MCP:

npx create-webclaw

El instalador detecta los clientes compatibles y configura el servidor MCP por ti.

Homebrew

brew tap 0xMassi/webclaw
brew install webclaw

Binarios precompilados

Descarga binarios para macOS, Linux y Windows desde GitHub Releases.

Windows (x64)

El ZIP precompilado es la instalación más fácil y no requiere Rust. En la página de la versión v0.6.22, descarga webclaw-v0.6.22-x86_64-pc-windows-msvc.zip. Extráelo en el Explorador de archivos, abre PowerShell en la carpeta extraída que contiene webclaw.exe y ejecuta:

.\webclaw.exe --version
.\webclaw.exe https://example.com --format markdown

PowerShell requiere el prefijo .\ para programas en el directorio actual. Agrega ese directorio a tu PATH de usuario solo si quieres ejecutar webclaw desde otras carpetas. Si Windows informa que falta un DLL de runtime de Visual C++, instala el Microsoft Visual C++ Redistributable para x64. El ZIP contiene binarios x64; Windows ARM64 no está cubierto por la verificación de instalación nativa.

Para compilar desde el código fuente en Windows, instala Rust con el toolchain x86_64-pc-windows-msvc, Visual Studio Build Tools con Desarrollo de escritorio con C++ y el Windows SDK, Git, CMake 3.22 o más reciente, LLVM (incluyendo libclang.dll) y NASM. Abre un nuevo Developer PowerShell para Visual Studio después de la instalación. Asegúrate de que CMake y NASM estén en el PATH y establece LIBCLANG_PATH a tu directorio bin de LLVM si bindgen no puede encontrarlo, por ejemplo:

$env:LIBCLANG_PATH = "C:\Program Files\LLVM\bin"
cargo install --git https://github.com/0xMassi/webclaw.git --tag v0.6.22 --locked webclaw-cli
webclaw --version

El paquete de Cargo es webclaw-cli; el ejecutable es webclaw. Estos paquetes se instalan desde Git, no desde crates.io. Una primera compilación desde el código fuente puede tardar varios minutos. El flujo de trabajo de CI de Windows verifica la instalación de Git y el ZIP publicado en un runner alojado con herramientas de compilación preinstaladas; no modela una PC limpia. Los contenedores Linux, incluido Docker en macOS, no validan el soporte de Windows.

Docker

docker run --rm ghcr.io/0xmassi/webclaw https://example.com

Cargo

cargo install --git https://github.com/0xMassi/webclaw.git --tag v0.6.22 --locked webclaw-cli
cargo install --git https://github.com/0xMassi/webclaw.git --tag v0.6.22 --locked webclaw-mcp

Si la compilación desde el código fuente falla porque faltan herramientas de compilación nativas, instala los requisitos previos de la plataforma:

SOComando
Debian / Ubuntusudo apt install -y pkg-config libssl-dev cmake clang git build-essential
Fedora / RHELsudo dnf install -y pkg-config openssl-devel cmake clang git make gcc
Archsudo pacman -S pkg-config openssl cmake clang git base-devel
macOSxcode-select --install

Inicio rápido

Extraer una página

webclaw https://stripe.com --format markdown

Devolver texto optimizado para LLM

webclaw https://docs.anthropic.com --format llm

Conservar solo el contenido principal

webclaw https://example.com/blog/post --only-main-content

Incluir o excluir selectores

webclaw https://example.com \
  --include "article, main, .content" \
  --exclude "nav, footer, .sidebar, .ad"

Rastrear un sitio de documentación

webclaw https://docs.rust-lang.org --crawl --depth 2 --max-pages 50

Ejemplos de flujos de trabajo

Extraer activos de marca

webclaw https://github.com --brand

Comparar una página a lo largo del tiempo

webclaw https://example.com/pricing --format json > pricing-old.json
webclaw https://example.com/pricing --diff-with pricing-old.json

Servidor MCP

webclaw incluye un servidor MCP para agentes de IA.

Sin instalación: apunta cualquier cliente MCP al lanzador de npx:

{
  "mcpServers": {
    "webclaw": {
      "command": "npx",
      "args": ["-y", "@webclaw/mcp"]
    }
  }
}

O ejecuta npx create-webclaw para detectar automáticamente tus herramientas de IA y escribir sus configuraciones por ti.

Luego pregúntale a tu agente cosas como:

Scrape these competitor pricing pages and summarize the differences.
Crawl this documentation site and prepare clean context for a RAG index.
Extract the brand colors, fonts, and logos from this company website.

Uso como habilidad de agente

Agrega webclaw a Claude Code, Cursor, Windsurf y otros agentes MCP con un solo comando:

npx skills add 0xMassi/webclaw-skill

Tu agente obtiene scrape, crawl, map, extract, summarize, diff, brand y search como herramientas nativas. La mayoría de los sitios se extraen localmente sin clave de API. Establece WEBCLAW_API_KEY para manejar páginas protegidas contra bots y renderizadas con JavaScript.

Encuéntralo en skills.sh.


Herramientas

HerramientaQué haceLocal
scrapeExtrae una URL como markdown, texto, JSON, formato LLM o HTMLSí
crawlSigue enlaces del mismo origen y extrae las páginas descubiertasSí
mapDescubre URLs sin extraer cada páginaSí
batchExtrae múltiples URLs en paraleloSí
extractConvierte el contenido de la página en datos estructuradosSí, con LLM local o configurado
summarizeResume una páginaSí, con LLM local o configurado
diffCompara instantáneas de contenido de páginasSí
brandExtrae colores, fuentes, logotipos y metadatosSí
searchBusca en la web y extrae resultadosAPI alojada
researchFlujo de trabajo de investigación con múltiples fuentesAPI alojada

SDKs

npm install @webclaw/sdk
pip install webclaw
go get github.com/0xMassi/webclaw-go
TypeScript
import { Webclaw } from "@webclaw/sdk";

const client = new Webclaw({ apiKey: process.env.WEBCLAW_API_KEY! });

const page = await client.scrape({
  url: "https://example.com",
  formats: ["markdown"],
  only_main_content: true,
});

console.log(page.markdown);
Python
from webclaw import Webclaw

client = Webclaw(api_key="wc_your_key")

page = client.scrape(
    "https://example.com",
    formats=["markdown"],
    only_main_content=True,
)

print(page.markdown)
cURL
curl -X POST https://api.webclaw.io/v1/scrape \
  -H "Authorization: Bearer $WEBCLAW_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "url": "https://example.com",
    "formats": ["markdown"],
    "only_main_content": true
  }'

Formatos de salida

FormatoÚsalo cuando necesites
markdownContenido de página limpio con estructura preservada
llmContexto compacto para agentes y pipelines de RAG
textTexto plano con formato mínimo
jsonMetadatos estructurados, enlaces, imágenes y campos extraídos
htmlHTML limpio para procesamiento personalizado

Local primero, alojado cuando sea necesario

El CLI y el servidor MCP funcionan localmente sin cuenta para la ruta de extracción principal.

Usa la API alojada en webclaw.io cuando necesites:

  • acceso a sitios protegidos sin gestionar infraestructura
  • renderizado de JavaScript
  • trabajos asíncronos de rastreo e investigación
  • búsqueda web
  • monitoreo y seguimiento de uso en producción
  • SDKs para código de aplicación
export WEBCLAW_API_KEY=wc_your_key

webclaw https://example.com --cloud

Lo que puedes construir

Caso de usoEjemplo
Acceso web para agentes de IADale a Claude, Cursor u otro cliente MCP contexto de página limpio
Ingestión de RAGRastrea documentación, centros de ayuda, blogs y bases de conocimiento
Monitoreo de competidoresRastrea páginas de precios, changelogs, documentación y páginas de productos
Extracción estructuradaConvierte páginas desordenadas en JSON tipado para automatizaciones
Flujos de investigaciónBusca, extrae, resume y cita múltiples fuentes
Inteligencia de marcaExtrae logotipos, colores, fuentes y metadatos sociales

Arquitectura

webclaw/
  crates/
    webclaw-core     HTML to markdown, text, JSON, and LLM-ready output
    webclaw-fetch    Fetching, crawling, batching, and mapping
    webclaw-llm      Local and hosted LLM provider support
    webclaw-pdf      PDF text extraction
    webclaw-mcp      MCP server for AI agents
    webclaw-cli      Command-line interface

webclaw-core es lógica de extracción pura: sin E/S de red, superficie pequeña y utilizable de forma independiente de la capa de obtención.


Configuración

VariableDescripción
WEBCLAW_API_KEYClave de API alojada
OLLAMA_HOSTURL de Ollama para funciones locales de LLM
OPENAI_API_KEYClave de proveedor de LLM compatible con OpenAI
OPENAI_BASE_URLURL base compatible con OpenAI
ANTHROPIC_API_KEYClave de proveedor de LLM compatible con Anthropic
ANTHROPIC_BASE_URLURL base compatible con Anthropic
ORCAROUTER_API_KEYClave de proveedor de LLM de OrcaRouter
ORCAROUTER_BASE_URLURL base de OrcaRouter (por defecto https://api.orcarouter.ai/v1)
WEBCLAW_PROXYURL de proxy única
WEBCLAW_PROXY_FILEArchivo de pool de proxies

Contribuciones

Las contribuciones más útiles en este momento son prácticas y pequeñas:

  • agrega ejemplos para flujos de trabajo reales de agentes y RAG
  • mejora los fragmentos de SDK
  • reporta páginas que se extraen mal
  • agrega fixtures que fallen para HTML desordenado
  • mejora la documentación para clientes MCP y configuración local
  • prueba el CLI en más entornos Linux/macOS

Buenos lugares para comenzar:

Si una página se extrae mal, incluye:

URL:
Command or API request:
Expected output:
Actual output:
Format used: markdown / llm / text / json / html
CLI, MCP, SDK, or API:

Por favor, elimina secretos, cookies, tokens privados y datos de clientes de los registros antes de publicar.


Socio estratégico

SerpApi
SerpApi, la API de búsqueda web. Proporciona datos en tiempo real a tus agentes de IA y mejora sus respuestas con los resultados estructurados de motores de búsqueda de SerpApi. SerpApi apoya a webclaw como Socio Estratégico.

Socio de infraestructura

ColdProxy
ColdProxy apoya a webclaw como Socio de Infraestructura, proporcionando infraestructura de proxies residenciales IPv4, residenciales IPv6 y de centro de datos IPv6 en más de 195 países para recopilación de datos públicos, pruebas regionales, monitoreo y flujos de trabajo de scraping web. Explora los planes y ofertas más recientes de ColdProxy directamente en el sitio web. Usa el código webclaw8Off para obtener un 8% de descuento en tu primer pago. Consulta la guía de rastreo con proxy respaldado para un recorrido práctico de cómo conectar ColdProxy a webclaw.

Socios de estudio

NodeMaven

NodeMaven: El proveedor de proxies más eficiente para Web Scraping y Automatización con la IP de mayor calidad del mercado.

¿Por qué NodeMaven?

  • Segmentación por código postal (ZIP)
  • 99.9% de tiempo de actividad
  • Filtrado de IP: todos los proxies tienen un fraude score <97%
  • No se requiere KYC
  • Herramientas gratuitas únicas: Proxy Bandwidth Checker, Meta Tag Checker, IP Lookup y ¡más!

Códigos especiales para usuarios de Webclaw:

  • WEBCLAW35 - 35% de descuento en Proxies Móviles y Residenciales
  • WEBCLAW40 - 40% de descuento en Proxies ISP (Estáticos)
MangoProxy MangoProxy ofrece proxies residenciales, ISP, de centro de datos y móviles en más de 200 ubicaciones, respaldados por un pool de más de 90 millones de IPs con soporte HTTP y SOCKS5 y alta estabilidad para web scraping y recopilación de datos a gran escala. Usa el código 0XMASSI para obtener un 8% de descuento en proxies ISP (estáticos) en mangoproxy.com.
Thordata

Thordata: Proxies Residenciales Premium para Desarrolladores. Construye rastreadores confiables, agentes de IA y flujos de automatización con IPs residenciales limpias e infraestructura de proxy estable.

¿Por qué Thordata?

  • Más de 100 millones de IPs en más de 195 GEOs
  • Conexiones concurrentes ilimitadas
  • 99.99% de tiempo de actividad y conexiones estables
  • Rotación + Sesiones persistentes (Sticky)

Oferta especial de Webclaw: Prueba gratuita de 3 días

  • WEBCLAW - 10% DE DESCUENTO

Plugins de la Comunidad

Plugins de terceros que integran webclaw con plataformas de agentes de IA:

PluginPlataformaQué hace
openclaw-webclawOpenClawPlugin nativo de la API v1 de webclaw con 9 herramientas: scrape, search, crawl, extract, summarize, diff, map, batch, brand
hermes-webclawHermes AgentProveedor de búsqueda web y 9 herramientas dedicadas para toda la superficie de la API v1. Instalar con hermes plugins install jal-co/hermes-webclaw

¿Construiste una integración de webclaw? Abre un PR para agregarla aquí.


Contribuidores

Gracias a todos los que mejoran webclaw a través de issues, ejemplos, documentación, reportes de errores y pull requests.

webclaw contributors

Historial de Estrellas

Star History Chart

Licencia

AGPL-3.0