Webclaw
Extração de conteúdo web para pipelines de LLM — markdown limpo ou JSON estruturado de qualquer URL usando fingerprinting TLS em nível de navegador, sem necessidade de navegador headless. CLI, API REST e servidor MCP.
Documentação
Português (BR) | 简体中文
webclaw
Transforme sites em markdown limpo, JSON e contexto pronto para LLM.
CLI, servidor MCP, API REST e SDKs para agentes de IA e pipelines de RAG.
A maioria das ferramentas de web scraping dá ao seu agente um de dois resultados ruins:
- uma página bloqueada, parede de login ou shell de aplicativo vazio
- HTML bruto cheio de navegação, scripts, estilos, anúncios e boilerplate duplicado
webclaw.io é a API hospedada de extração web para webclaw. Este repositório contém o CLI de código aberto, o servidor MCP, o mecanismo de extração e o servidor auto-hospedável.
webclaw transforma uma URL em conteúdo limpo que suas ferramentas podem realmente usar.
webclaw https://example.com --format markdown
# Example Domain
This domain is for use in illustrative examples in documents.
You may use this domain in literature without prior coordination or asking for permission.
Use-o pelo terminal, conecte-o ao Claude/Cursor via MCP, chame a API hospedada do seu aplicativo ou auto-hospede o servidor OSS.
Instalação
Configuração do agente
A maneira mais rápida de conectar webclaw ao Claude Code, Claude Desktop, Cursor, Windsurf, OpenCode, Codex CLI e outras ferramentas compatíveis com MCP:
npx create-webclaw
O instalador detecta clientes compatíveis e configura o servidor MCP para você.
Homebrew
brew tap 0xMassi/webclaw
brew install webclaw
Binários pré-compilados
Baixe binários para macOS, Linux e Windows em GitHub Releases.
Docker
docker run --rm ghcr.io/0xmassi/webclaw https://example.com
Cargo
cargo install --git https://github.com/0xMassi/webclaw.git webclaw-cli
cargo install --git https://github.com/0xMassi/webclaw.git webclaw-mcp
Se a compilação a partir do código-fonte falhar porque faltam ferramentas de build nativas, instale os pré-requisitos da plataforma:
| SO | Comando |
|---|---|
| Debian / Ubuntu | sudo apt install -y pkg-config libssl-dev cmake clang git build-essential |
| Fedora / RHEL | sudo dnf install -y pkg-config openssl-devel cmake clang git make gcc |
| Arch | sudo pacman -S pkg-config openssl cmake clang git base-devel |
| macOS | xcode-select --install |
Início Rápido
Extrair uma página
webclaw https://stripe.com --format markdown
Retornar texto otimizado para LLM
webclaw https://docs.anthropic.com --format llm
Manter apenas o conteúdo principal
webclaw https://example.com/blog/post --only-main-content
Incluir ou excluir seletores
webclaw https://example.com \
--include "article, main, .content" \
--exclude "nav, footer, .sidebar, .ad"
Rastrear um site de documentação
webclaw https://docs.rust-lang.org --crawl --depth 2 --max-pages 50
Exemplos de fluxos de trabalho
- HTML para Markdown para RAG
- API compatível com Firecrawl
- Web scraping via MCP
- Rastreamento com proxy via ColdProxy
- Diagnóstico de Cloudflare
Extrair ativos de marca
webclaw https://github.com --brand
Comparar uma página ao longo do tempo
webclaw https://example.com/pricing --format json > pricing-old.json
webclaw https://example.com/pricing --diff-with pricing-old.json
Servidor MCP
webclaw acompanha um servidor MCP para agentes de IA.
Instalação zero — aponte qualquer cliente MCP para o lançador npx:
{
"mcpServers": {
"webclaw": {
"command": "npx",
"args": ["-y", "@webclaw/mcp"]
}
}
}
Ou execute npx create-webclaw para detectar automaticamente suas ferramentas de IA e escrever as configurações para você.
Depois, pergunte ao seu agente coisas como:
Scrape these competitor pricing pages and summarize the differences.
Crawl this documentation site and prepare clean context for a RAG index.
Extract the brand colors, fonts, and logos from this company website.
Usar como habilidade de agente
Adicione webclaw ao Claude Code, Cursor, Windsurf e outros agentes MCP em um único comando:
npx skills add 0xMassi/webclaw-skill
Seu agente recebe scrape, crawl, map, extract, summarize, diff, brand e search
como ferramentas nativas. A maioria dos sites é extraída localmente sem chave de API. Defina WEBCLAW_API_KEY
para lidar com páginas protegidas contra bots e renderizadas com JavaScript.
Encontre-o em skills.sh.
Ferramentas
| Ferramenta | O que faz | Local |
|---|---|---|
scrape | Extrai uma URL como markdown, texto, JSON, formato LLM ou HTML | Sim |
crawl | Segue links da mesma origem e extrai páginas descobertas | Sim |
map | Descobre URLs sem extrair cada página | Sim |
batch | Extrai múltiplas URLs em paralelo | Sim |
extract | Converte o conteúdo da página em dados estruturados | Sim, com LLM local ou configurado |
summarize | Resume uma página | Sim, com LLM local ou configurado |
diff | Compara snapshots de conteúdo de páginas | Sim |
brand | Extrai cores, fontes, logotipos e metadados | Sim |
search | Pesquisa na web e extrai resultados | API hospedada |
research | Fluxo de trabalho de pesquisa multi-fonte | API hospedada |
SDKs
npm install @webclaw/sdk
pip install webclaw
go get github.com/0xMassi/webclaw-go
TypeScript
import { Webclaw } from "@webclaw/sdk";
const client = new Webclaw({ apiKey: process.env.WEBCLAW_API_KEY! });
const page = await client.scrape({
url: "https://example.com",
formats: ["markdown"],
only_main_content: true,
});
console.log(page.markdown);
Python
from webclaw import Webclaw
client = Webclaw(api_key="wc_your_key")
page = client.scrape(
"https://example.com",
formats=["markdown"],
only_main_content=True,
)
print(page.markdown)
cURL
curl -X POST https://api.webclaw.io/v1/scrape \
-H "Authorization: Bearer $WEBCLAW_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"url": "https://example.com",
"formats": ["markdown"],
"only_main_content": true
}'
Formatos de Saída
| Formato | Use quando precisar de |
|---|---|
markdown | Conteúdo limpo da página com estrutura preservada |
llm | Contexto compacto para agentes e pipelines de RAG |
text | Texto simples com formatação mínima |
json | Metadados estruturados, links, imagens e campos extraídos |
html | HTML limpo para processamento personalizado |
Local Primeiro, Hospedado Quando Necessário
O CLI e o servidor MCP funcionam localmente sem conta para o caminho principal de extração.
Use a API hospedada em webclaw.io quando precisar de:
- acesso a sites protegidos sem gerenciar infraestrutura
- renderização de JavaScript
- trabalhos assíncronos de rastreamento e pesquisa
- pesquisa na web
- monitoramentos e rastreamento de uso em produção
- SDKs para código de aplicação
export WEBCLAW_API_KEY=wc_your_key
webclaw https://example.com --cloud
O Que Você Pode Construir
| Caso de uso | Exemplo |
|---|---|
| Acesso web para agentes de IA | Dê ao Claude, Cursor ou outro cliente MCP contexto limpo de páginas |
| Ingestão de RAG | Rastreie docs, centros de ajuda, blogs e bases de conhecimento |
| Monitoramento de concorrentes | Acompanhe páginas de preços, changelogs, docs e páginas de produtos |
| Extração estruturada | Transforme páginas bagunçadas em JSON tipado para automações |
| Fluxos de pesquisa | Pesquise, extraia, resuma e cite múltiplas fontes |
| Inteligência de marca | Extraia logotipos, cores, fontes e metadados sociais |
Arquitetura
webclaw/
crates/
webclaw-core HTML to markdown, text, JSON, and LLM-ready output
webclaw-fetch Fetching, crawling, batching, and mapping
webclaw-llm Local and hosted LLM provider support
webclaw-pdf PDF text extraction
webclaw-mcp MCP server for AI agents
webclaw-cli Command-line interface
webclaw-core é lógica de extração pura: sem I/O de rede, superfície pequena e utilizável independentemente da camada de busca.
Configuração
| Variável | Descrição |
|---|---|
WEBCLAW_API_KEY | Chave da API hospedada |
OLLAMA_HOST | URL do Ollama para recursos locais de LLM |
OPENAI_API_KEY | Chave do provedor de LLM compatível com OpenAI |
OPENAI_BASE_URL | URL base compatível com OpenAI |
ANTHROPIC_API_KEY | Chave do provedor de LLM compatível com Anthropic |
ANTHROPIC_BASE_URL | URL base compatível com Anthropic |
ORCAROUTER_API_KEY | Chave do provedor de LLM OrcaRouter |
ORCAROUTER_BASE_URL | URL base do OrcaRouter (padrão: https://api.orcarouter.ai/v1) |
WEBCLAW_PROXY | URL de proxy único |
WEBCLAW_PROXY_FILE | Arquivo de pool de proxies |
Contribuindo
As contribuições mais úteis agora são práticas e pequenas:
- adicione exemplos para fluxos reais de agentes e RAG
- melhore trechos de SDK
- relate páginas que extraem mal
- adicione fixtures com falha para HTML bagunçado
- melhore a documentação para clientes MCP e configuração local
- teste o CLI em mais ambientes Linux/macOS
Bons lugares para começar:
Se uma página extrair mal, inclua:
URL:
Command or API request:
Expected output:
Actual output:
Format used: markdown / llm / text / json / html
CLI, MCP, SDK, or API:
Por favor, remova segredos, cookies, tokens privados e dados de clientes dos logs antes de publicar.
Parceiro Estratégico
|
| SerpApi, a API de Pesquisa Web. Dê dados em tempo real aos seus agentes de IA e melhore suas respostas com os resultados estruturados de mecanismos de busca da SerpApi. A SerpApi apoia webclaw como Parceiro Estratégico. |
Parceiro de Infraestrutura
|
ColdProxy apoia webclaw como Parceiro de Infraestrutura, fornecendo infraestrutura de proxies residenciais IPv4,
residenciais IPv6 e datacenter IPv6 em mais de 195 países para coleta de dados
públicos, testes regionais, monitoramento e fluxos de web scraping. Explore
ColdProxy's planos mais recentes e ofertas disponíveis diretamente no site.
Use o código webclaw8Off para 8% de desconto no seu primeiro pagamento.
Veja o guia de rastreamento com proxy
para um passo a passo prático de como conectar ColdProxy ao webclaw.
|
Parceiros de Estúdio
|
NodeMaven é o provedor de proxies mais confiável, com os IPs de maior qualidade do mercado.
Melhor solução para automação, web scraping, pesquisa de SEO e gerenciamento de mídias sociais: 99,9% de uptime,
sessões persistentes de até 7 dias, filtragem de IP (todos os proxies com pontuação de fraude abaixo de 97%), sem KYC e cashback de até
10% no tráfego. Use WEBCLAW35 para 35% de desconto em proxies Mobile e Residenciais, ou
WEBCLAW40 para 40% de desconto em proxies ISP (Estáticos) em
NodeMaven.
|
|
MangoProxy fornece proxies residenciais, ISP, datacenter e móveis em mais de 200 locais, com um pool de mais de 90 milhões de IPs, suporte a HTTP e SOCKS5 e alta estabilidade para web scraping e coleta de dados em escala.
Use o código 0XMASSI para 8% de desconto em proxies ISP (Estáticos) em
mangoproxy.com.
|
Plugins da Comunidade
Plugins de terceiros que integram webclaw a plataformas de agentes de IA:
| Plugin | Plataforma | O que faz |
|---|---|---|
| openclaw-webclaw | OpenClaw | Plugin nativo da API v1 do webclaw com 9 ferramentas: scrape, search, crawl, extract, summarize, diff, map, batch, brand |
| hermes-webclaw | Hermes Agent | Provedor de pesquisa web e 9 ferramentas dedicadas para toda a superfície da API v1. Instale com hermes plugins install jal-co/hermes-webclaw |
Construiu uma integração com webclaw? Abra um PR para adicioná-la aqui.
Contribuidores
Obrigado a todos que melhoram webclaw por meio de issues, exemplos, documentação, relatórios de bugs e pull requests.