AI Crawler Index
Identifique crawlers de IA por user-agent ou IP e gere o robots.txt que corresponde à sua postura.
Documentação
Servidor MCP
Este índice como um servidor MCP: HTTP Streamable em /mcp, nove ferramentas somente leitura, sem chave, sem cadastro. Classifique um user-agent, consulte um crawler, gere robots.txt, verifique um IP.
Conecte-se: uma colagem, uma chamada
https://www.pathwren.workers.dev/mcp
no auth, read-only, public
Esse é o endpoint completo e esses são seus termos: HTTP Streamable (MCP), sem chave de API, sem conta, sem OAuth, sem sessão para manter ativa, nada para instalar. Toda ferramenta é somente leitura, e nenhuma delas buscará uma URL em seu nome.
O JSON que uma configuração de conector espera — Claude Desktop, Cursor, VS Code, Windsurf, Cline,
LibreChat, Continue, qualquer coisa que aceite um bloco mcpServers. Completo como
está; não há campo para preencher:
{
"mcpServers": {
"ai-crawler-index": {
"type": "streamable-http",
"url": "https://www.pathwren.workers.dev/mcp"
}
}
}
O Claude Code aceita uma única linha:
claude mcp add --transport http ai-crawler-index https://www.pathwren.workers.dev/mcp
Então chame whoami primeiro. Ela não aceita nenhum argumento, então não há
nada para inventar e nada para consultar antes de você ver este servidor funcionar — o assunto da
resposta é a solicitação que você acabou de enviar:
curl -s https://www.pathwren.workers.dev/mcp \
-H 'content-type: application/json' -H 'accept: application/json, text/event-stream' \
-d '{"jsonrpc":"2.0","id":1,"method":"tools/call","params":{"name":"whoami","arguments":{}}}' \
| jq -r '.result.content[0].text' | head -3
You are calling as: curl/8.7.1
From: 203.0.113.7 (CF-Connecting-IP)
Our own instrument books that user-agent as: agent.
Essas são as três primeiras linhas da própria resposta. As duas primeiras são o que VOCÊ enviou —
a amostra mostra um curl simples de um endereço de documentação — e a terceira é o que o classificador
deste host faz com isso. O restante da resposta adiciona o registro do próprio índice sobre o user-agent que você enviou, se já o vimos aqui
antes, e o que nossa política de robots diz ao seu user-agent. Nada é buscado para responder, nenhum
argumento existe, e a mesma resposta é um GET simples em
/tools/whoami. example é a outra ferramenta sem argumentos
neste servidor: ela executa o exemplo prático do próprio servidor de verdade e devolve exatamente o que uma
chamada real retorna. Qualquer uma das duas é uma primeira chamada segura.
O índice inteiro, falado como Model Context Protocol em vez de como arquivos. HTTP Streamable, sem estado, sem chave, sem cadastro, sem sessão para manter ativa. Toda ferramenta é somente leitura.
# it answers right now — no account, no header ceremony
curl -s https://www.pathwren.workers.dev/mcp \
-H 'content-type: application/json' -H 'accept: application/json, text/event-stream' \
-d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}' | jq -r '.result.tools[].name'
Ferramentas
| Ferramenta | O que ela responde |
|---|---|
classify_user_agent | Dado um cabeçalho User-Agent bruto: qual crawler é este, quem o opera, para que serve e quanto custa bloqueá-lo? |
lookup_crawler | O registro completo de um crawler por slug, nome ou token de robots.txt. |
list_crawlers | Os 150 crawlers, filtrados por categoria, operador, postura de robots.txt ou método de verificação. Também retorna os valores de filtro válidos, então uma chamada ensina o vocabulário. |
generate_robots_txt | Um robots.txt pronto para colar para uma de 8 posturas, com a justificativa e os tokens exatos que ela implica. |
is_verified_crawler_ip | Este IP está dentro de uma faixa que o próprio operador publica? 1987 prefixos IPv4 e 1062 prefixos IPv6, espelhados de 15 endpoints, atualizados a cada seis horas. |
whats_changed | Tempo de build, atualização por fonte, quais fontes mudaram ou estão falhando, e o changelog datado. A verificação cron para qualquer coisa que regenere uma configuração a partir desses dados. |
Recursos
Quatro, cada um apontando para o arquivo a partir do qual as ferramentas são calculadas:
agents.json, ua-regex.json, ip-ranges/all.json,
status.json. Leia-os diretamente se preferir fazer sua própria correspondência.
O que ele não fará
Não tem efeitos colaterais e nenhum caminho de escrita: não pode editar seu robots.txt, bloquear nada,
ou buscar uma URL para você. Uma correspondência de user-agent é uma afirmação, não uma prova — classify_user_agent
diz isso em toda resposta, e is_verified_crawler_ip é a ferramenta que transforma uma afirmação
em evidência. Onde um operador não publica faixas, nenhuma ferramenta aqui pode verificar, e cada
uma diz em qual caso você está.
Medido, não afirmado: como realmente se parecem 24 horas de chamadores nesses endpoints — 330 chaves de cliente tocaram um endpoint RPC aqui, 214 delas nunca enviaram um POST, e 23 comprovaram uma chamada de ferramenta. Uma janela nomeada, cada número com sua derivação em /data/mcp-endpoint-callers-2026-w36.json.
Medido aqui, não afirmado: O que registros MCP públicos erram, medido em seis endpoints — 134 chaves de cliente em 97 operadores, 8.617 handshakes, e as quatro armadilhas em que um registro publicado cai: o GET de abertura de stream que responde 405, os documentos de descoberta que chamadores esperam antes de discar, duas grafias da mesma URL RFC 9728, e um arquivo de propriedade que retorna 404. Um de cinco documentos sobre as mesmas 24 horas — os outros quatro são nomeados no rodapé de cada um — todos também em .md e .json, com os números e o SQL sob o índice de dados ao lado.
Mais cinco servidores neste host
Trabalhos diferentes, sem nomes de ferramentas compartilhados — execute todos os seis ou apenas o que você precisa.
crawler-log-triage em /mcp/triage recebe um log de acesso
inteiro e retorna veredictos por linha, os impostores, e um robots.txt ou conjunto de regras WAF para exatamente o que
havia nele. agent-discovery-doctor em /mcp/doctor
inverte a pergunta: quais dos 22 documentos de descoberta que agentes pedem — llms.txt, A2A
agent card, owners.json, mcp.json — um host realmente serve, e quem pede cada um que está
faltando. robots-policy-lint em /mcp/robots lê um
robots.txt que você cola e relata o que ele realmente faz, pelas regras da RFC 9309.
crawler-ip-verifier em /mcp/netcheck é a forma
em lote e prefixo de is_verified_crawler_ip: 500 endereços por vez, aritmética de
sobreposição CIDR, e uma allowlist de firewall que você pode colar.
mcp-endpoint-lint em /mcp/lint é o que visa o próprio MCP:
dê a ele o endpoint de outro servidor e ele relata o que o handshake negociou, se
cada esquema de ferramenta anunciado compila, se os códigos de erro são os que o JSON-RPC exige,
e o que um cliente encontra antes de discar — pontuado de 0 a 100.
Versões de protocolo 2026-06-18, negociadas por chamada.
server/discover responde para clientes em 2026-07-28, initialize para todos os demais.
Mesmos dados de /data/agents.json e
/openapi.json — escolha o que seu cliente fala.
Listado no Registro oficial de MCP como dev.workers.pathwren.www/ai-crawler-index.
Mapa do site
- Mapa do site completo (XML) — todas as páginas, com datas
- Mapa do site completo (markdown) — o mesmo mapa, legível
- llms.txt — o host inteiro em um arquivo de texto
- documents.json — todos os documentos, com seus ETags
- Agentes A2A
- Sobre e método
- API
- /c//
- Changelog
- Conformidade
- Contato
- Impressum · Anbieterkennzeichnung
- AI Crawler Index
- Nenhum modelo roda aqui
- Jurídico
- Servidor MCP
- Servidor MCP
- Servidor MCP
- Servidor MCP
- Servidor MCP
- Transporte MCP: a etapa GET e HEAD
- Servidor MCP
- Servidor MCP
- Pacotes
- Preços
- Privacidade
- Referência da API
- Acesso, chaves e cadastro
- Postura de segurança
- Serviços
- Status upstream
- Termos de uso
- Confiança
Cópias automáticas desta página
- HTML (canônico)
- JSON
- Markdown — este documento
Este documento é uma renderização em markdown de https://www.pathwren.workers.dev/mcp.html, gerada a partir dos bytes da própria página na mesma compilação. A página HTML é canônica.