AI Crawler Index

Identifique crawlers de IA por user-agent ou IP e gere o robots.txt que corresponde à sua postura.

Documentação

Servidor MCP

Este índice como um servidor MCP: HTTP Streamable em /mcp, nove ferramentas somente leitura, sem chave, sem cadastro. Classifique um user-agent, consulte um crawler, gere robots.txt, verifique um IP.

Conecte-se: uma colagem, uma chamada

https://www.pathwren.workers.dev/mcp
no auth, read-only, public

Esse é o endpoint completo e esses são seus termos: HTTP Streamable (MCP), sem chave de API, sem conta, sem OAuth, sem sessão para manter ativa, nada para instalar. Toda ferramenta é somente leitura, e nenhuma delas buscará uma URL em seu nome.

O JSON que uma configuração de conector espera — Claude Desktop, Cursor, VS Code, Windsurf, Cline, LibreChat, Continue, qualquer coisa que aceite um bloco mcpServers. Completo como está; não há campo para preencher:

{
  "mcpServers": {
    "ai-crawler-index": {
      "type": "streamable-http",
      "url": "https://www.pathwren.workers.dev/mcp"
    }
  }
}

O Claude Code aceita uma única linha:

claude mcp add --transport http ai-crawler-index https://www.pathwren.workers.dev/mcp

Então chame whoami primeiro. Ela não aceita nenhum argumento, então não há nada para inventar e nada para consultar antes de você ver este servidor funcionar — o assunto da resposta é a solicitação que você acabou de enviar:

curl -s https://www.pathwren.workers.dev/mcp \
  -H 'content-type: application/json' -H 'accept: application/json, text/event-stream' \
  -d '{"jsonrpc":"2.0","id":1,"method":"tools/call","params":{"name":"whoami","arguments":{}}}' \
  | jq -r '.result.content[0].text' | head -3

You are calling as: curl/8.7.1
From: 203.0.113.7 (CF-Connecting-IP)
Our own instrument books that user-agent as: agent.

Essas são as três primeiras linhas da própria resposta. As duas primeiras são o que VOCÊ enviou — a amostra mostra um curl simples de um endereço de documentação — e a terceira é o que o classificador deste host faz com isso. O restante da resposta adiciona o registro do próprio índice sobre o user-agent que você enviou, se já o vimos aqui antes, e o que nossa política de robots diz ao seu user-agent. Nada é buscado para responder, nenhum argumento existe, e a mesma resposta é um GET simples em /tools/whoami. example é a outra ferramenta sem argumentos neste servidor: ela executa o exemplo prático do próprio servidor de verdade e devolve exatamente o que uma chamada real retorna. Qualquer uma das duas é uma primeira chamada segura.

O índice inteiro, falado como Model Context Protocol em vez de como arquivos. HTTP Streamable, sem estado, sem chave, sem cadastro, sem sessão para manter ativa. Toda ferramenta é somente leitura.

# it answers right now — no account, no header ceremony
curl -s https://www.pathwren.workers.dev/mcp \
  -H 'content-type: application/json' -H 'accept: application/json, text/event-stream' \
  -d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}' | jq -r '.result.tools[].name'

Ferramentas

FerramentaO que ela responde
classify_user_agentDado um cabeçalho User-Agent bruto: qual crawler é este, quem o opera, para que serve e quanto custa bloqueá-lo?
lookup_crawlerO registro completo de um crawler por slug, nome ou token de robots.txt.
list_crawlersOs 150 crawlers, filtrados por categoria, operador, postura de robots.txt ou método de verificação. Também retorna os valores de filtro válidos, então uma chamada ensina o vocabulário.
generate_robots_txtUm robots.txt pronto para colar para uma de 8 posturas, com a justificativa e os tokens exatos que ela implica.
is_verified_crawler_ipEste IP está dentro de uma faixa que o próprio operador publica? 1987 prefixos IPv4 e 1062 prefixos IPv6, espelhados de 15 endpoints, atualizados a cada seis horas.
whats_changedTempo de build, atualização por fonte, quais fontes mudaram ou estão falhando, e o changelog datado. A verificação cron para qualquer coisa que regenere uma configuração a partir desses dados.

Recursos

Quatro, cada um apontando para o arquivo a partir do qual as ferramentas são calculadas: agents.json, ua-regex.json, ip-ranges/all.json, status.json. Leia-os diretamente se preferir fazer sua própria correspondência.

O que ele não fará

Não tem efeitos colaterais e nenhum caminho de escrita: não pode editar seu robots.txt, bloquear nada, ou buscar uma URL para você. Uma correspondência de user-agent é uma afirmação, não uma prova — classify_user_agent diz isso em toda resposta, e is_verified_crawler_ip é a ferramenta que transforma uma afirmação em evidência. Onde um operador não publica faixas, nenhuma ferramenta aqui pode verificar, e cada uma diz em qual caso você está.

Medido, não afirmado: como realmente se parecem 24 horas de chamadores nesses endpoints — 330 chaves de cliente tocaram um endpoint RPC aqui, 214 delas nunca enviaram um POST, e 23 comprovaram uma chamada de ferramenta. Uma janela nomeada, cada número com sua derivação em /data/mcp-endpoint-callers-2026-w36.json.

Medido aqui, não afirmado: O que registros MCP públicos erram, medido em seis endpoints — 134 chaves de cliente em 97 operadores, 8.617 handshakes, e as quatro armadilhas em que um registro publicado cai: o GET de abertura de stream que responde 405, os documentos de descoberta que chamadores esperam antes de discar, duas grafias da mesma URL RFC 9728, e um arquivo de propriedade que retorna 404. Um de cinco documentos sobre as mesmas 24 horas — os outros quatro são nomeados no rodapé de cada um — todos também em .md e .json, com os números e o SQL sob o índice de dados ao lado.

Mais cinco servidores neste host

Trabalhos diferentes, sem nomes de ferramentas compartilhados — execute todos os seis ou apenas o que você precisa. crawler-log-triage em /mcp/triage recebe um log de acesso inteiro e retorna veredictos por linha, os impostores, e um robots.txt ou conjunto de regras WAF para exatamente o que havia nele. agent-discovery-doctor em /mcp/doctor inverte a pergunta: quais dos 22 documentos de descoberta que agentes pedem — llms.txt, A2A agent card, owners.json, mcp.json — um host realmente serve, e quem pede cada um que está faltando. robots-policy-lint em /mcp/robots lê um robots.txt que você cola e relata o que ele realmente faz, pelas regras da RFC 9309. crawler-ip-verifier em /mcp/netcheck é a forma em lote e prefixo de is_verified_crawler_ip: 500 endereços por vez, aritmética de sobreposição CIDR, e uma allowlist de firewall que você pode colar. mcp-endpoint-lint em /mcp/lint é o que visa o próprio MCP: dê a ele o endpoint de outro servidor e ele relata o que o handshake negociou, se cada esquema de ferramenta anunciado compila, se os códigos de erro são os que o JSON-RPC exige, e o que um cliente encontra antes de discar — pontuado de 0 a 100.

Versões de protocolo 2026-06-18, negociadas por chamada. server/discover responde para clientes em 2026-07-28, initialize para todos os demais. Mesmos dados de /data/agents.json e /openapi.json — escolha o que seu cliente fala. Listado no Registro oficial de MCP como dev.workers.pathwren.www/ai-crawler-index.

Mapa do site

Cópias automáticas desta página

Este documento é uma renderização em markdown de https://www.pathwren.workers.dev/mcp.html, gerada a partir dos bytes da própria página na mesma compilação. A página HTML é canônica.