AI Crawler Index

Identifica los rastreadores de IA por user-agent o IP y genera el robots.txt que coincida con tu postura.

Documentación

Servidor MCP

Este índice como servidor MCP: HTTP transmisible en /mcp, nueve herramientas de solo lectura, sin clave, sin registro. Clasifica un agente de usuario, busca un rastreador, genera robots.txt, verifica una IP.

Conéctalo: un pegado, una llamada

https://www.pathwren.workers.dev/mcp
no auth, read-only, public

Ese es el endpoint completo y esos son sus términos: HTTP transmisible (MCP), sin clave de API, sin cuenta, sin OAuth, sin sesión que mantener viva, nada que instalar. Cada herramienta es de solo lectura, y ninguna de ellas obtendrá una URL en tu nombre.

El JSON que una configuración de conector quiere — Claude Desktop, Cursor, VS Code, Windsurf, Cline, LibreChat, Continue, cualquier cosa que acepte un bloque mcpServers. Completo tal como está; no hay ningún campo que rellenar:

{
  "mcpServers": {
    "ai-crawler-index": {
      "type": "streamable-http",
      "url": "https://www.pathwren.workers.dev/mcp"
    }
  }
}

Claude Code acepta una sola línea en su lugar:

claude mcp add --transport http ai-crawler-index https://www.pathwren.workers.dev/mcp

Luego llama a whoami primero. No acepta argumentos en absoluto, así que no hay nada que inventar ni nada que buscar antes de que puedas ver funcionar este servidor — el tema de la respuesta es la solicitud que acabas de enviar:

curl -s https://www.pathwren.workers.dev/mcp \
  -H 'content-type: application/json' -H 'accept: application/json, text/event-stream' \
  -d '{"jsonrpc":"2.0","id":1,"method":"tools/call","params":{"name":"whoami","arguments":{}}}' \
  | jq -r '.result.content[0].text' | head -3

You are calling as: curl/8.7.1
From: 203.0.113.7 (CF-Connecting-IP)
Our own instrument books that user-agent as: agent.

Esas son las primeras tres líneas de la propia respuesta. Las dos primeras son lo que TÚ enviaste — la muestra muestra un curl simple desde una dirección de documentación — y la tercera es lo que el propio clasificador de este host hace con ello. El resto de la respuesta añade el registro propio del índice del agente de usuario que enviaste, si te hemos visto aquí antes, y lo que nuestra política de robots dice a tu agente de usuario. No se obtiene nada para responderla, no existe ningún argumento, y la misma respuesta es un GET simple en /tools/whoami. example es la otra herramienta de cero argumentos en este servidor: ejecuta el propio ejemplo trabajado de este servidor de verdad y devuelve exactamente lo que devuelve una llamada real. Cualquiera de las dos es una primera llamada segura.

Todo el índice, expresado como Protocolo de Contexto de Modelo en lugar de como archivos. HTTP transmisible, sin estado, sin clave, sin registro, sin sesión que mantener viva. Cada herramienta es de solo lectura.

# it answers right now — no account, no header ceremony
curl -s https://www.pathwren.workers.dev/mcp \
  -H 'content-type: application/json' -H 'accept: application/json, text/event-stream' \
  -d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}' | jq -r '.result.tools[].name'

Herramientas

HerramientaQué responde
classify_user_agentDado un encabezado de agente de usuario sin procesar: ¿qué rastreador es este, quién lo opera, para qué sirve y cuánto me cuesta bloquearlo?
lookup_crawlerEl registro completo de un rastreador por slug, nombre o token de robots.txt.
list_crawlersLos 150 rastreadores, filtrados por categoría, operador, postura de robots.txt o método de verificación. También devuelve los valores de filtro válidos, así que una llamada enseña el vocabulario.
generate_robots_txtUn robots.txt listo para pegar para una de 8 posturas, con el razonamiento y los tokens exactos que implica.
is_verified_crawler_ip¿Está esta IP dentro de un rango que el propio operador publica? 1987 prefijos IPv4 y 1062 prefijos IPv6, reflejados desde 15 endpoints, actualizados cada seis horas.
whats_changedHora de compilación, frescura por fuente, qué fuentes cambiaron o están fallando, y el registro de cambios con fecha. La comprobación cron para cualquier cosa que regenere una configuración a partir de estos datos.

Recursos

Cuatro, cada uno apuntando al archivo del que se calculan las herramientas: agents.json, ua-regex.json, ip-ranges/all.json, status.json. Léelos directamente si prefieres hacer tu propio emparejamiento.

Lo que no hará

No tiene efectos secundarios ni ruta de escritura: no puede editar tu robots.txt, bloquear nada, ni obtener una URL por ti. Una coincidencia de agente de usuario es una afirmación, no una prueba — classify_user_agent lo dice en cada respuesta, y is_verified_crawler_ip es la herramienta que convierte una afirmación en evidencia. Cuando un operador no publica rangos, ninguna herramienta aquí puede verificarlo, y cada una dice en qué caso te encuentras.

Medido, no afirmado: cómo se ven realmente 24 horas de llamantes en estos endpoints — 330 claves de cliente tocaron un endpoint RPC aquí, 214 de ellas nunca enviaron un POST, y 23 demostraron una llamada de herramienta. Una ventana nombrada, cada cifra con su derivación en /data/mcp-endpoint-callers-2026-w36.json.

Medido aquí, no afirmado: Lo que los registros públicos de MCP hacen mal, medido en seis endpoints — 134 claves de cliente en 97 operadores, 8.617 protocolos de enlace, y las cuatro trampas en las que cae un registro publicado: el GET de apertura de flujo que responde 405, los documentos de descubrimiento que los llamantes esperan antes de marcar, dos grafías de la misma URL RFC 9728, y un archivo de propiedad que da 404. Uno de cinco documentos sobre las mismas 24 horas — los otros cuatro se nombran al pie de cada uno — cada uno de ellos también en .md y .json, con las cifras y el SQL bajo el índice de datos junto a ellos.

Cinco servidores más en este host

Trabajos diferentes, sin nombres de herramientas compartidos — ejecuta los seis o solo el que necesites. crawler-log-triage en /mcp/triage toma un registro de acceso completo y devuelve veredictos por línea, los suplantadores, y un robots.txt o conjunto de reglas WAF para exactamente lo que había en él. agent-discovery-doctor en /mcp/doctor invierte la pregunta: ¿cuál de los 22 documentos de descubrimiento que los agentes piden — llms.txt, tarjeta de agente A2A, owners.json, mcp.json — sirve realmente un host, y quién pide cada uno de los que faltan? robots-policy-lint en /mcp/robots lee un robots.txt que pegues e informa de lo que realmente hace, según las reglas RFC 9309. crawler-ip-verifier en /mcp/netcheck es la forma de lote y prefijo de is_verified_crawler_ip: 500 direcciones a la vez, aritmética de solapamiento CIDR, y una lista de permitidos de firewall que puedes pegar. mcp-endpoint-lint en /mcp/lint es el dirigido al propio MCP: dale el endpoint de otro servidor e informa de qué negoció el protocolo de enlace, si cada esquema de herramienta anunciado compila, si los códigos de error son los que exige JSON-RPC, y qué encuentra un cliente antes de marcar — puntuado sobre 100.

Versiones de protocolo 2025-06-18, negociadas por llamada. server/discover responde para clientes en 2026-07-28, initialize para todos los demás. Mismos datos que /data/agents.json y /openapi.json — elige el que hable tu cliente. Listado en el Registro oficial de MCP como dev.workers.pathwren.www/ai-crawler-index.

Mapa del sitio

Copias automáticas de esta página

Este documento es una representación en markdown de https://www.pathwren.workers.dev/mcp.html, generado a partir de los propios bytes de esa página en la misma compilación. La página HTML es canónica.