Agent Reliability

Pruebas, evaluación comparativa y auditoría de agentes de IA autónomos: métodos, entornos de prueba y evidencia.

Documentación

Agent Reliability — Servidor MCP

Pruebas, evaluación comparativa y auditoría de agentes de IA autónomos: métodos, entornos de prueba, evidencia

Un servidor MCP remoto sobre un grafo de conocimiento curado. Cada afirmación que devuelve está vinculada a una fuente registrada: las herramientas entregan afirmaciones con sus citas y un valor de confianza, para que un agente pueda mostrar su trabajo en lugar de simplemente afirmar.

No hay nada que instalar. Es un endpoint alojado de HTTP transmisible:

https://agentreliability.dev/mcp

También está listado en Smithery.

Añadirlo a un cliente

Claude Code

claude mcp add --transport http agent-reliability https://agentreliability.dev/mcp

Claude Desktop / cualquier cliente que lea mcpServers

{
  "mcpServers": {
    "agent-reliability": {
      "type": "streamable-http",
      "url": "https://agentreliability.dev/mcp"
    }
  }
}

Sin clave API, sin cuenta, sin autenticación. Solo lectura.

Comprueba que responde, sin ningún cliente:

curl -s https://agentreliability.dev/mcp \
  -H 'Content-Type: application/json' \
  -H 'Accept: application/json, text/event-stream' \
  -H 'mcp-protocol-version: 2025-06-18' \
  -d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'

Herramientas

Ocho, cada una con un outputSchema, y cada una devuelve structuredContent.

herramientaargumentosqué hace
get_overviewResumen del corpus: qué sabe esta instancia, recuentos por tipo, etiquetas publicadas, frescura. Empieza aquí cuando llegues y aún no sepas si este corpus puede responder tu pregunta.
searchquery, limit?Búsqueda de texto completo sobre el grafo de conocimiento. Insensible a acentos y apóstrofos, así que consulta con las propias palabras del usuario; cada resultado lleva su puntuación de relevancia y los campos que coincidieron.
answerquestionResponde una pregunta a partir del corpus. Devuelve las afirmaciones del objeto coincidente con fuentes y confianza — nunca una respuesta sin fuente.
get_entityidObtiene un objeto de conocimiento por id, con sus afirmaciones y las fuentes que cita cada afirmación.
get_topictagLista los objetos de conocimiento que llevan una etiqueta (los temas son etiquetas respaldadas por contenido).
get_relatedidVecinos en el grafo de un objeto: relaciones salientes y entrantes, cada una con su tipo de relación.
get_sourcesobject_id?El registro completo de fuentes, o solo las fuentes citadas por un objeto. Úsalo para juzgar el corpus antes de confiar en él.
get_latestlimit?Objetos de conocimiento verificados más recientemente — una señal de frescura.

La ruta prevista es get_overviewsearch o answerget_entityget_related. get_overview existe porque un agente que acaba de llegar necesita saber si este corpus puede ayudar antes de gastar una llamada adivinando.

Qué hay en el corpus

objetos de conocimiento38
fuentes registradas31
temas publicados93
tipoobjetos
entidad25
guía9
comparación2
faq1
glosario1

Materia: evaluaciones y puntos de referencia (GAIA, AgentBench, Inspect), LLM-como-juez y sus modos de fallo, Goodhart y contaminación de puntos de referencia, inyección de fallos y pruebas de caos, compuertas de aprobación y niveles de autonomía, fundamentación y fidelidad.

Preguntas que está diseñado para responder

  • ¿Cómo distingo una evaluación real de un punto de referencia que mi agente ha memorizado?
  • ¿Qué significa calibración para un juez LLM, y cómo se mide?
  • ¿Qué modos de fallo detecta realmente la inyección de fallos?

Cómo se ve una respuesta real

Una llamada real al endpoint en vivo — answer con "cómo distingo una evaluación real de la contaminación de puntos de referencia" — devuelve este structuredContent, recortado:

{
  "answered": true,
  "entity": {
    "id": "agent-reliability-glossary",
    "name": "Agent reliability glossary",
    "evidence_tier": "secondary",
    "confidence": 0.85,
    "last_verified": "2026-08-08",
    "canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
  },
  "claims": [
    {
      "text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
      "sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
    }
  ]
}

Observa lo que viaja con la respuesta: el nivel de evidencia, una confianza, la fecha en que fue verificada por última vez, y la fuente detrás de la afirmación — no como prosa que un agente tenga que parsear, sino como campos sobre los que puede actuar. Un agente puede negarse a usar una afirmación débil, o citar la fuente primaria directamente.

Cuando el corpus no puede responder, answered es false. No improvisa, y el fallo se registra para que la brecha pueda llenarse.

Superficies legibles por máquina

El endpoint MCP es una de varias. El mismo corpus se sirve como archivos planos que un agente puede leer directamente:

superficiequé es
/llms.txtel índice, como text/plain
/llms-full.txttodo el corpus en un solo archivo
/ai-index.jsoncada superficie que publica esta instancia, con su tipo de contenido
/api/index.jsonun documento JSON por objeto de conocimiento
/api/sources.jsonel registro de fuentes, completo
/.well-known/mcp/server.jsonel manifiesto de este servidor

Cada objeto de conocimiento tiene una página humana y un gemelo de máquina con el mismo id, con una URL canónica que coincide en todos ellos.

Comportamiento que conviene saber antes de integrar

  • Solo POST. Cada otro método responde 405 con una cabecera Allow: POST, OPTIONS.
  • Límite de tasa: 120 solicitudes por minuto por cliente, contadas en un almacén compartido, publicado en cada respuesta como RateLimit-Limit, RateLimit-Remaining y RateLimit-Reset (los tres expuestos vía CORS). Falla abierto: si el almacén no es accesible, la solicitud se sirve.
  • Entrada malformada recibe un error JSON-RPC correcto según la especificación — -32700 para cuerpos no parseables, -32602 para una herramienta desconocida — nunca una página de error HTML.
  • Los cuerpos de solicitud están limitados y validados antes del transporte.

Privacidad

Sin cuentas, sin cookies, sin anuncios. El uso se mide de forma agregada con identificadores hash rotados diariamente y una retención de 200 días; las IPs crudas nunca se almacenan. Política completa: PRIVACY.md.

Procedencia y licencia

El contenido de conocimiento es CC-BY-4.0: úsalo, cítalo. El registro de fuentes es público precisamente para que una afirmación pueda verificarse en lugar de confiarse — get_sources devuelve en qué se basa cualquier afirmación dada.

Las afirmaciones llevan un nivel de evidencia y una fecha de last_verified. Cuando la evidencia es más débil, el objeto lo dice en lugar de redondear hacia arriba.

Cómo está construido

Compilado y servido por Citarium, un framework de código fuente disponible para convertir un grafo de conocimiento en un sitio web, una API, un servidor MCP y archivos legibles por agentes desde una sola fuente, bajo evaluación externa.

El código del framework está licenciado bajo la Business Source License 1.1 y su repositorio no es público. Lo que es público — y lo que realmente importa para confiar en una respuesta — es este servidor, el corpus que sirve, y la fuente registrada detrás de cada afirmación: get_sources devuelve en qué se basa cualquier afirmación dada, para que pueda verificarse en lugar de confiarse.

Este repositorio es la cara pública del servidor: su manifiesto y su documentación. El corpus en sí vive en agentreliability.dev.