Agent Reliability
Testes, benchmarking e auditoria de agentes de IA autônomos — métodos, estruturas e evidências
Documentação
Agent Reliability — servidor MCP
Testes, benchmarking e auditoria de agentes de IA autônomos — métodos, ambientes de teste, evidências
Um servidor MCP remoto sobre um grafo de conhecimento curado. Cada afirmação que ele retorna está vinculada a uma fonte registrada: as ferramentas devolvem afirmações com suas citações e um valor de confiança, para que um agente possa mostrar seu trabalho em vez de apenas afirmar.
Nada para instalar. É um endpoint hospedado de HTTP transmissível:
https://agentreliability.dev/mcp
Também listado no Smithery.
Adicionar a um cliente
Claude Code
claude mcp add --transport http agent-reliability https://agentreliability.dev/mcp
Claude Desktop / qualquer cliente que leia mcpServers
{
"mcpServers": {
"agent-reliability": {
"type": "streamable-http",
"url": "https://agentreliability.dev/mcp"
}
}
}
Sem chave de API, sem conta, sem autenticação. Somente leitura.
Verifique se ele responde, sem nenhum cliente:
curl -s https://agentreliability.dev/mcp \
-H 'Content-Type: application/json' \
-H 'Accept: application/json, text/event-stream' \
-H 'mcp-protocol-version: 2025-06-18' \
-d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'
Ferramentas
Oito, cada uma com um outputSchema, cada uma retornando structuredContent.
| ferramenta | argumentos | o que faz |
|---|---|---|
get_overview | — | Visão geral do corpus: o que esta instância conhece, contagens por tipo, tags publicadas, atualidade. Comece aqui ao chegar e ainda não souber se este corpus pode responder à sua pergunta. |
search | query, limit? | Busca de texto completo no grafo de conhecimento. Insensível a acentos e apóstrofos, então consulte nas próprias palavras do usuário; cada resultado traz sua pontuação de relevância e os campos em que houve correspondência. |
answer | question | Responda a uma pergunta a partir do corpus. Retorna as afirmações do objeto correspondente com fontes e confiança — nunca uma resposta sem fonte. |
get_entity | id | Busca um objeto de conhecimento por id, com suas afirmações e as fontes que cada afirmação cita. |
get_topic | tag | Lista os objetos de conhecimento que possuem uma tag (tópicos são tags com respaldo de conteúdo). |
get_related | id | Vizinhos no grafo de um objeto: relações de saída e de entrada, cada uma com seu tipo de relação. |
get_sources | object_id? | O registro completo de fontes, ou apenas as fontes citadas por um objeto. Use-o para avaliar o corpus antes de confiar nele. |
get_latest | limit? | Objetos de conhecimento verificados mais recentemente — um sinal de atualidade. |
O caminho pretendido é get_overview → search ou answer → get_entity
→ get_related. get_overview existe porque um agente que acabou de
chegar precisa saber se este corpus pode ajudar antes de gastar uma
chamada adivinhando.
O que há no corpus
| objetos de conhecimento | 38 |
| fontes registradas | 31 |
| tópicos publicados | 93 |
| tipo | objetos |
|---|---|
| entidade | 25 |
| guia | 9 |
| comparação | 2 |
| faq | 1 |
| glossário | 1 |
Assuntos: avaliações e benchmarks (GAIA, AgentBench, Inspect), LLM-como-juiz e seus modos de falha, Goodhart e contaminação de benchmarks, injeção de falhas e testes de caos, portões de aprovação e níveis de autonomia, fundamentação e fidelidade.
Perguntas que ele foi construído para responder
- Como distinguir uma avaliação real de um benchmark que meu agente memorizou?
- O que calibração significa para um juiz LLM, e como ela é medida?
- Quais modos de falha a injeção de falhas realmente captura?
Como é uma resposta de verdade
Uma chamada real ao endpoint ao vivo — answer com
"como distinguir uma avaliação real de contaminação de benchmark" — retorna este structuredContent, reduzido:
{
"answered": true,
"entity": {
"id": "agent-reliability-glossary",
"name": "Agent reliability glossary",
"evidence_tier": "secondary",
"confidence": 0.85,
"last_verified": "2026-08-08",
"canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
},
"claims": [
{
"text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
"sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
}
]
}
Observe o que viaja com a resposta: o nível de evidência, uma confiança, a data em que foi verificada pela última vez e a fonte por trás da afirmação — não como prosa que um agente precisa interpretar, mas como campos sobre os quais ele pode agir. Um agente pode recusar usar uma afirmação fraca, ou citar a fonte primária diretamente.
Quando o corpus não consegue responder, answered é false. Ele não
improvisa, e a falha é registrada para que a lacuna possa ser preenchida.
Superfícies legíveis por máquina
O endpoint MCP é uma de várias. O mesmo corpus é servido como arquivos simples que um agente pode ler diretamente:
| superfície | o que é |
|---|---|
/llms.txt | o índice, como text/plain |
/llms-full.txt | o corpus inteiro em um arquivo |
/ai-index.json | toda superfície que esta instância publica, com seu tipo de conteúdo |
/api/index.json | um documento JSON por objeto de conhecimento |
/api/sources.json | o registro de fontes, completo |
/.well-known/mcp/server.json | o manifesto deste servidor |
Cada objeto de conhecimento tem uma página humana e um gêmeo de máquina no mesmo id, com uma URL canônica que concorda entre todos eles.
Comportamento que vale saber antes de integrar
- Somente
POST. Todos os outros métodos respondem405com um cabeçalhoAllow: POST, OPTIONS. - Limite de taxa: 120 requisições por minuto por cliente, contadas em um
armazenamento compartilhado, publicado em cada resposta como
RateLimit-Limit,RateLimit-RemainingeRateLimit-Reset(todos os três expostos via CORS). Ele falha aberto: se o armazenamento estiver inacessível, a requisição é atendida. - Entrada malformada recebe um erro JSON-RPC correto pela especificação —
-32700para corpos não analisáveis,-32602para uma ferramenta desconhecida — nunca uma página de erro HTML. - Corpos de requisição são limitados e validados antes do transporte.
Privacidade
Sem contas, sem cookies, sem anúncios. O uso é medido de forma agregada com identificadores hash rotativos diários e retenção de 200 dias; IPs brutos nunca são armazenados. Política completa: PRIVACY.md.
Proveniência e licença
O conteúdo de conhecimento é CC-BY-4.0: use-o, cite-o. O registro de fontes é
público justamente para que uma afirmação possa ser verificada em vez de confiada —
get_sources retorna no que qualquer afirmação dada se apoia.
As afirmações carregam um nível de evidência e uma data de last_verified. Onde a
evidência é mais fraca, o objeto diz isso em vez de arredondar para cima.
Como é construído
Compilado e servido por Citarium, um framework de código-fonte disponível para transformar um grafo de conhecimento em um site, uma API, um servidor MCP e arquivos legíveis por agente a partir de uma única fonte, sob avaliação externa.
O código do framework é licenciado sob a Business Source License 1.1 e
seu repositório não é público. O que é público — e o que realmente importa para
confiar em uma resposta — é este servidor, o corpus que ele serve e a fonte registrada
por trás de cada afirmação: get_sources retorna no que qualquer afirmação dada se apoia,
para que possa ser verificada em vez de confiada.
Este repositório é a face pública do servidor: seu manifesto e sua documentação. O corpus em si vive em agentreliability.dev.