Scorable

Agente de evaluaciones de IA

Documentación

Para el índice completo de documentación, consulta llms.txt. Las versiones en Markdown de las páginas de documentación están disponibles añadiendo .md a las URLs de las páginas; esta página está disponible como Markdown.

Servidor MCP

Conecta Claude Code, Codex, Cursor o cualquier cliente MCP al servidor MCP remoto alojado de Scorable y deja que tu agente cree y ejecute evaluaciones directamente.

Scorable ejecuta un servidor MCP remoto alojado en https://api.scorable.ai/mcp. Apunta un cliente MCP hacia él con tu clave API y tu agente obtendrá 14 herramientas para encontrar, ejecutar y crear evaluaciones.

Úsalo cuando quieras que el agente evalúe como parte de su propio bucle de razonamiento: puntúa un borrador antes de mostrarlo al usuario, comprueba un cambio contra una rúbrica o investiga por qué una puntuación ha retrocedido. Para uso con scripts y CI, el CLI suele ser la mejor opción.

Obtén una clave API

Consigue una en app.scorable.ai en API keys, o crea una temporal gratuita desde la terminal:

curl -s -X POST https://api.scorable.ai/create-demo-user/ | jq -r .api_key

Mantenla en una variable de entorno para que nunca termine en un archivo de configuración que puedas llegar a commitear:

export SCORABLE_API_KEY="your-key"

Claude Code

claude mcp add --transport http scorable https://api.scorable.ai/mcp \
  --header "Authorization: Bearer $SCORABLE_API_KEY"

Eso registra el servidor para el proyecto actual. Añade --scope user para que esté disponible en todos los proyectos, o --scope project para escribirlo en .mcp.json y compartirlo con tu equipo mediante control de versiones — en ese caso, referencia la variable en lugar de la clave en sí, para que no se commitee ningún secreto.

Verifica que se conectó:

claude mcp list

Codex

Codex configura servidores remotos en ~/.codex/config.toml — codex mcp add es solo para servidores stdio:

[mcp_servers.scorable]
url = "https://api.scorable.ai/mcp"
bearer_token_env_var = "SCORABLE_API_KEY"

bearer_token_env_var lee la clave de tu entorno al iniciar y la envía como token de portador, por lo que la clave no queda en el archivo.

Cursor, VS Code y otros clientes

Cualquier cosa que hable con MCP HTTP transmisible funciona. La mayoría de los clientes usan esta forma:

{
  "mcpServers": {
    "scorable": {
      "url": "https://api.scorable.ai/mcp",
      "headers": {
        "Authorization": "Bearer ${SCORABLE_API_KEY}"
      }
    }
  }
}

El servidor también acepta el esquema Api-Key usado por el resto de la API de Scorable, por lo que Authorization: Api-Key <key> funciona si se adapta mejor a tu cliente.

Las herramientas

Encontrar lo que existe

HerramientaQué hace
list_judgesJueces disponibles para tu organización, los más nuevos primero
get_judgeUn juez completo, incluyendo cada evaluador que aplica
list_evaluatorsEvaluadores, incluyendo los preajustes que Scorable incluye
get_evaluatorUn evaluador con su rúbrica y entradas requeridas
list_projectsProyectos, para delimitar otras llamadas

Ejecutar evaluaciones

HerramientaQué hace
run_judgePuntúa un par solicitud/respuesta contra un juez, por id o nombre
run_evaluatorPuntúa contra un único evaluador

Creación

HerramientaQué hace
generate_judgeConstruye un juez a partir de una descripción en lenguaje natural de lo que te importa
create_judge / update_judgeCrea o edita un juez a partir de una lista explícita de evaluadores
create_evaluator / update_evaluatorCrea o edita un único evaluador y su rúbrica

Auditoría

HerramientaQué hace
list_execution_logsEjecuciones pasadas, filtrables por juez, proyecto, puntuación, costo, etiquetas y fecha
get_execution_logUna ejecución completa, con puntuaciones por evaluador y justificaciones

Deliberadamente no hay herramientas de borrado. Eliminar un juez o evaluador sigue siendo una acción humana en la interfaz o el CLI.

Pruébalo

Una vez conectado, indicaciones como estas se resuelven en llamadas a herramientas:

What Scorable judges do I have?

Generate a judge that checks our support replies are concise, grounded in the
policy documents, and never promise refunds the policy does not allow.

Run that judge against this reply: "Absolutely, I've processed a full refund!"
given the policy "Refunds within 30 days, unopened items only."

Why did last night's evaluation scores drop? Check the execution logs.

El juez generado en ese tercer ejemplo devuelve una puntuación por evaluador con una justificación escrita, para que el agente pueda actuar sobre por qué algo falló en lugar de solo un número.

Conceptos que vale la pena conocer

Un evaluador puntúa una cualidad de una respuesta — fidelidad al contexto, relevancia, seguridad, tono o una rúbrica personalizada — devolviendo una puntuación entre 0 y 1 con una justificación. Un juez es un conjunto reutilizable y con nombre de evaluadores aplicados juntos, y es la unidad de trabajo habitual.

El servidor le informa de esto a tu agente al conectarse, por lo que generalmente elige la herramienta correcta sin necesidad de indicaciones. Consulta Conceptos para ver el modelo completo.

Solución de problemas

401 Unauthorized — la clave falta, ha expirado o está malformada. Confirma primero que funciona contra la API REST: curl -H "Authorization: Api-Key $SCORABLE_API_KEY" https://api.scorable.ai/v1/judges/?limit=1.

404 Not Found — el endpoint está deshabilitado en esa implementación. Las instalaciones autoalojadas pueden desactivarlo; comprueba que MCP_ENABLED no esté configurado como false.

Una herramienta informa de un campo faltante — algunos evaluadores requieren contexts o expected_output. Llama a get_judge y revisa el requires_contexts y el requires_expected_output de cada evaluador antes de ejecutar.