Scorable
Agente de evaluaciones de IA
Documentación
Para el índice completo de documentación, consulta llms.txt. Las versiones en Markdown de las páginas de documentación están disponibles añadiendo
.mda las URLs de las páginas; esta página está disponible como Markdown.
Servidor MCP
Conecta Claude Code, Codex, Cursor o cualquier cliente MCP al servidor MCP remoto alojado de Scorable y deja que tu agente cree y ejecute evaluaciones directamente.
Scorable ejecuta un servidor MCP remoto alojado en https://api.scorable.ai/mcp. Apunta un cliente MCP hacia él con tu clave API y tu agente obtendrá 14 herramientas para encontrar, ejecutar y crear evaluaciones.
Úsalo cuando quieras que el agente evalúe como parte de su propio bucle de razonamiento: puntúa un borrador antes de mostrarlo al usuario, comprueba un cambio contra una rúbrica o investiga por qué una puntuación ha retrocedido. Para uso con scripts y CI, el CLI suele ser la mejor opción.
Obtén una clave API
Consigue una en app.scorable.ai en API keys, o crea una temporal gratuita desde la terminal:
curl -s -X POST https://api.scorable.ai/create-demo-user/ | jq -r .api_key
Mantenla en una variable de entorno para que nunca termine en un archivo de configuración que puedas llegar a commitear:
export SCORABLE_API_KEY="your-key"
Claude Code
claude mcp add --transport http scorable https://api.scorable.ai/mcp \
--header "Authorization: Bearer $SCORABLE_API_KEY"
Eso registra el servidor para el proyecto actual. Añade --scope user para que esté disponible en todos los proyectos, o --scope project para escribirlo en .mcp.json y compartirlo con tu equipo mediante control de versiones — en ese caso, referencia la variable en lugar de la clave en sí, para que no se commitee ningún secreto.
Verifica que se conectó:
claude mcp list
Codex
Codex configura servidores remotos en ~/.codex/config.toml — codex mcp add es solo para servidores stdio:
[mcp_servers.scorable]
url = "https://api.scorable.ai/mcp"
bearer_token_env_var = "SCORABLE_API_KEY"
bearer_token_env_var lee la clave de tu entorno al iniciar y la envía como token de portador, por lo que la clave no queda en el archivo.
Cursor, VS Code y otros clientes
Cualquier cosa que hable con MCP HTTP transmisible funciona. La mayoría de los clientes usan esta forma:
{
"mcpServers": {
"scorable": {
"url": "https://api.scorable.ai/mcp",
"headers": {
"Authorization": "Bearer ${SCORABLE_API_KEY}"
}
}
}
}
El servidor también acepta el esquema Api-Key usado por el resto de la API de Scorable, por lo que Authorization: Api-Key <key> funciona si se adapta mejor a tu cliente.
Las herramientas
Encontrar lo que existe
| Herramienta | Qué hace |
|---|---|
list_judges | Jueces disponibles para tu organización, los más nuevos primero |
get_judge | Un juez completo, incluyendo cada evaluador que aplica |
list_evaluators | Evaluadores, incluyendo los preajustes que Scorable incluye |
get_evaluator | Un evaluador con su rúbrica y entradas requeridas |
list_projects | Proyectos, para delimitar otras llamadas |
Ejecutar evaluaciones
| Herramienta | Qué hace |
|---|---|
run_judge | Puntúa un par solicitud/respuesta contra un juez, por id o nombre |
run_evaluator | Puntúa contra un único evaluador |
Creación
| Herramienta | Qué hace |
|---|---|
generate_judge | Construye un juez a partir de una descripción en lenguaje natural de lo que te importa |
create_judge / update_judge | Crea o edita un juez a partir de una lista explícita de evaluadores |
create_evaluator / update_evaluator | Crea o edita un único evaluador y su rúbrica |
Auditoría
| Herramienta | Qué hace |
|---|---|
list_execution_logs | Ejecuciones pasadas, filtrables por juez, proyecto, puntuación, costo, etiquetas y fecha |
get_execution_log | Una ejecución completa, con puntuaciones por evaluador y justificaciones |
Deliberadamente no hay herramientas de borrado. Eliminar un juez o evaluador sigue siendo una acción humana en la interfaz o el CLI.
Pruébalo
Una vez conectado, indicaciones como estas se resuelven en llamadas a herramientas:
What Scorable judges do I have?
Generate a judge that checks our support replies are concise, grounded in the
policy documents, and never promise refunds the policy does not allow.
Run that judge against this reply: "Absolutely, I've processed a full refund!"
given the policy "Refunds within 30 days, unopened items only."
Why did last night's evaluation scores drop? Check the execution logs.
El juez generado en ese tercer ejemplo devuelve una puntuación por evaluador con una justificación escrita, para que el agente pueda actuar sobre por qué algo falló en lugar de solo un número.
Conceptos que vale la pena conocer
Un evaluador puntúa una cualidad de una respuesta — fidelidad al contexto, relevancia, seguridad, tono o una rúbrica personalizada — devolviendo una puntuación entre 0 y 1 con una justificación. Un juez es un conjunto reutilizable y con nombre de evaluadores aplicados juntos, y es la unidad de trabajo habitual.
El servidor le informa de esto a tu agente al conectarse, por lo que generalmente elige la herramienta correcta sin necesidad de indicaciones. Consulta Conceptos para ver el modelo completo.
Solución de problemas
401 Unauthorized — la clave falta, ha expirado o está malformada. Confirma primero que funciona contra la API REST: curl -H "Authorization: Api-Key $SCORABLE_API_KEY" https://api.scorable.ai/v1/judges/?limit=1.
404 Not Found — el endpoint está deshabilitado en esa implementación. Las instalaciones autoalojadas pueden desactivarlo; comprueba que MCP_ENABLED no esté configurado como false.
Una herramienta informa de un campo faltante — algunos evaluadores requieren contexts o expected_output. Llama a get_judge y revisa el requires_contexts y el requires_expected_output de cada evaluador antes de ejecutar.