eval-session-classify

Clasificar si la intención de un usuario fue satisfecha en una sesión del asistente de Datadog. Usar cuando se proporcione un session_id y se solicite evaluar la satisfacción, la intención…

npx skills add https://github.com/datadog-labs/agent-skills --skill eval-session-classify

Más skills de datadog-labs

dd-audit
datadog-labs
Investigaciones de pista de auditoría: quién cambió qué, compromiso de claves, causa raíz de picos de costos, evidencia de cumplimiento (SOC 2/PCI) y auditoría de actividad de IA.
official
agent-install
datadog-labs
Instala el Datadog Agent en Kubernetes usando el Datadog Operator, requisito previo para habilitar Single Step Instrumentation (SSI), que automáticamente…
official
agent-observability-auto-experiment
datadog-labs
Ejecuta una escalada iterativa de mejora de código contra datos reales de Datadog LLM-Obs, localmente, con Claude Code como agente. Establece una evaluación de referencia, realiza una…
official
agent-observability-eval-bootstrap
datadog-labs
Inicializa evaluadores a partir de trazas de producción — por defecto propone evaluadores LLM-juez en línea y, tras tu confirmación, los crea en Datadog como borradores deshabilitados…
official
agent-observability-eval-pipeline
datadog-labs
Pipeline de observabilidad de agentes de extremo a extremo para una ml_app instrumentada — clasificar trazas de producción, causa raíz de fallos, inicializar evaluadores y luego (opcionalmente)…
official
agent-observability-experiment-analyzer
datadog-labs
Analiza los resultados de experimentos con LLM. Maneja experimentos individuales o comparativos, en modos exploratorio o de preguntas y respuestas. Úsalo cuando el usuario diga "analizar experimento", "comparar…
official
agent-observability-replay-trace
datadog-labs
Utilizar cuando un desarrollador quiere iterar sobre UNA traza específica de Agent Observability / LLM Obs cuyo resultado no le gustó — re-ejecutando esa traza contra su...
official
agent-observability-trace-rca
datadog-labs
Análisis de causa raíz en trazas de LLM en producción. Diagnostica por qué una aplicación de LLM está fallando — funciona a partir de veredictos de jueces de evaluación, errores de ejecución o estructurales…
official