eval-trace-rca

Análisis de causa raíz en trazas de LLM en producción utilizando los resultados del juez de evaluación como señal. Diagnostica por qué la aplicación del usuario está fallando. Úsalo cuando el usuario diga "eval…

npx skills add https://github.com/datadog-labs/agent-skills --skill eval-trace-rca

Más skills de datadog-labs

dd-audit
datadog-labs
Investigaciones de pista de auditoría: quién cambió qué, compromiso de claves, causa raíz de picos de costos, evidencia de cumplimiento (SOC 2/PCI) y auditoría de actividad de IA.
official
agent-install
datadog-labs
Instala el Datadog Agent en Kubernetes usando el Datadog Operator, requisito previo para habilitar Single Step Instrumentation (SSI), que automáticamente…
official
agent-observability-auto-experiment
datadog-labs
Ejecuta una escalada iterativa de mejora de código contra datos reales de Datadog LLM-Obs, localmente, con Claude Code como agente. Establece una evaluación de referencia, realiza una…
official
agent-observability-eval-bootstrap
datadog-labs
Inicializa evaluadores a partir de trazas de producción — por defecto propone evaluadores LLM-juez en línea y, tras tu confirmación, los crea en Datadog como borradores deshabilitados…
official
agent-observability-eval-pipeline
datadog-labs
Pipeline de observabilidad de agentes de extremo a extremo para una ml_app instrumentada — clasificar trazas de producción, causa raíz de fallos, inicializar evaluadores y luego (opcionalmente)…
official
agent-observability-experiment-analyzer
datadog-labs
Analiza los resultados de experimentos con LLM. Maneja experimentos individuales o comparativos, en modos exploratorio o de preguntas y respuestas. Úsalo cuando el usuario diga "analizar experimento", "comparar…
official
agent-observability-replay-trace
datadog-labs
Utilizar cuando un desarrollador quiere iterar sobre UNA traza específica de Agent Observability / LLM Obs cuyo resultado no le gustó — re-ejecutando esa traza contra su...
official
agent-observability-trace-rca
datadog-labs
Análisis de causa raíz en trazas de LLM en producción. Diagnostica por qué una aplicación de LLM está fallando — funciona a partir de veredictos de jueces de evaluación, errores de ejecución o estructurales…
official