eval-trace-rca

Analyse des causes profondes sur les traces de production des LLM en utilisant les résultats du juge d'évaluation comme signal. Diagnostique pourquoi l'application de l'utilisateur échoue. Utilisez lorsque l'utilisateur dit "eval…

npx skills add https://github.com/datadog-labs/agent-skills --skill eval-trace-rca

Plus de skills de datadog-labs

dd-audit
datadog-labs
Investigations de piste d'audit - qui a modifié quoi, compromission de clé, cause racine de pic de coût, preuve de conformité (SOC 2/PCI), et audit d'activité IA.
official
agent-install
datadog-labs
Installez l'Agent Datadog sur Kubernetes à l'aide de l'Operator Datadog — requis avant d'activer Single Step Instrumentation (SSI), qui automatiquement…
official
agent-observability-auto-experiment
datadog-labs
Exécute une montée de colline itérative d'amélioration de code sur de vraies données Datadog LLM-Obs, localement, avec Claude Code comme agent. Établit une évaluation de référence, effectue une…
official
agent-observability-eval-bootstrap
datadog-labs
Bootstrap evaluators from production traces — by default propose online LLM-judge evaluators and, after you confirm, create them in Datadog as disabled drafts…
official
agent-observability-eval-pipeline
datadog-labs
End-to-end Agent Observability pipeline for an instrumented ml_app — classify production traces, root-cause failures, bootstrap evaluators, then (optionally)…
official
agent-observability-experiment-analyzer
datadog-labs
Analyser les résultats d'expériences LLM. Gère les expériences uniques ou comparatives, les modes exploratoire ou Q&A. À utiliser lorsque l'utilisateur dit « analyser l'expérience », « comparer…
official
agent-observability-replay-trace
datadog-labs
À utiliser lorsqu'un développeur souhaite itérer sur UNE trace spécifique d'Agent Observability / LLM Obs dont le résultat ne lui a pas plu — en ré-exécutant cette trace contre son…
official
agent-observability-trace-rca
datadog-labs
Analyse des causes racines sur les traces LLM en production. Diagnostique pourquoi une application LLM échoue — fonctionne à partir des verdicts des juges d'évaluation, des erreurs d'exécution ou des éléments structurels…
official