experiment-analzyer-comparative

Analysieren Sie zwei LLMO-Experimente vergleichend. Verwenden Sie, wenn der Benutzer sagt: „zwei Experimente analysieren“, „vergleichende Experimentanalyse“, „Experimente bewerten“…

npx skills add https://github.com/datadog-labs/agent-skills --skill experiment-analzyer-comparative

Mehr Skills von datadog-labs

dd-audit
datadog-labs
Prüfpfad-Untersuchungen – wer was geändert hat, Schlüsselkompromittierung, Ursache von Kostenanstiegen, Compliance-Nachweise (SOC 2/PCI) und Prüfung von KI-Aktivitäten.
official
agent-install
datadog-labs
Installieren Sie den Datadog Agent auf Kubernetes mit dem Datadog Operator – erforderlich, bevor Single Step Instrumentation (SSI) aktiviert werden kann, das automatisch…
official
agent-observability-auto-experiment
datadog-labs
Run an iterative code-improvement hill-climb against real Datadog LLM-Obs data, locally, with Claude Code as the agent. Establishes a baseline eval, makes one…
official
agent-observability-eval-bootstrap
datadog-labs
Bootstrappen Sie Evaluatoren aus Produktionstraces — standardmäßig werden Online-LLM-Judge-Evaluatoren vorgeschlagen, und nach Ihrer Bestätigung werden sie in Datadog als deaktivierte Entwürfe erstellt…
official
agent-observability-eval-pipeline
datadog-labs
End-to-End-Agent-Observability-Pipeline für eine instrumentierte ml_app — Produktions-Traces klassifizieren, Fehlerursachen ermitteln, Evaluatoren bootstrapen, dann (optional)…
official
agent-observability-experiment-analyzer
datadog-labs
Analyze LLM experiment results. Handles single or comparative experiments, exploratory or Q&A modes. Use when user says "analyze experiment", "compare…
official
agent-observability-replay-trace
datadog-labs
Use when a developer wants to iterate on ONE specific Agent Observability / LLM Obs trace whose output they didn't like — re-running that trace against their…
official
agent-observability-trace-rca
datadog-labs
Ursachenanalyse bei Produktions-LLM-Traces. Diagnostiziert, warum eine LLM-Anwendung fehlschlägt – arbeitet mit Eval-Judge-Urteilen, Laufzeitfehlern oder strukturellen…
official