eval-session-classify

Klassifizieren, ob die Absicht eines Benutzers in einer Datadog-Assistenten-Sitzung erfüllt wurde. Verwenden Sie dies, wenn eine session_id angegeben wird und Sie aufgefordert werden, die Zufriedenheit, Absicht… zu bewerten.

npx skills add https://github.com/datadog-labs/agent-skills --skill eval-session-classify

Mehr Skills von datadog-labs

dd-audit
datadog-labs
Prüfpfad-Untersuchungen – wer was geändert hat, Schlüsselkompromittierung, Ursache von Kostenanstiegen, Compliance-Nachweise (SOC 2/PCI) und Prüfung von KI-Aktivitäten.
official
agent-install
datadog-labs
Installieren Sie den Datadog Agent auf Kubernetes mit dem Datadog Operator – erforderlich, bevor Single Step Instrumentation (SSI) aktiviert werden kann, das automatisch…
official
agent-observability-auto-experiment
datadog-labs
Führe einen iterativen Code-Verbesserungs-Hill-Climb gegen echte Datadog-LLM-Obs-Daten lokal mit Claude Code als Agent durch. Etabliert eine Baseline-Evaluierung, macht eine…
official
agent-observability-eval-bootstrap
datadog-labs
Bootstrappen Sie Evaluatoren aus Produktionstraces — standardmäßig werden Online-LLM-Judge-Evaluatoren vorgeschlagen, und nach Ihrer Bestätigung werden sie in Datadog als deaktivierte Entwürfe erstellt…
official
agent-observability-eval-pipeline
datadog-labs
End-to-End-Agent-Observability-Pipeline für eine instrumentierte ml_app — Produktions-Traces klassifizieren, Fehlerursachen ermitteln, Evaluatoren bootstrapen, dann (optional)…
official
agent-observability-experiment-analyzer
datadog-labs
Analyze LLM experiment results. Handles single or comparative experiments, exploratory or Q&A modes. Use when user says "analyze experiment", "compare…
official
agent-observability-replay-trace
datadog-labs
Verwenden Sie dies, wenn ein Entwickler an EINER bestimmten Agent Observability / LLM Obs-Trace iterieren möchte, deren Ausgabe ihm nicht gefallen hat — indem er diese Trace erneut gegen seine…
official
agent-observability-trace-rca
datadog-labs
Ursachenanalyse bei Produktions-LLM-Traces. Diagnostiziert, warum eine LLM-Anwendung fehlschlägt – arbeitet mit Eval-Judge-Urteilen, Laufzeitfehlern oder strukturellen…
official