experiment-analzyer

作者: datadog-labs

分析LLM实验结果。当用户说“分析实验”、“实验分析”、“评估实验”、“检查实验指标”或提供……时使用。

npx skills add https://github.com/datadog-labs/agent-skills --skill experiment-analzyer

来自 datadog-labs 的更多技能

dd-audit
datadog-labs
审计追踪调查——谁更改了什么、密钥泄露、成本激增根本原因、合规证据(SOC 2/PCI)以及AI活动审计。
official
agent-install
datadog-labs
使用Datadog Operator在Kubernetes上安装Datadog Agent——这是在启用Single Step Instrumentation(SSI)之前所必需的,该功能会自动…
official
agent-observability-auto-experiment
datadog-labs
针对真实的Datadog LLM-Obs数据运行迭代式代码改进爬山算法,本地执行,以Claude Code作为代理。建立基线评估,做出一项…
official
agent-observability-eval-bootstrap
datadog-labs
从生产追踪中引导评估器——默认提议在线LLM-judge评估器,并在您确认后,在Datadog中将其创建为已禁用的草稿…
official
agent-observability-eval-pipeline
datadog-labs
End-to-end Agent Observability pipeline for an instrumented ml_app — classify production traces, root-cause failures, bootstrap evaluators, then (optionally)…
official
agent-observability-experiment-analyzer
datadog-labs
分析LLM实验结果。处理单一或对比实验,探索性或问答模式。当用户说“分析实验”、“比较…”时使用。
official
agent-observability-replay-trace
datadog-labs
当开发者想要针对某一条他们不满意输出的Agent Observability / LLM Obs trace进行迭代时使用——重新运行该trace以对比他们的……
official
agent-observability-trace-rca
datadog-labs
生产环境中LLM轨迹的根因分析。诊断LLM应用为何失败——基于评测裁判的判定、运行时错误或结构性……
official