nvrx-attr

por nvidia

Capa de orquestación sobre los módulos de atribución de nvidia_resiliency_ext. Proporciona análisis de logs, análisis de FR y retroalimentación de inyección de fallos orientada a Megatron-LM…

npx skills add https://github.com/nvidia/nvidia-resiliency-ext --skill nvrx-attr

Attribution Skills

High-level orchestration layer over the nvidia_resiliency_ext.attribution modules. Each subdirectory is a self-contained skill with its own SKILL.md and helper scripts.

Skills

DirectoryPurposeEntry point
log-analysis/Analyze SLURM job logs for failure root-cause and restart decisionsNVRxLogAnalyzer (nvrx_logsage.py)
fr-analysis/Analyze NCCL flight-recorder dumps for collective-hang root-causeCollectiveAnalyzer (fr_attribution.py)
fault-injection-loop/Run a batched SLURM fault-injection feedback loop and score attribution accuracyprepare_node_alloc.sh / watch_and_analyze.sh

How skills relate to the library

src/nvidia_resiliency_ext/
├── attribution/
│   ├── log_analyzer/nvrx_logsage.py      ← log-analysis implementation
│   ├── trace_analyzer/fr_attribution.py  ← fr-analysis implementation
│   ├── analyzer/engine.py                ← combined orchestration entry point
│   └── combined_log_fr/                  ← optional log + FR fusion
└── skills/
    └── nvrx-attr/                        ← this skill bundle
        ├── log-analysis/
        ├── fr-analysis/
        └── fault-injection-loop/

The Analyzer (analyzer/engine.py) is the recommended entry point when you need request coalescing, result caching, or the combined LOG_AND_TRACE pipeline. Use the individual skills when you want to run one analysis type directly without the full coalescing stack.

Common prerequisites

  • LLM_API_KEY environment variable, LLM_API_KEY_FILE, or ~/.llm_api_key
  • Package installed: pip install 'nvidia-resiliency-ext[attribution]' or pip install -e '.[attribution]' from repo root
  • The fault-injection loop has only been validated with Megatron-LM training scripts

Fault-Loop Local Setup

Before using fault-injection-loop/, create the local config file from the tracked template and fill in your site-specific values:

cp scripts/user.env.example scripts/user.env

The feedback-loop scripts require src/nvidia_resiliency_ext/skills/nvrx-attr/scripts/user.env to exist at runtime. Keep user.env local and untracked.

Más skills de nvidia

compileiq-debug
nvidia
Úsalo cuando algo esté mal: Search() se cuelga, todas las evaluaciones devuelven INVALID_SCORE, las puntuaciones no mejoran, cada configuración devuelve el mismo número, errores de ptxas…
create-github-pr
nvidia
Crear solicitudes de extracción de GitHub usando la CLI gh. Usar cuando el usuario quiera crear un nuevo PR, enviar código para revisión o abrir una solicitud de extracción. Palabras clave de activación -…
nemoclaw-maintainer-cross-issue-sweep
nvidia
Escanea otros issues abiertos para encontrar aquellos que un PR dado también podría corregir o romper accidentalmente. Genera oportunidades de corrección adyacente y riesgos de contradicción con archivo:línea…
fhir-basics
nvidia
Enseña a los agentes cómo funcionan las APIs de FHIR R4, qué recursos están disponibles, cómo consultarlos con parámetros de búsqueda y cómo analizar correctamente todos los formatos de respuesta…
compileiq-validate-result
nvidia
Usar DESPUÉS de que una Búsqueda haya finalizado y ANTES de reclamar cualquier aceleración o enviar un ACF. Carga el CSV de dump_results, extrae los mejores K candidatos (de un solo objetivo)…
changelog-audit
nvidia
Auditar el CHANGELOG.md de Warp antes de un lanzamiento: recuperar entradas perdidas, ordenar por impacto en el usuario, refinar el lenguaje de las entradas, ajustar saltos de línea y (en modo rama de lanzamiento) incrementar comparación…
maintain-dynamic-plugins
nvidia
Mantener los cargadores de plugins dinámicos de NeMo Relay, manifiestos, SDKs nativos de Rust, protocolo de trabajador gRPC, SDK de trabajador Python, documentación, pruebas y cobertura del flujo de trabajo de lanzamiento
dgx-diagnose
nvidia
Diagnostica problemas comunes de la DGX Station GB300: fallos de CUDA, direccionamiento incorrecto de GPU, errores de contenedores vLLM/SGLang, problemas de estado MIG, errores de NVLink/Fabric Manager,…