log-analysis

Diagnoses SLURM training job failures and recommends restart viability per cycle.

320|60|Updated Oct 4, 2024
One-click install
npx skills add https://github.com/NVIDIA/nvidia-resiliency-ext --skill log-analysis-nvidia
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: log-analysis
Source: https://github.com/NVIDIA/nvidia-resiliency-ext/tree/main/src/nvidia_resiliency_ext/skills/nvrx-attr/log-analysis
Command: npx skills add https://github.com/NVIDIA/nvidia-resiliency-ext --skill log-analysis-nvidia

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires logsage, langchain-openai, and includes scripts (resource) components.

What problem does it solve?

Analyze SLURM training job logs to attribute failure root causes and guide restart decisions for resilient AI workloads.

Core Features & Use Cases

  • Per-cycle log analysis and error extraction to map failures to causes.
  • LLM-assisted classification for complex failure reasons and recommended actions.
  • CLI and programmatic API access to integrate with training workflows.

Quick Start

Analyze a SLURM job log to obtain per-cycle failure attributions and restart recommendations.

Frequently Asked Questions about log-analysis

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I analyze SLURM job logs to find the root cause of training failures?

Analyzing SLURM job logs to find failure root causes involves extracting errors from per-cycle training logs and applying pattern matching to map them to specific causes. This process determines restart viability for resilient AI workloads.

What is the best way to determine if a failed SLURM training job is safe to restart?

Determining SLURM job restart viability requires analyzing per-cycle failure attributions to understand the root cause. By extracting errors and applying LLM-assisted classification, you can evaluate whether the underlying issue is safe for a restart.

Can I use an LLM to classify complex failure reasons in SLURM training logs?

Yes, you can use an LLM to classify complex failure reasons in SLURM training logs. LLM-assisted classification evaluates extracted error patterns to provide recommended actions and guide restart decisions for failed training jobs.

Do I need a specific Python environment to run NVRxLogAnalyzer for log analysis?

Yes, running NVRxLogAnalyzer requires a Python environment with necessary dependencies like logsage and langchain-openai installed. You also need access to the SLURM job logs you intend to analyze for failure root causes.

How do I integrate SLURM log analysis into my existing AI training workflows?

You can integrate SLURM log analysis into AI training workflows using CLI or programmatic API access. This allows you to programmatically obtain per-cycle failure attributions and restart recommendations during the training process.