multi-node-slurm

Convert single-node training scripts into multi-node SLURM sbatch jobs.

852|445|Updated May 21, 2025
One-click install
npx skills add https://github.com/NVIDIA-NeMo/Megatron-Bridge --skill multi-node-slurm-nvidia-nemo
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: multi-node-slurm
Source: https://github.com/NVIDIA-NeMo/Megatron-Bridge/tree/main/skills/multi-node-slurm
Command: npx skills add https://github.com/NVIDIA-NeMo/Megatron-Bridge --skill multi-node-slurm-nvidia-nemo

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes scripts (resource) and references (resource) components.

What problem does it solve?

This Skill simplifies the process of converting single-node scripts into efficient multi-node SLURM sbatch jobs with container support, enabling scalable training and debugging.

Core Features & Use Cases

  • Script Conversion: Automates the transformation of single-node training commands into multi-node SLURM jobs with proper environment setup.
  • Failure Debugging: Provides guidelines and best practices for diagnosing multi-node failures, NCCL timeouts, and environment issues.
  • Use Case: Use this skill when scaling training jobs across multiple nodes or troubleshooting distributed training failures in HPC clusters.

Quick Start

Convert your existing single-node training script for multi-node execution using SLURM by integrating the provided script template and following the two-phase srun procedure.

Frequently Asked Questions about multi-node-slurm

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I convert a single-node training script to run on a SLURM cluster?

To convert single-node training scripts for multi-node SLURM execution, automate the transformation into sbatch jobs using a provided script template and a two-phase srun procedure with proper environment variable management.

How do I debug NCCL timeouts in multi-node distributed training?

Debugging NCCL timeouts in multi-node distributed training requires following specific failure diagnosis guidelines and best practices to identify environment issues and standard SLURM configuration mismatches across cluster nodes.

Do I need a containerized environment to run multi-node SLURM jobs?

Yes, a containerized environment is required for optimal operation when setting up and debugging multi-node distributed training jobs on SLURM clusters, alongside proper environment variable management and standard SLURM configurations.

What is the best way to scale training jobs across multiple nodes in an HPC cluster?

The best way to scale training jobs across multiple HPC cluster nodes is streamlining the process with SLURM automation, ensuring scalable efficiency by converting single-node scripts into multi-node sbatch jobs with container support.

Why does my multi-node SLURM distributed training job fail during environment setup?

Multi-node SLURM distributed training jobs fail during environment setup due to improper environment variable management or lack of containerized environments, requiring specific failure diagnosis guidelines to troubleshoot effectively.