mcore-run-on-slurm

Orchestrate distributed Megatron-LM training on SLURM clusters with sbatch skeletons.

Updated Apr 16, 2026
One-click install
npx skills add https://github.com/sayalinvidia/sayali-skills-test --skill mcore-run-on-slurm
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: mcore-run-on-slurm
Source: https://github.com/sayalinvidia/sayali-skills-test/tree/main/skills/mcore-run-on-slurm
Command: npx skills add https://github.com/sayalinvidia/sayali-skills-test --skill mcore-run-on-slurm

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Launch and manage distributed Megatron-LM training on SLURM clusters, providing a repeatable pattern that reduces setup time and configuration errors.

Core Features & Use Cases

  • Reusable sbatch skeleton for multi-node GPU training with Megatron-LM.
  • Environment and launcher guidance for torch.distributed.run, including MASTER_ADDR/MASTER_PORT and WORLD_SIZE calculations.
  • CUDA_DEVICE_MAX_CONNECTIONS recommendations across hardware generations and parallelism modes.
  • Container deployment considerations and monitoring guidance.
  • Use Case: Validate a new SLURM cluster by quickly spinning up a Megatron-LM job to test scaling and fault diagnosis.

Quick Start

Create and submit a SLURM sbatch script using the provided skeleton to start a multi-node Megatron-LM training job.

Frequently Asked Questions about mcore-run-on-slurm

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I launch multi-node Megatron-LM training on a SLURM cluster?

You can launch multi-node Megatron-LM training on a SLURM cluster by creating and submitting an sbatch script built from a reusable skeleton that configures torch.distributed.run across allocated GPUs.

How do I configure MASTER_ADDR and WORLD_SIZE for distributed training in SLURM?

Configuring MASTER_ADDR, MASTER_PORT, and WORLD_SIZE for SLURM distributed training involves calculating these values dynamically from SLURM environment variables to establish the torch.distributed.run rendezvous endpoints.

What should CUDA_DEVICE_MAX_CONNECTIONS be set to for Megatron-LM?

CUDA_DEVICE_MAX_CONNECTIONS settings for Megatron-LM depend on your specific hardware generation and parallelism modes, requiring tailored recommendations to optimize multi-node GPU communication throughput.

Does this SLURM sbatch skeleton support container deployment and monitoring for GPU jobs?

Yes, the SLURM sbatch skeleton supports container integration and provides monitoring guidance to track distributed GPU training jobs, alongside per-rank failure diagnosis workflows for troubleshooting.

Why use a reusable sbatch skeleton for Megatron-LM instead of a custom SLURM script?

Using a reusable sbatch skeleton for Megatron-LM provides a repeatable pattern that reduces setup time and configuration errors when orchestrating multi-node GPU training on SLURM clusters.

Can I validate a new SLURM cluster by running a Megatron-LM job?

Yes, you can validate a new SLURM cluster by quickly spinning up a Megatron-LM job to test scaling, verify environment setup, and perform fault diagnosis across multi-node GPU hardware.