What problem does it solve?
It solves the complexity of structuring PyTorch training code by showing how to implement LightningModule, LightningDataModule, and Trainer in a way that supports scalable, reproducible ML workflows.
Core Features & Use Cases
- LightningModule patterns: Encapsulates model architecture and training/validation logic with required hooks like training_step, validation_step, and configure_optimizers.
- LightningDataModule for reproducible data: Centralizes prepare_data, setup, and dataloader definitions for consistent loading across distributed runs.
- Trainer orchestration: Demonstrates automatic hardware/distributed configuration (DDP/FSDP/DeepSpeed), callbacks, logging, and mixed-precision settings.
- PyTorch 2.0 optimization: Covers practical torch.compile integration (modes, best practices, and handling graph breaks).
- Production best practices: Emphasizes hyperparameter saving, correct logging via self.log, and guidance for common issues like NaNs, OOM, and slow training.
Quick Start
Use the ml-lightning-basics skill to design your model as a LightningModule and your data as a LightningDataModule, then train it with Trainer using the configuration patterns shown in the skill.