What problem does it solve?
Preference alignment of large language models traditionally requires a reference model (as in DPO), doubling memory costs and complicating training pipelines. SimPO eliminates this requirement while delivering stronger alignment performance, but practitioners struggle with hyperparameter selection, dataset preparation, and loss function tuning.
Core Features & Use Cases
- Reference-Free Training: Optimize models directly on preference pairs without loading a reference model, reducing VRAM requirements by half.
- Hyperparameter Guidance: Select appropriate learning rates, beta values, gamma-beta ratios, and SFT weights for different model sizes and task types.
- Dataset Preparation: Format, filter, and mix preference datasets like UltraFeedback, HelpSteer, and HH-RLHF for SimPO training.
- Use Case: Fine-tune Llama 3 8B Instruct on math reasoning preferences using DeepSpeed ZeRO-3 on a single A100 node, achieving better alignment than DPO with lower memory footprint.
Quick Start
Configure and launch SimPO training for Mistral 7B on UltraFeedback preferences using DeepSpeed ZeRO-3 acceleration.