What problem does it solve?
NeMo Curator removes low-quality, duplicated, and unsafe content from large web-scale datasets so you can train LLMs on cleaner material.
Core Features & Use Cases
- GPU-accelerated quality filtering: Applies 30+ heuristic filters to drop short, repetitive, noisy, or suspicious text.
- Exact, fuzzy, and semantic deduplication: Removes identical, near-duplicate, and paraphrase-like repeats using MinHash/LSH and embedding similarity.
- PII and safety handling: Redacts personally identifiable information and supports NSFW classification for safer training corpora.
- Multimodal support: Works across text, images, video, and audio curation pipelines for multimodal model training.
Use it to clean Common Crawl-derived datasets, curate high-quality training sets for production runs, or deduplicate massive corpora before fine-tuning.
Quick Start
Run NeMo Curator to curate a dataset by installing nemo-curator with the appropriate CUDA or CPU extras and then applying quality filters, deduplication, and PII/NSFW stages in a single pipeline.