What problem does it solve?
Curating noisy, duplicate, and unsafe web-scale data into high-quality multimodal training datasets is slow and error-prone, which can degrade LLM performance.
Core Features & Use Cases
- GPU-Accelerated Multimodal Curation: Clean and filter text plus images, video, and audio using NVIDIA/NeMo Curator-style pipelines.
- Fuzzy & Semantic Deduplication: Remove exact, near-duplicate, and semantically similar samples using GPU-accelerated approaches (fuzzy MinHash/LSH and embedding-based methods).
- Safety and Quality Controls: Apply PII redaction and NSFW detection alongside 30+ heuristic quality filters to reduce harmful or identifying content.
- Use Case: Clean and deduplicate a Common Crawl-derived dataset before fine-tuning or pretraining, producing a curated Parquet/JSONL corpus ready for training.
Quick Start
Use nemo-curator to curate your input Parquet/JSONL dataset by running quality filtering, deduplicating, and then exporting the cleaned corpus to Parquet for LLM training.