What problem does it solve?
NeMo Curator streamlines preparing high-quality training datasets for large language and multimodal models by removing duplicates, filtering low-quality content, redacting PII, and detecting unsafe material at GPU scale.
Core Features & Use Cases
- High-performance deduplication: Exact, fuzzy (MinHash+LSH), and semantic deduplication to remove duplicates from large corpora.
- Quality and safety filtering: 30+ heuristic filters plus classifier-based quality and NSFW filtering to enforce dataset standards.
- Multimodal and scalable: Supports text, image, audio, and video with RAPIDS/Dask multi-GPU scaling and Parquet/JSONL inputs for production pipelines.
- PII redaction and compliance: Built-in PII redactors and options to anonymize or redact sensitive entities.
- Use Case: Clean and deduplicate Common Crawl or web-scraped corpora, then output curated Parquet for LLM training.
Quick Start
Run a GPU-accelerated curation pipeline to deduplicate, quality-filter, and redact PII from a Parquet Common Crawl dataset and write the curated Parquet output.