What problem does it solve?
Cleans, filters, and deduplicates massive web-scraped and multimodal corpora to produce high-quality training datasets for LLMs and other ML models, addressing scale, noise, PII leakage, and redundant content that degrade model performance.
Core Features & Use Cases
- High-throughput deduplication: Exact, fuzzy (MinHash+LSH), and semantic deduplication accelerated on GPUs to remove identical and near-duplicate content at multi-terabyte scale.
- Quality filtering and classifiers: 30+ heuristic filters plus GPU classifiers for quality, language, and NSFW detection to remove low-value or harmful data.
- Multimodal support and PII redaction: Handles text, images, video, and audio with PII anonymization and modality-specific filters and embedders.
- Distributed GPU scaling: Integrates with RAPIDS and Dask for near-linear scaling across GPU clusters for production-grade pipelines.
- Use case: Curate Common Crawl or web-scraped datasets to produce a cleaned, deduplicated Parquet corpus ready for LLM training.
Quick Start
Run a NeMo Curator pipeline on your GPU cluster to quality-filter, redact PII, and deduplicate a Common Crawl Parquet dataset.