What problem does it solve?
GPU-accelerated data curation for LLM training. Supports text/image/video/audio. Features fuzzy deduplication (16× faster), quality filtering (30+ heuristics), semantic deduplication, PII redaction, NSFW detection. Scales across GPUs with RAPIDS. Use for preparing high-quality training datasets, cleaning web data, or deduplicating large corpora.
Core Features & Use Cases
- GPU-accelerated deduplication (exact, fuzzy, semantic) for large-scale datasets
- multimodal quality filtering (text, image, video, audio) with 30+ heuristics
- PII redaction and NSFW detection to sanitize data
- scalable pipelines across GPU clusters using RAPIDS, Dask, and Nemo
- Use case: curate RedPajama-like training data from web scrapes for safe model fine-tuning
Quick Start
Run the Nemo Curator pipeline on your dataset to produce a cleaned, de-duplicated, and redacted version ready for model fine-tuning.