What problem does it solve?
Data scientists and MLOps teams spend countless hours preparing training data for LLMs. Nemo Curator automates end-to-end data curation, combining fast deduplication, quality filtering, PII redaction, and multi-modal processing on GPU.
Core Features & Use Cases
- Multi-modal deduplication: exact, fuzzy, and semantic deduplication across text, image, video, and audio data.
- 30+ quality filters: aggressive cleaning to improve dataset quality and reduce toxicity and noise.
- PII redaction & NSFW detection: protects sensitive information and content integrity at scale.
- Large-scale GPU acceleration: scales across RAPIDS and CUDA-enabled clusters for massive datasets.
- Use cases: prepare web-scraped corpora, curate product/data catalogs, or clean proprietary datasets for model training.
Quick Start
Install Nemo Curator and run a quick sample on a small dataset to see automatic deduplication and quality filtering in action.