What problem does it solve?
NeMo Curator eliminates the time-consuming work of cleaning, filtering, and deduplicating massive web-scale datasets so your LLM training corpus is higher quality and safer.
Core Features & Use Cases
- GPU-accelerated data curation: Runs high-throughput curation workflows on NVIDIA GPUs using RAPIDS to reduce cost and wall-clock time.
- Quality filtering with heuristics and classifiers: Applies 30+ filtering heuristics and optional quality/NSFW classifiers to remove low-quality content.
- Multi-strategy deduplication: Performs exact, fuzzy (MinHash + LSH), and semantic (embedding-based) deduplication to remove duplicates and near-duplicates.
- PII redaction and multimodal support: Redacts personally identifiable information and supports text and multimodal inputs (image/video/audio).
Quick Start
Use the nemo-curator skill to run a GPU curation pipeline that filters, deduplicates, and redacts a large Parquet corpus into a cleaned output dataset.