What problem does it solve?
Preparing high-quality, deduplicated, and safe training datasets for LLMs from noisy large-scale sources is slow and error-prone, especially when the corpus is multimodal and needs privacy protection.
Core Features & Use Cases
- GPU-accelerated curation for large text/image/video/audio datasets using NVIDIA tooling and distributed GPU execution.
- Fuzzy, exact, and semantic deduplication to remove duplicates and near-duplicates (including embedding-based similarity removal).
- Quality filtering, PII redaction, and NSFW detection to improve dataset trustworthiness before model training.
- Use case: Curate Common Crawl-derived datasets into a cleaner multimodal corpus by filtering low-quality samples, deduplicating aggressively, redacting sensitive data, and dropping unsafe content.
Quick Start
Use the nemo-curator skill to deduplicate and filter your raw dataset with GPU acceleration, including PII redaction and NSFW removal, then save the curated output to Parquet.