What problem does it solve?
This Skill removes the manual burden of cleaning large, messy datasets for AI training by automating quality filtering, deduplication, and sensitive-content removal at scale.
Core Features & Use Cases
- Multimodal data curation: Handles text, image, video, and audio pipelines for training-data preparation.
- High-quality filtering: Applies heuristic and classifier-based checks to remove low-value, repetitive, or unsafe content.
- Exact, fuzzy, and semantic deduplication: Eliminates duplicate and near-duplicate records to improve dataset quality and reduce training bias.
- Privacy and safety controls: Redacts PII and detects NSFW content before data is used in model training.
- Use case: Clean a Common Crawl-style web corpus, deduplicate it, redact personal information, and export a curated Parquet dataset ready for LLM training.
Quick Start
Use the nemo-curator skill to load your dataset, apply filtering and deduplication, and save the cleaned output as a curated training corpus.