nemo-curator

Curate multimodal LLM training data with GPU-accelerated filtering and deduplication.

52|6|Updated Nov 24, 2025
One-click install
npx skills add https://github.com/ovachiever/droid-tings --skill nemo-curator
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/ovachiever/droid-tings/tree/main/skills/nemo-curator
Command: npx skills add https://github.com/ovachiever/droid-tings --skill nemo-curator

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes scripts (resource) and references (resource) and assets (resource) components.

What problem does it solve?

NeMo Curator provides GPU-accelerated data curation for large multimodal datasets used in LLM training, enabling fast deduplication, high-quality filtering, PII redaction, and NSFW detection across text, image, video, and audio data.

Core Features & Use Cases

  • 16× faster fuzzy deduplication on large datasets (e.g., 8TB RedPajama v2)
  • 30+ quality filters and heuristics for data quality
  • Semantic, exact, and semantic deduplication options
  • PII redaction and NSFW detection to safeguard privacy and safety
  • Scales across GPU clusters for web data curation and large corpora

Quick Start

Install Nemo Curator, load 600+ tools, and run a simple corpus curation pipeline that filters low-quality documents, deduplicates, redacts PII, and saves to Parquet.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large datasets for LLM training on GPUs?

GPU-accelerated deduplication identifies and removes duplicate records across massive datasets 16× faster than CPU methods. Nemo Curator supports exact, fuzzy, and semantic deduplication, scaling across GPU clusters to handle multi-terabyte corpora like RedPajama v2 efficiently.

Can I filter and clean multimodal data across text, image, video, and audio?

Multimodal data curation applies 30+ quality heuristics across all four formats simultaneously. Nemo Curator processes text, image, video, and audio through unified filtering pipelines, enabling consistent quality standards across heterogeneous training datasets.

What's the fastest way to redact PII and detect NSFW content in web-scraped data?

PII redaction and NSFW detection run as GPU-accelerated pipeline stages before training data export. Nemo Curator redacts sensitive information and filters unsafe content at scale, protecting privacy and safety compliance without manual review.

How do I scale data curation across multiple GPUs and clusters?

RAPIDS and Dask enable distributed processing across GPU clusters for stage-based pipelines. Nemo Curator leverages multi-GPU scaling to parallelize filtering, deduplication, and redaction across nodes, reducing curation time for massive corpora.

Do I need semantic deduplication or is exact matching sufficient?

Semantic deduplication finds duplicate meaning beyond exact text matches, catching near-duplicates exact matching misses. Choose semantic deduplication for web-scraped or noisy corpora; exact matching suffices for clean, deduplicated sources already prepared.

What format should my input data be in for this curation pipeline?

Input data integrates from web scrapes and large text corpora, typically as raw documents or structured formats. Nemo Curator outputs curated datasets to Parquet, enabling direct ingestion into LLM training frameworks after all filtering and deduplication stages.