nemo-curator

GPU-accelerates multimodal dataset curation with quality filtering and deduplication.

Updated Apr 3, 2026
One-click install
npx skills add https://github.com/handsomelong922/my-codex-skills --skill nemo-curator-handsomelong922
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/handsomelong922/my-codex-skills/tree/main/skills/nemo-curator
Command: npx skills add https://github.com/handsomelong922/my-codex-skills --skill nemo-curator-handsomelong922

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes scripts (resource) and references (resource) components.

What problem does it solve?

NeMo Curator addresses the challenge of assembling clean, deduplicated, and policy-compliant training data from large, multimodal sources, reducing manual curation time and data quality risk.

Core Features & Use Cases

  • GPU-accelerated data curation for large-scale multimodal datasets (text, image, video, audio).
  • 30+ quality filters and multiple deduplication modes (exact, fuzzy, semantic) for high-quality corpora.
  • PII redaction and NSFW detection to protect privacy and safety across training data.
  • Scales across GPUs and clusters with RAPIDS to accelerate end-to-end pipelines.

Quick Start

Install Nemo Curator and run a simple pipeline to begin curating your multimodal dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large multimodal datasets for LLM training?

You can deduplicate large multimodal datasets using exact, fuzzy, and semantic deduplication modes. GPU-accelerated processing scales across clusters to efficiently clean text, image, video, and audio corpora for high-quality training.

What's the best way to redact PII and detect NSFW content in training data?

The best way to redact PII and detect NSFW content is through modular data curation pipelines. Automated PII redaction and NSFW detection modules process large corpora to ensure privacy and safety compliance across multimodal training data.

Does GPU-acceleration support data curation across multiple clusters?

Yes, GPU-acceleration supports data curation across multiple clusters using RAPIDS. This scales end-to-end pipelines across GPUs to accelerate quality filtering, deduplication, and classification for large-scale multimodal datasets.

Can I apply quality filtering to text, image, video, and audio workflows simultaneously?

Yes, you can apply quality filtering to text, image, video, and audio workflows simultaneously. The modular pipeline design includes 30+ quality filters to process multimodal training data and extract high-quality corpora.

When do I need semantic deduplication instead of exact deduplication for training data?

You need semantic deduplication when identifying contextually similar data points rather than exact matches. It complements exact and fuzzy deduplication modes to remove deeper redundancies across large-scale multimodal training corpora.

Why does assembling clean training data require multiple curation steps?

Assembling clean training data requires multiple curation steps because raw multimodal sources contain duplicates, low-quality content, PII, and NSFW material. Modular pipelines applying quality filtering, deduplication, and redaction reduce manual curation time and data quality risk.