nemo-curator

Curate multi-modal LLM training data with GPU-accelerated deduplication and filtering.

2|Updated Apr 25, 2026
One-click install
npx skills add https://github.com/AlexiosBluffMara/mercury --skill nemo-curator-alexiosbluffmara
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/AlexiosBluffMara/mercury/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/AlexiosBluffMara/mercury --skill nemo-curator-alexiosbluffmara

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes references (resource) components.

What problem does it solve?

Curates high-quality training data for LLMs using GPU-accelerated data curation workflows. Applies to multi-modal datasets (text, images, video, audio) and large web corpora, enabling deduplication, quality filtering, PII redaction, and NSFW detection at scale.

Core Features & Use Cases

  • GPU-accelerated multi-modal data curation (text, image, video, audio) with deduplication, quality filtering, PII redaction, and NSFW detection.
  • Scales across RAPIDS-enabled GPUs for large corpora and web-scraped data, enabling end-to-end data preparation, cleaning, and deduplication.
  • Suitable for building high-quality training datasets for Nemotron/NVIDIA-style models and other large language models.

Quick Start

Install NeMo Curator and run a sample end-to-end data-curation workflow on your dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate and clean large web corpora for LLM training data?

Deduplicating and cleaning large web corpora for LLM training data is achieved through GPU-accelerated data curation workflows. This approach applies quality filtering, PII redaction, and NSFW detection at scale across multi-modal datasets.

What is GPU-accelerated data curation for multi-modal datasets?

GPU-accelerated data curation for multi-modal datasets is an end-to-end data preparation process that scales across RAPIDS-enabled GPUs. It enables deduplication, quality filtering, PII redaction, and NSFW detection for text, images, video, and audio.

Do I need RAPIDS and Dask to run GPU-accelerated data curation workflows?

Yes, you need RAPIDS and Dask to run these GPU-accelerated data curation workflows. The pipelines require RAPIDS-enabled GPUs and Nemo Curator modules to deliver end-to-end data preparation, cleaning, and deduplication at scale.

Can I use Nemo Curator for PII redaction and NSFW detection on text data?

Yes, you can use Nemo Curator for PII redaction and NSFW detection on text data. It applies these quality filtering steps natively within its GPU-accelerated multi-modal data curation pipelines for large web corpora.

What's the best way to scale data preparation across large web-scraped datasets?

The best way to scale data preparation across large web-scraped datasets is using RAPIDS-enabled GPUs. This distributes the end-to-end data cleaning, deduplication, and quality filtering workloads required for high-quality LLM training data.

When should I not use GPU-accelerated pipelines for multi-modal data curation?

You should not use GPU-accelerated pipelines for multi-modal data curation if your environment lacks RAPIDS-enabled GPUs. The end-to-end data preparation, cleaning, and deduplication workflows specifically require this hardware to scale across large corpora.