nemo-curator

Deduplicate and filter large multimodal datasets for LLM training.

Updated Aug 23, 2026
One-click install
npx skills add https://github.com/AVOI-CEO/avoi-agent --skill nemo-curator-avoi-ceo
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/AVOI-CEO/avoi-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/AVOI-CEO/avoi-agent --skill nemo-curator-avoi-ceo

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

Nemo Curator provides GPU-accelerated data curation for large-scale multimodal datasets used in LLM training, enabling fast deduplication, quality filtering, PII redaction, and NSFW detection to improve data quality at scale.

Core Features & Use Cases

  • GPU-accelerated deduplication (exact, fuzzy, semantic) across text, image, video, and audio data.
  • 30+ quality filters with configurable thresholds for data cleaning.
  • PII redaction and NSFW detection to enforce safety and compliance.
  • Multi-GPU scaling with RAPIDS for large datasets.
  • Use cases: preparing RedPajama/The Pile style training corpora; cleaning web scraped data; deduplicating massive multimodal datasets.

Quick Start

Run Nemo Curator on a GPU-enabled cluster to begin a data curation pipeline that deduplicates, filters, redacts, and classifies a multimodal training dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large multimodal datasets for LLM training?

To prepare web scraped data for LLM training, apply quality filtering and deduplication to clean the raw corpora. This pipeline uses 30+ configurable quality filters to remove low-quality content before model training.

Do I need CUDA-enabled GPUs to run data curation pipelines at scale?

PII redaction and NSFW detection enforce data safety and compliance during curation. These features automatically identify, filter, and redact sensitive content across large multimodal datasets to ensure training corpora meet safety standards.

What is the best way to clean web scraped data for RedPajama style training corpora?

The best way to clean web scraped data for RedPajama style training corpora is using an automated curation pipeline. This approach applies GPU-accelerated quality filtering and deduplication to prepare massive multimodal training datasets efficiently.

Does GPU-accelerated data curation support text, image, video, and audio sources?

Yes, GPU-accelerated data curation supports text, image, video, and audio sources. It applies uniform deduplication, quality filtering, and classification across multimodal web crawls to prepare comprehensive LLM training datasets.