nemo-curator

Curate and deduplicate multimodal training corpora with NVIDIA NeMo Curator on GPU clusters.

Updated Apr 9, 2026
One-click install
npx skills add https://github.com/MarbleSodas/Mavis --skill nemo-curator-marblesodas
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/MarbleSodas/Mavis/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/MarbleSodas/Mavis --skill nemo-curator-marblesodas

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

NeMo Curator helps you prepare high-quality LLM training datasets by removing low-quality, duplicate, unsafe, and sensitive content before model training.

Core Features & Use Cases

  • GPU-accelerated curation pipeline: quality filtering, deduplication, PII redaction, and NSFW detection across large corpora.
  • Fuzzy and semantic deduplication: near-duplicate removal using MinHash/LSH and embedding-based similarity to improve dataset diversity.
  • Multimodal support: handle text, images, video, and audio with modality-specific filters and classifiers (including ASR + WER filtering for audio).
  • Use case: curate 10B-scale web-crawl or scraped datasets (e.g., Common Crawl) into cleaner, deduplicated Parquet shards ready for training.

Quick Start

Ask NeMo Curator to run a GPU pipeline that filters low-quality docs, applies fuzzy and semantic deduplication, and outputs a cleaned Parquet dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate Common Crawl data for LLM training?

Deduplicating Common Crawl data for LLM training involves running a GPU-accelerated curation pipeline that applies quality heuristics, fuzzy MinHash/LSH matching, and semantic embedding similarity to output cleaned Parquet shards.

Can I use GPU acceleration for PII redaction on web-scale datasets?

Yes, you can use GPU acceleration for PII redaction on web-scale datasets via distributed multi-GPU execution with RAPIDS components, which processes sensitive content removal efficiently before model training.

What is fuzzy and semantic deduplication in multimodal data curation?

Fuzzy and semantic deduplication in multimodal data curation is the process of removing near-duplicate documents using MinHash/LSH algorithms and embedding-based similarity to improve dataset diversity across text, image, video, and audio modalities.

Does multimodal data curation support audio and video filtering?

Multimodal data curation supports audio and video filtering through modality-specific filters and classifiers, including ASR and WER filtering for audio, to ensure high-quality training corpora across all media types.

Do I need NVIDIA RAPIDS components to run distributed multi-GPU deduplication?

Yes, you need NVIDIA RAPIDS components to run distributed multi-GPU deduplication, as the curation pipeline requires GPU-capable RAPIDS libraries to execute fuzzy and semantic deduplication at web scale.

What are the limitations of NSFW detection in large corpus cleaning?

The metadata does not specify exact limitations of NSFW detection in large corpus cleaning, but it confirms the pipeline removes NSFW content alongside low-quality, duplicate, and PII data during web-scale dataset preparation.