nemo-curator

Filter noisy multimodal datasets and remove exact, fuzzy, and semantic duplicates.

4|Updated May 18, 2026
One-click install
npx skills add https://github.com/ZardLi1115/zedclaw --skill nemo-curator-zardli1115
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/ZardLi1115/zedclaw/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/ZardLi1115/zedclaw --skill nemo-curator-zardli1115

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes references (resource) components.

What problem does it solve?

NeMo Curator reduces noisy, duplicated, unsafe, and low-quality content so your LLM training sets stay clean, diverse, and privacy-safe without spending weeks manually auditing web-scale corpora.

Core Features & Use Cases

  • GPU-accelerated multimodal curation: Apply quality filtering and deduplication across text, images, video, and audio at scale.
  • Fast deduplication pipelines: Use exact, fuzzy (MinHash+LSH), and semantic (embedding-based) deduplication to remove repeats and near-repeats.
  • Safety and privacy controls: Perform PII redaction and NSFW detection/classifier filtering to reduce sensitive or harmful content.

Quick Start

Install nemo-curator with GPU support and run a pipeline that filters for quality, removes fuzzy duplicates, redacts PII, and writes the curated output to Parquet for training ingestion.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I curate multimodal LLM training data to remove duplicates and unsafe content?

You can curate multimodal LLM training data using GPU-accelerated pipelines that filter low-quality content, remove exact and fuzzy duplicates, and apply PII redaction with NSFW filtering for privacy-safe datasets.

What is GPU deduplication and how does it work for large text corpora?

GPU deduplication processes large text corpora using RAPIDS, applying exact, fuzzy (MinHash+LSH), and semantic embedding-based methods to remove repeats and near-repeats across multiple GPUs.

Do I need RAPIDS and multiple GPUs to run nemo-curator for data preparation?

Yes, nemo-curator requires GPU-accelerated processing with RAPIDS across multiple GPUs to handle web-scale multimodal corpora curation efficiently.

How do I redact PII and filter NSFW content from web-scale datasets?

Redact PII and filter NSFW content from web-scale datasets by applying built-in safety and privacy controls that detect and redact sensitive information while filtering harmful multimodal content.

What's the best way to prepare noisy web data for downstream model training?

The best way to prepare noisy web data for model training is running a curation pipeline that filters low-quality content, removes duplicates, redacts PII, and writes the curated output to Parquet for training ingestion.

Does nemo-curator support curation for image, video, and audio data?

Yes, nemo-curator supports multimodal curation across text, images, video, and audio, applying quality heuristics and safety controls to prepare diverse web-scale corpora for training.