nemo-curator

Curate multimodal training data with GPU-accelerated deduplication and filtering.

Updated Aug 23, 2026
One-click install
npx skills add https://github.com/zulumonkeymetallic/bob --skill nemo-curator-zulumonkeymetallic
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/zulumonkeymetallic/bob/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/zulumonkeymetallic/bob --skill nemo-curator-zulumonkeymetallic

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

NeMo Curator automates the time-consuming task of preparing high-quality, deduplicated, and safe training data for large language models. It handles multi-modal data (text, image, video, audio) and scales across GPU clusters to produce clean, ready-to-train datasets.

Core Features & Use Cases

  • GPU-accelerated multi-modal data curation with exact, fuzzy, and semantic deduplication.
  • 30+ quality filters, PII redaction, and NSFW detection for safer training corpora.
  • Scales across RAPIDS-enabled GPUs for large datasets and distributed processing.

Quick Start

Ingest raw training data, run GPU-accelerated curation to deduplicate, filter quality, redact PII, and output a clean dataset ready for model training.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large-scale multimodal training data efficiently?

You can deduplicate large-scale multimodal training data efficiently using GPU-accelerated data curation. It performs exact, fuzzy, and semantic deduplication across text, image, video, and audio corpora using RAPIDS-enabled GPUs.

Can I use GPU acceleration for PII redaction and NSFW detection in LLM training data?

Yes, GPU acceleration supports PII redaction and NSFW detection in LLM training data. It processes large datasets across distributed GPU nodes to identify and filter unsafe or sensitive content.

Do I need CUDA-enabled GPUs to run multimodal data curation for LLM training?

Yes, you need CUDA-enabled GPUs and NVIDIA RAPIDS to run multimodal data curation for LLM training. The distributed processing across GPU nodes relies on these dependencies to scale large datasets.

What is the best way to clean web-scraped data for model training?

The best way to clean web-scraped data for model training is through automated data curation. It applies over 30 quality filters, PII redaction, and NSFW detection to produce safe, high-quality, ready-to-train datasets.

Does GPU-accelerated data curation support distributed processing for large datasets?

Yes, GPU-accelerated data curation supports distributed processing for large datasets. It scales across RAPIDS-enabled GPU nodes to handle massive multimodal corpora efficiently during deduplication and filtering.