nemo-curator

Curate multi-modal datasets for LLM training with GPU-accelerated filters and deduplication.

Updated Apr 10, 2026
One-click install
npx skills add https://github.com/overviewlabs/WHOX --skill nemo-curator-overviewlabs
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/overviewlabs/WHOX/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/overviewlabs/WHOX --skill nemo-curator-overviewlabs

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

GPUs enable scalable, fast data curation for LLM training, but workflows are often fragmented across tools, leading to inconsistent quality and long data prep cycles.

Core Features & Use Cases

  • GPU-accelerated deduplication (exact, fuzzy, semantic) across large corpora
  • 30+ quality filters for text, image, video, and audio data
  • PII redaction and NSFW detection for safer datasets
  • Multimodal support (text, images, video, audio) with RAPIDS scaling
  • Use cases: preparing large training datasets (e.g., RedPajama/The Pile), cleaning web data, deduplicating large corpora

Quick Start

Ingest raw multi-modal data and run a default curation pipeline to produce clean Parquet datasets for LLM training.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large multimodal datasets for LLM training?

GPU-accelerated data curation pipelines apply 30+ quality filters to text, image, video, and audio data, removing low-quality content and ensuring clean training corpora at scale.

Can I remove PII and NSFW content during data curation on a GPU?

Yes, you can remove PII and NSFW content during GPU-accelerated data curation by applying built-in redaction and detection filters to ensure safer large-scale multimodal datasets.

Does nemo-curator require RAPIDS for GPU acceleration?

Yes, nemo-curator satisfies requirements for RAPIDS-based GPU acceleration, utilizing distributed GPU environments to scale data curation pipelines across large multimodal corpora.

What is the best way to clean web data for LLM training?

The best way to clean web data for LLM training is to run a default curation pipeline that ingests raw data and applies modular quality filters, deduplication, and PII redaction to produce clean Parquet datasets.

What export formats are supported for curated LLM datasets?

Curated LLM datasets support modular export formats including Parquet and JSONL, allowing flexible downstream integration after applying multi-stage quality controls across distributed GPU environments.