nemo-curator

Curate LLM training data with GPU-accelerated deduplication, filtering, and PII redaction.

Updated Sep 10, 2026
One-click install
npx skills add https://github.com/loteiron/ZeusAgent --skill nemo-curator-loteiron
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/loteiron/ZeusAgent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/loteiron/ZeusAgent --skill nemo-curator-loteiron

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes references (resource) components.

What problem does it solve? Preparing high-quality training data for LLMs from raw web scrapes and multi-modal sources is slow and expensive on CPU, and low-quality, duplicated, or privacy-sensitive content degrades model training. ## Core Features & Use Cases - Deduplication at scale: Exact, fuzzy (MinHash + LSH), and semantic deduplication running up to 16× faster on GPU, e.g., 8TB RedPajama v2 in 7.5 hours instead of 120. - Quality filtering and classification: 30+ heuristic filters (word count, repeated lines, URL ratio) plus GPU classifiers for quality and NSFW content. - PII redaction and multi-modal curation: Redact emails, phone numbers, and names from text; curate image, video, and audio datasets with aesthetic scoring, scene detection, and ASR-based filtering. - Use Case: Curate a Common Crawl dump by chaining language identification, heuristic filters, exact and fuzzy deduplication, and PII redaction, then write the result to Parquet. ## Quick Start Ask the agent to build a NeMo Curator pipeline that loads your Parquet dataset, applies quality filters, removes fuzzy duplicates, redacts PII, and saves the curated output.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate LLM training data with NeMo Curator?▼

NeMo Curator offers exact deduplication via hashing, fuzzy deduplication using MinHash plus LSH, and semantic deduplication with embedding models. Fuzzy dedup is the recommended speed/quality trade-off and runs about 16× faster on GPU than CPU.

NeMo Curator vs datatrove for data curation?▼

NeMo Curator is GPU-accelerated and focused on curation with dedup, classifiers, and PII redaction, while datatrove is CPU-based and open-source. Choose NeMo Curator when GPU clusters are available and throughput matters.

Does NeMo Curator support image and video datasets?▼

Yes, NeMo Curator supports multi-modal curation including image aesthetic and NSFW filtering with CLIP embeddings, video scene detection and clip extraction, and audio ASR transcription with WER filtering.

Is NeMo Curator 1.x compatible with 0.x code?▼

No, version 1.x is a major rewrite around a Ray-based pipeline and stage architecture. The old DocumentDataset and ScoreFilter call-style API is gone, so follow the current quickstart and modality guides for exact 1.x imports.

What are the GPU requirements for NeMo Curator?▼

NeMo Curator runs on Linux or macOS with CUDA GPUs using RAPIDS, cuDF, and Dask for acceleration. A CPU-only text extra exists but is significantly slower, and multi-GPU scaling is near-linear across nodes.