nemo-curator

Curate and deduplicate large-scale multimodal corpora with GPU acceleration.

2|Updated Apr 12, 2026
One-click install
npx skills add https://github.com/Clay-HHK/claude-config --skill nemo-curator-clay-hhk
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/Clay-HHK/claude-config/tree/main/skills/AI-research-SKILLs/05-data-processing/nemo-curator
Command: npx skills add https://github.com/Clay-HHK/claude-config --skill nemo-curator-clay-hhk

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

Cleans, filters, and deduplicates massive web-scraped and multimodal corpora to produce high-quality training datasets for LLMs and other ML models, addressing scale, noise, PII leakage, and redundant content that degrade model performance.

Core Features & Use Cases

  • High-throughput deduplication: Exact, fuzzy (MinHash+LSH), and semantic deduplication accelerated on GPUs to remove identical and near-duplicate content at multi-terabyte scale.
  • Quality filtering and classifiers: 30+ heuristic filters plus GPU classifiers for quality, language, and NSFW detection to remove low-value or harmful data.
  • Multimodal support and PII redaction: Handles text, images, video, and audio with PII anonymization and modality-specific filters and embedders.
  • Distributed GPU scaling: Integrates with RAPIDS and Dask for near-linear scaling across GPU clusters for production-grade pipelines.
  • Use case: Curate Common Crawl or web-scraped datasets to produce a cleaned, deduplicated Parquet corpus ready for LLM training.

Quick Start

Run a NeMo Curator pipeline on your GPU cluster to quality-filter, redact PII, and deduplicate a Common Crawl Parquet dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large-scale Common Crawl datasets for LLM training?

You can deduplicate large-scale Common Crawl datasets by applying GPU-accelerated exact, fuzzy (MinHash+LSH), and semantic deduplication to remove identical and near-duplicate content at multi-terabyte scale. This process outputs a cleaned Parquet corpus ready for model training.

What is GPU-accelerated data curation and how does it handle multimodal corpora?

GPU-accelerated data curation cleans, filters, and deduplicates massive text, image, video, and audio corpora. It uses RAPIDS and Dask for distributed execution, applying modality-specific filters and embedders to process high-quality multimodal datasets efficiently.

Do I need a GPU-capable RAPIDS stack to run NeMo Curator pipelines?

Yes, you need a GPU-capable RAPIDS stack and Dask for distributed execution to run NeMo Curator pipelines. These dependencies provide the near-linear scaling across GPU clusters required to process multi-terabyte web-scraped datasets.

Can I redact PII and detect NSFW content during data quality filtering?

Yes, you can redact PII and detect NSFW content during data quality filtering. The pipeline includes PII anonymization and GPU classifiers for quality, language, and NSFW detection to remove low-value or harmful data from your corpora.

What's the best way to remove near-duplicate text from web scrapes at scale?

The best way to remove near-duplicate text from web scrapes is using fuzzy (MinHash+LSH) and semantic deduplication accelerated on GPUs. This approach identifies and eliminates redundant content across multi-terabyte datasets to prevent model performance degradation.

How many heuristic filters are available for quality filtering web-scraped text?

There are over 30 heuristic filters available for quality filtering web-scraped text. These filters work alongside GPU classifiers to evaluate document quality and language, ensuring low-value data is removed from your training datasets.