nemo-curator

Curate large-scale LLM training datasets with GPU-accelerated deduplication, filtering, and PII redaction.

Updated Jun 17, 2026
One-click install
npx skills add https://github.com/cxnaive/hermes-agent-llbot --skill nemo-curator-cxnaive
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/cxnaive/hermes-agent-llbot/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/cxnaive/hermes-agent-llbot --skill nemo-curator-cxnaive

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes references (resource) components.

What problem does it solve?

This skill addresses the massive computational bottleneck in preparing high-quality LLM training data by leveraging GPU acceleration for deduplication, filtering, and PII redaction.

Core Features & Use Cases

  • GPU-Accelerated Processing: Perform fuzzy deduplication and quality filtering up to 16x faster than CPU-based alternatives.
  • Multi-Modal Support: Curate text, image, video, and audio datasets using specialized pipelines.
  • Use Case: When preparing a massive web-scraped dataset like Common Crawl, use this skill to efficiently remove exact and fuzzy duplicates, filter out low-quality or toxic content, and redact sensitive PII before model training.

Quick Start

Use the nemo-curator skill to initialize a GPU-accelerated pipeline that filters and deduplicates the dataset located in the current directory.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I accelerate deduplication and PII redaction for large LLM training datasets?

You can accelerate LLM training data curation using GPU-accelerated pipelines that perform fuzzy deduplication, quality filtering, and PII redaction up to 16x faster than CPU alternatives. This leverages RAPIDS, Dask, and Ray-based orchestration for scalable processing.

What is GPU-accelerated data curation and how does it work for LLM training?

GPU-accelerated data curation uses RAPIDS and cuDF to process multi-modal datasets, performing fuzzy deduplication, quality filtering, and PII redaction. It ensures high-quality inputs for LLM training by leveraging Ray-based pipeline orchestration for scalable data processing.

Does nemo-curator support multi-modal data like images, video, and audio?

Yes, this skill supports multi-modal data curation for text, image, video, and audio datasets using specialized pipelines. It applies GPU-accelerated filtering, deduplication, and PII redaction across these formats to ensure high-quality model inputs.

What's the best way to prepare Common Crawl data for LLM training?

The best way to prepare Common Crawl data is to use a GPU-accelerated curation pipeline that removes exact and fuzzy duplicates, filters low-quality or toxic content, and redacts sensitive PII. This leverages RAPIDS and Dask for scalable, high-quality LLM training inputs.

Do I need RAPIDS and Dask to run GPU-accelerated data curation pipelines?

Yes, RAPIDS, cuDF, and Dask are required dependencies for GPU-accelerated data curation. RAPIDS provides GPU-based performance for deduplication and filtering, while Dask and Ray handle scalable pipeline orchestration across massive LLM training datasets.