nemo-curator

Curate LLM training data with GPU-accelerated deduplication and quality filtering.

150|25|Updated Apr 20, 2026
One-click install
npx skills add https://github.com/Devsoul2026/Hermes-One-Click --skill nemo-curator-devsoul2026
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/Devsoul2026/Hermes-One-Click/tree/main/hermes-agent/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/Devsoul2026/Hermes-One-Click --skill nemo-curator-devsoul2026

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes references (resource) components.

What problem does it solve?

This Skill accelerates the creation of high-quality training data for large language models by providing GPU-accelerated data curation workflows that combine deduplication, quality filtering, and multi-modal support.

Core Features & Use Cases

  • GPU-accelerated deduplication: exact, fuzzy, and semantic deduplication across large corpora.
  • Quality filtering: 30+ heuristics to improve data quality and usefulness for model training.
  • PII redaction & NSFW detection: automatic privacy preservation and content safety checks.
  • Multi-modal curation: support for text, images, video, and audio data.
  • Scalable pipelines: end-to-end workflows designed to run efficiently on multi-GPU clusters.

Quick Start

Install Nemo Curator, configure a CUDA-enabled GPU cluster, and run the data-curation pipeline on your dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large web-scraped corpora for LLM training?

GPU-accelerated data curation workflows support exact, fuzzy, and semantic deduplication across large web-scraped corpora, running efficiently on multi-GPU clusters to remove redundant text for LLM training.

What is GPU-accelerated data curation and when do I need it?

GPU-accelerated data curation uses CUDA-enabled GPUs to process large-scale LLM training data. You need it when curating massive web-scraped or multi-modal datasets requiring deduplication, quality filtering, and PII redaction at scale.

Do I need CUDA-enabled GPUs to run multimodal data curation pipelines?

Yes, CUDA-enabled GPUs are required to run these GPU-accelerated data curation pipelines. The workflow depends on RAPIDS, cuDF, and Dask to scale deduplication and quality filtering across multi-modal datasets like text, images, video, and audio.

Can I automatically redact PII and detect NSFW content in training datasets?

Yes, you can automatically redact PII and detect NSFW content in training datasets. The curation workflow includes built-in privacy preservation and content safety checks alongside its 30+ quality filtering heuristics.

What's the best way to filter low-quality text from scraped datasets?

The best way to filter low-quality text from scraped datasets is using GPU-accelerated curation pipelines with 30+ quality heuristics. This improves data usefulness for model training while running efficiently on multi-GPU clusters.

Does Nemo Curator work with Dask and RAPIDS for distributed data processing?

Yes, Nemo Curator works with Dask and RAPIDS for distributed data processing. It leverages these dependencies alongside cuDF to enable scalable, GPU-accelerated curation workflows across multi-GPU clusters for large corpora.