nemo-curator

Deduplicate and filter large-scale LLM training data with GPU-optimized pipelines.

1|Updated May 12, 2026
One-click install
npx skills add https://github.com/projectedanx/hermes-agent --skill nemo-curator-projectedanx
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/projectedanx/hermes-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/projectedanx/hermes-agent --skill nemo-curator-projectedanx

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes references (resource) components.

What problem does it solve?

This skill addresses the bottleneck of preparing massive, high-quality datasets for LLM training by leveraging GPU acceleration to perform deduplication, filtering, and cleaning tasks significantly faster than traditional CPU-based methods.

Core Features & Use Cases

  • High-Speed Deduplication: Perform exact, fuzzy, and semantic deduplication on multi-terabyte datasets with up to 16x speed improvements.
  • Advanced Quality Filtering: Apply over 30 heuristic filters, including PII redaction, NSFW detection, and language identification, to ensure training data integrity.
  • Use Case: Use this skill to process raw web scrapes like Common Crawl, removing low-quality content and duplicates to prepare a clean, high-performance dataset for training a large language model.

Quick Start

Use the nemo-curator skill to perform fuzzy deduplication on the dataset located in the input directory using the default MinHash parameters.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I accelerate deduplication and data curation for LLM training on large datasets?

GPU-accelerated data curation for LLM training uses RAPIDS and Dask to perform high-speed deduplication and quality filtering, achieving up to 16x speed improvements on multi-terabyte datasets compared to traditional CPU-based methods.

What is the best way to clean raw web scrapes like Common Crawl for language model training?

Cleaning raw web scrapes for language model training involves applying heuristic filters for PII redaction and NSFW detection, alongside exact, fuzzy, and semantic deduplication to remove low-quality content and prepare high-performance datasets.

Does GPU-accelerated data processing support multimodal datasets across distributed clusters?

GPU-accelerated data processing supports multimodal datasets across distributed GPU clusters, enabling high-throughput cleaning and semantic similarity analysis for text, image, video, and audio data formats.

Can I use Dask and RAPIDS for fuzzy deduplication on multi-terabyte text datasets?

You can use Dask and RAPIDS to perform fuzzy deduplication on multi-terabyte text datasets using default MinHash parameters, leveraging distributed GPU clusters to satisfy high-throughput data cleaning requirements.

What types of quality filtering are available for preparing LLM training data?

Quality filtering for preparing LLM training data includes over 30 heuristic filters, such as PII redaction, NSFW detection, and language identification, to ensure training data integrity and remove low-quality content.

When should I use GPU acceleration instead of CPU-based methods for data deduplication?

GPU acceleration should be used instead of CPU-based methods for data deduplication when processing massive datasets for LLM training, as it provides significantly faster high-throughput data preparation and semantic similarity analysis.