nemo-curator

GPU-accelerate LLM training data curation with fuzzy deduplication, quality filtering, and PII redaction.

Updated May 11, 2026
One-click install
npx skills add https://github.com/richardnguyen0715/keep-it-real --skill nemo-curator-richardnguyen0715
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/richardnguyen0715/keep-it-real/tree/main/refer-projects/hermes-agent/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/richardnguyen0715/keep-it-real --skill nemo-curator-richardnguyen0715

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes scripts (resource) and references (resource) and assets (resource) components.

What problem does it solve?

This Skill addresses the challenges of preparing high-quality training datasets for large language models (LLMs), including data deduplication, quality filtering, and privacy redaction.

Core Features & Use Cases

  • GPU-accelerated Data Curation: Offers up to 16x faster fuzzy deduplication, 30+ quality filters, and PII redaction.
  • Multi-modal Support: Caters to text, image, video, and audio data.
  • Use Case: Ideal for cleaning web scraped data, deduplicating large corpora, or preparing datasets for LLM training.

Quick Start

Use the nemo-curator skill to filter and deduplicate your dataset 'llm_training_data.csv'.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I accelerate data curation and fuzzy deduplication for LLM training datasets?

GPU-accelerated data curation for LLM training speeds up fuzzy deduplication by up to 16x. It uses RAPIDS to scale across GPUs, efficiently cleaning and processing large text corpora.

Can I use GPU acceleration to filter and redact PII from web scraped data?

Yes, you can redact PII and apply over 30 quality filters to web scraped data using GPU acceleration. This ensures privacy and dataset quality for LLM training.

Does GPU-accelerated data curation support multi-modal formats like image, video, and audio?

GPU-accelerated data curation supports multi-modal data including text, image, video, and audio formats. It processes these diverse datasets for comprehensive LLM training preparation.

Do I need specific libraries like RAPIDS and Dask to run GPU-accelerated data curation?

Yes, you need nemo-curator, cudf, dask, and rapids libraries installed. These dependencies provide the necessary GPU acceleration and distributed computing environment for data curation.