nemo-curator

Accelerate LLM training data curation with GPU-based deduplication and quality filtering.

3|1|Updated May 19, 2026
One-click install
npx skills add https://github.com/Quill-Agent/Quill-Agent --skill nemo-curator-quill-agent
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/Quill-Agent/Quill-Agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/Quill-Agent/Quill-Agent --skill nemo-curator-quill-agent

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes scripts (resource) and references (resource) and assets (resource) components.

What problem does it solve?

This Skill addresses the challenge of preparing high-quality training data for Large Language Models (LLMs) by providing GPU-accelerated data curation capabilities.

Core Features & Use Cases

  • GPU Acceleration: Leverages GPUs for faster data processing, including deduplication and quality filtering.
  • Multi-Modal Support: Curation for text, images, video, and audio data.
  • Use Case: Prepare a diverse dataset for LLM training by cleaning, deduplicating, and filtering text, images, and audio data.

Quick Start

Run the 'nemo-curator' skill to prepare your dataset for LLM training.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I accelerate data curation for LLM training using GPU?

GPU acceleration speeds up data curation for LLM training by offloading deduplication and quality filtering to GPUs, reducing processing time for large-scale datasets compared to CPU methods.

Can I use GPU deduplication for multi-modal datasets?

Yes, GPU deduplication supports multi-modal data curation, enabling you to clean, deduplicate, and filter text, images, video, and audio within a single large-scale preparation workflow.

What's the best way to prepare high-quality training data for Large Language Models?

Preparing high-quality training data for Large Language Models requires systematic data curation to clean, deduplicate, and apply quality filtering across diverse datasets, ensuring reliable model performance.

Does GPU-accelerated quality filtering work with Dask and RAPIDS?

GPU-accelerated quality filtering works with Dask and RAPIDS by utilizing cudf for GPU dataframes, enabling distributed and scalable data processing for LLM training preparation workflows.

Do I need specific dependencies to run GPU-accelerated data curation scripts?

You need dependencies including nemo-curator, cudf, dask, and rapids to run GPU-accelerated data curation scripts, ensuring the environment supports GPU power for large-scale data cleaning.

When should I use GPU acceleration for data curation instead of CPU processing?

You should use GPU acceleration for data curation instead of CPU processing when handling large-scale datasets for LLM training, as GPUs significantly speed up deduplication and quality filtering workflows.