nemo-curator

Curate multimodal LLM training datasets with GPU-accelerated deduplication and filtering.

3|Updated Feb 21, 2026
One-click install
npx skills add https://github.com/ihatesea69/HieuNghi-AI-Skills --skill nemo-curator-ihatesea69
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/ihatesea69/HieuNghi-AI-Skills/tree/main/airesearch_skills/05-data-processing/nemo-curator
Command: npx skills add https://github.com/ihatesea69/HieuNghi-AI-Skills --skill nemo-curator-ihatesea69

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes scripts (resource) and references (resource) components.

What problem does it solve?

This Skill addresses the challenge of preparing massive, high-quality datasets for training Large Language Models (LLMs) by providing GPU-accelerated data curation tools.

Core Features & Use Cases

  • GPU-Accelerated Processing: Significantly speeds up data curation tasks like deduplication and filtering using NVIDIA RAPIDS.
  • Multimodal Support: Handles text, image, video, and audio data.
  • Advanced Filtering & Deduplication: Includes fuzzy deduplication (16x faster), quality filtering with 30+ heuristics, semantic deduplication, PII redaction, and NSFW detection.
  • Use Case: Prepare a large corpus of web-scraped text for LLM training by removing near-duplicates, filtering out low-quality content, and redacting sensitive information, all on a GPU cluster for maximum efficiency.

Quick Start

Use the nemo-curator skill to prepare LLM training data by applying quality filters and fuzzy deduplication to your dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I accelerate fuzzy deduplication for large text datasets?

GPU-accelerated fuzzy deduplication processes large text datasets 16x faster using NVIDIA RAPIDS. It scales across multiple GPUs to efficiently identify and remove near-duplicate content in web-scraped corpora.

What is GPU-accelerated data curation for LLM training?

GPU-accelerated data curation prepares high-quality datasets for LLM training by using NVIDIA RAPIDS to speed up tasks like quality filtering and deduplication. It supports multimodal data including text, image, video, and audio formats.

Can I redact PII and detect NSFW content during LLM data preparation?

You can redact PII and detect NSFW content during LLM data preparation using built-in advanced filtering features. The process applies these safety filters alongside 30+ quality heuristics to clean web-scraped text.

Does data curation with RAPIDS support multimodal data formats?

Data curation with RAPIDS supports multimodal data formats including text, image, video, and audio. It processes these diverse data types on GPU clusters to prepare comprehensive training corpora for large language models.

What is the best way to filter low-quality content from scraped web data?

The best way to filter low-quality content from scraped web data is applying 30+ quality heuristics and semantic deduplication. This GPU-accelerated approach removes near-duplicates and inferior content efficiently.

Do I need multiple GPUs to scale data curation for LLM training?

You need multiple GPUs to scale data curation for LLM training across large corpora. The workflow leverages Dask and RAPIDS to distribute fuzzy deduplication and filtering tasks efficiently across a GPU cluster.