nemo-curator

Curate large multimodal datasets with GPU-accelerated filtering, deduplication, and PII redaction.

1|Updated Mar 22, 2026
One-click install
npx skills add https://github.com/nelohenriq/hermes-agent-plus --skill nemo-curator-nelohenriq
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/nelohenriq/hermes-agent-plus/tree/main/skills/mlops/evaluation/nemo-curator
Command: npx skills add https://github.com/nelohenriq/hermes-agent-plus --skill nemo-curator-nelohenriq

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

GPU-accelerated data curation for high-quality training data, enabling scalable filtering, deduplication, and redaction for large LLM datasets.

Core Features & Use Cases

  • Quality filtering across 30+ heuristics to remove low-quality text and multimodal data
  • Exact, fuzzy, and semantic deduplication to create unique, high-value corpora
  • PII redaction and privacy-preserving transformations for compliant datasets
  • GPU-accelerated processing using RAPIDS for multi-node scaling across clusters

Quick Start

Run Nemo Curator on your dataset to produce a curated, deduplicated training corpus ready for LLM training.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large multimodal datasets for LLM training?

Large multimodal datasets for LLM training can be deduplicated using GPU-accelerated exact, fuzzy, and semantic deduplication. This approach scales across multi-node clusters using RAPIDS to produce unique, high-value training corpora.

What is GPU-accelerated data curation and when do I need it?

GPU-accelerated data curation is the process of filtering, deduplicating, and redacting large datasets using RAPIDS. You need it when scaling quality filtering and PII redaction across massive text, image, video, and audio datasets for production LLM pipelines.

Can I use RAPIDS for PII redaction in Parquet and JSONL files?

Yes, RAPIDS can be used for PII redaction and privacy-preserving transformations. The system natively supports Parquet and JSONL inputs and outputs, enabling compliant dataset creation within GPU-accelerated production pipelines.

Does data curation for LLM training support multi-node scaling?

Data curation for LLM training supports multi-node scaling across clusters. It uses GPU-accelerated processing with RAPIDS to handle large datasets requiring extensive quality filtering and deduplication.

What is the best way to filter low-quality text from multimodal training corpora?

The best way to filter low-quality text is applying over 30 quality heuristics. This GPU-accelerated approach removes low-quality text and multimodal data, producing a high-quality, deduplicated training corpus.

Do I need GPU hardware to run data curation pipelines?

GPU hardware is required to leverage RAPIDS-based acceleration for multi-node scaling. This GPU acceleration enables efficient quality filtering, PII redaction, and semantic deduplication across large multimodal datasets.