nemo-curator

Deduplicate, filter, and redact multi-modal training data with GPU acceleration.

78|16|Updated Apr 23, 2026
One-click install
npx skills add https://github.com/sheawinkler/hermes-agent-ultra --skill nemo-curator-sheawinkler
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/sheawinkler/hermes-agent-ultra/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/sheawinkler/hermes-agent-ultra --skill nemo-curator-sheawinkler

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

NeMo Curator accelerates the preparation of high-quality training data for multi-modal LLMs by combining GPU-accelerated deduplication, quality filtering, and redaction into a single workflow.

Core Features & Use Cases

  • GPU-accelerated deduplication (exact, fuzzy, semantic) across text, images, and other modalities.
  • 30+ quality filters to prune low-quality or unsafe data.
  • PII redaction and NSFW detection to sanitize training corpora.
  • Scales across GPU clusters with RAPIDS for large datasets and multi-modal curation.
  • Use cases include preparing RedPajama-type datasets, cleaning web data, and deduplicating large corpora for LLM training.

Quick Start

Run Nemo Curator on a GPU cluster to deduplicate, filter quality, redact PII, and curate multi-modal training data.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I prepare large-scale training data for multi-modal LLMs?

Prepare large-scale training data for multi-modal LLMs by using GPU-accelerated data curation to deduplicate, filter, and redact text, image, video, and audio datasets. This ensures high-quality inputs for model training.

What is GPU-accelerated semantic deduplication and how does it work for training corpora?

GPU-accelerated semantic deduplication identifies and removes semantically similar data points in training corpora. It scales across GPU clusters using RAPIDS to efficiently clean large-scale text and multi-modal datasets.

Do I need the RAPIDS stack to run GPU-accelerated data curation?

Yes, you need the RAPIDS stack installed on a Linux or macOS environment to run GPU-accelerated data curation. It provides the necessary GPU compute backend for scaling deduplication and filtering tasks.

Can I redact PII and detect NSFW content in large web datasets?

Yes, you can redact PII and detect NSFW content in large web datasets. The data curation pipeline includes specific modules to sanitize training corpora and prune low-quality or unsafe data.

What is the best way to deduplicate large text corpora for LLM training?

The best way to deduplicate large text corpora is using a GPU-accelerated pipeline that performs exact, fuzzy, and semantic deduplication. This method scales across GPU clusters to clean RedPajama-type datasets.