nemo-curator

GPU-accelerate multimodal data curation for LLM training with RAPIDS.

Updated May 4, 2026
One-click install
npx skills add https://github.com/Plaidmustache/hermes-nulab --skill nemo-curator-plaidmustache
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/Plaidmustache/hermes-nulab/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/Plaidmustache/hermes-nulab --skill nemo-curator-plaidmustache

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

GPU-accelerated data curation for LLM training. Supports text/image/video/audio. Features fuzzy deduplication (16× faster), quality filtering (30+ heuristics), semantic deduplication, PII redaction, NSFW detection. Scales across GPUs with RAPIDS. Use for preparing high-quality training datasets, cleaning web data, or deduplicating large corpora.

Core Features & Use Cases

  • GPU-accelerated data curation across multimodal datasets (text, image, video, audio) for LLM training.
  • Fuzzy and semantic deduplication to ensure unique, high-quality corpora.
  • PII redaction and NSFW detection to protect privacy and safety, with scalable performance on RAPIDS.
  • Use cases include preparing training data from web scrapes, cleaning large datasets, and deduplicating corpora for production-grade models.

Quick Start

Install Nemo Curator on your GPU cluster to begin curating multimodal datasets for LLM training.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I clean and deduplicate web data for LLM training?

Clean and deduplicate web data for LLM training by applying GPU-accelerated quality filters, fuzzy and semantic deduplication, PII redaction, and NSFW detection using RAPIDS. This prepares high-quality, compliant multimodal corpora for scalable model training.

Can I curate multimodal datasets including video and audio on a GPU cluster?

Yes, you can curate multimodal datasets across text, image, video, and audio on a GPU cluster. The data curation process uses RAPIDS acceleration to scale quality filtering and deduplication across large multimodal training corpora.

What is the best way to redact PII and detect NSFW content in large training corpora?

Redact PII and detect NSFW content in large training corpora by running GPU-accelerated data curation with RAPIDS. This enforces privacy and safety compliance while scaling efficiently across large datasets intended for LLM training.

Does fuzzy deduplication work for large text corpora without slowing down processing?

Fuzzy deduplication works for large text corpora without slowing processing by utilizing GPU acceleration via RAPIDS. This approach operates 16 times faster than standard methods to ensure unique, high-quality training data.

How do I apply quality filters to web-scraped data before model training?

Apply quality filters to web-scraped data before model training by running GPU-accelerated data curation. The process enforces over 30 quality heuristics alongside semantic deduplication to ensure clean, production-grade corpora.

When do I need semantic deduplication for LLM training datasets?

You need semantic deduplication for LLM training datasets when handling large-scale multimodal corpora where exact matching is insufficient. It identifies and removes contextually similar data points, ensuring high-quality, unique training samples.