nemo-curator

Automate GPU-accelerated data curation for LLM training corpora.

Updated May 2, 2026
One-click install
npx skills add https://github.com/AlvaroBiano/hermes-agent --skill nemo-curator-alvarobiano
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/AlvaroBiano/hermes-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/AlvaroBiano/hermes-agent --skill nemo-curator-alvarobiano

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

GPU-accelerated data curation for high-quality training datasets, enabling fast, scalable deduplication, quality filtering, and redaction across multi-modal data.

Core Features & Use Cases

  • GPU-accelerated data curation for LLM training with multi-modal support.
  • Deduplication (exact, fuzzy, semantic), quality filtering (30+ heuristics), PII redaction, and NSFW detection.
  • Use cases include cleaning web-scraped data and assembling robust training datasets for large language models.

Quick Start

Process your dataset by applying quality filters, deduplication, and redaction to produce a clean training set.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large web-scraped datasets for LLM training?

GPU-accelerated data curation automates dataset preparation for LLM training by applying deduplication, PII redaction, and NSFW filtering across multi-modal corpora like text, images, video, and audio.

How do I redact PII and filter NSFW content from training corpora?

To redact PII and filter NSFW content from training corpora, apply automated quality filters and redaction capabilities that detect and remove sensitive or explicit material across multi-modal data.

Do I need NVIDIA RAPIDS-enabled GPU infrastructure for multi-modal data curation?

Yes, multi-modal data curation with this method requires NVIDIA RAPIDS-enabled GPU infrastructure to scale across multiple GPUs and execute GPU-accelerated deduplication and filtering tasks.

What is the best way to apply quality filtering to text and image datasets?

The best way to apply quality filtering to text and image datasets is using GPU-accelerated curation pipelines that run 30+ heuristic quality filters to clean and refine multi-modal training data.

Can I scale semantic deduplication across multiple GPUs?

Yes, you can scale semantic deduplication across multiple GPUs using multi-GPU scaling support built into the NVIDIA RAPIDS-enabled infrastructure to process large training corpora efficiently.