nemo-curator

Clean and deduplicate large multi-modal datasets for LLM training with GPU acceleration.

Updated Apr 24, 2026
One-click install
npx skills add https://github.com/Harries/hermes-agent --skill nemo-curator-harries
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/Harries/hermes-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/Harries/hermes-agent --skill nemo-curator-harries

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

Curates and cleans large, multi-modal datasets for LLM training using GPU-accelerated tooling to improve data quality and reduce processing time.

Core Features & Use Cases

  • Quality filtering: Apply 30+ heuristics to filter low-quality content.
  • Deduplication: Supports exact, fuzzy, and semantic deduplication at scale.
  • PII redaction & NSFW detection: Redacts sensitive information and flags unsafe content for review.
  • Use Case: Prepare RedPajama-like training data by curating and deduplicating web-scraped text, image, audio, and video datasets.

Quick Start

Install Nemo Curator and run a multi-stage curation pipeline across a GPU cluster to produce cleaned, deduplicated data.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large multimodal datasets for LLM training?

You can deduplicate large multimodal datasets for LLM training using GPU-accelerated data curation. It supports exact, fuzzy, and semantic deduplication strategies at scale across text, image, video, and audio.

What is GPU-accelerated data curation and how does it work for LLM training?

GPU-accelerated data curation cleans and deduplicates large training datasets using GPU clusters. It targets multi-modal data workflows across text, image, video, and audio to improve data quality and reduce processing time.

Can I redact PII and filter unsafe content during dataset preparation?

Yes, you can redact PII and filter unsafe content during dataset preparation. The pipeline includes PII redaction to remove sensitive information and NSFW detection to flag unsafe content for review.

How do I apply quality filtering to web-scraped text and image data?

You can apply quality filtering to web-scraped text and image data using over 30 built-in heuristics. This filters low-quality content to prepare cleaned, RedPajama-like training data.

Do I need a GPU cluster to run multi-stage data curation pipelines?

Yes, you need a GPU cluster to run multi-stage data curation pipelines. The workflow is scalable to GPU clusters and uses Nemo Curator with RAPIDS to satisfy end-to-end pipeline requirements.

What's the best way to curate web-scraped training data at scale?

The best way to curate web-scraped training data at scale is running a multi-stage pipeline across a GPU cluster. This process handles quality filtering, various deduplication strategies, PII redaction, and safety checks simultaneously.