nemo-curator

Curate large multimodal training datasets with GPU-accelerated deduplication and filtering.

Updated Aug 27, 2026
One-click install
npx skills add https://github.com/kotakbiasa/hermes-agent --skill nemo-curator-kotakbiasa
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/kotakbiasa/hermes-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/kotakbiasa/hermes-agent --skill nemo-curator-kotakbiasa

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

GPU-accelerated data curation organizes and cleans large training datasets for LLMs.

Core Features & Use Cases

  • Supports text, image, video, and audio data
  • Fuzzy and semantic deduplication; PII redaction; NSFW detection
  • Scales across GPUs with NVIDIA RAPIDS for large-scale data curation
  • Use cases: preparing high-quality training data, cleaning web data, deduplicating large corpora

Quick Start

Run Nemo Curator on your multimodal dataset to deduplicate, filter quality, redact PII, and detect NSFW content to prepare high-quality training data.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I clean large training datasets for LLMs?

GPU-accelerated data curation cleans large training datasets for LLMs by handling text, image, video, and audio formats. It performs fuzzy and semantic deduplication, quality filtering, PII redaction, and NSFW detection to prepare high-quality training data.

Does GPU-accelerated data curation work with multimodal datasets?

Yes, GPU-accelerated data curation works with multimodal datasets. It supports text, image, video, and audio data, allowing you to organize and clean diverse training corpora using modular pipelines for future extensions.

How do I deduplicate large corpora across GPUs?

You can deduplicate large corpora across GPUs using NVIDIA RAPIDS. GPU-accelerated data curation scales across GPUs to perform both fuzzy and semantic deduplication on large-scale datasets, ensuring corpus quality.

What is the best way to prepare high-quality training data from web data?

The best way to prepare high-quality training data from web data is using GPU-accelerated data curation. It cleans web data by applying quality filtering, PII redaction, and NSFW detection to ensure the resulting corpus is safe and effective for LLM training.

Can I redact PII and detect NSFW content during data curation?

Yes, you can redact PII and detect NSFW content during data curation. GPU-accelerated data curation integrates PII redaction and NSFW detection directly into the pipeline to ensure corpus quality and safety.