nemo-curator

Accelerate LLM training data curation on GPU clusters with NeMo Curator.

Updated Aug 23, 2026
One-click install
npx skills add https://github.com/AlexKoncept/omnia-hub --skill nemo-curator-alexkoncept
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/AlexKoncept/omnia-hub/tree/main/HERMES/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/AlexKoncept/omnia-hub --skill nemo-curator-alexkoncept

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

GPU-accelerated data curation for large multimodal datasets used in LLM training, enabling scalable, high-quality data preparation on GPU clusters.

Core Features & Use Cases

  • Fuzzy deduplication: up to 16× faster on GPU for near-duplicate removal across huge datasets.
  • Quality filtering: 30+ heuristics to clean, filter, and improve data quality for model training.
  • Semantic deduplication and PII redaction: reduce redundancy while protecting sensitive information.
  • NSFW detection and multi-modal support: handles text, image, video, and audio data at scale.
  • Use Cases: prepare training data from web scrapes, clean product datasets, and deduplicate large document collections.

Quick Start

Install NeMo Curator, configure a dataset, and run the data-curation pipeline to begin cleaning and deduplicating.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I accelerate data deduplication for large LLM training datasets?

Data curation on GPU clusters accelerates preparing high-quality LLM training data by applying 30+ quality filters and exact, fuzzy, and semantic deduplication, enabling scalable cleaning across text, image, video, and audio formats.

Does GPU-accelerated data cleaning support PII redaction and NSFW detection?

Yes, GPU-accelerated data cleaning supports PII redaction and NSFW detection to remove sensitive information and explicit content, ensuring multimodal training datasets remain secure and high-quality at scale.

Can I use multimodal data curation for text, image, video, and audio datasets?

Multimodal data curation handles text, image, video, and audio datasets by applying quality filtering and deduplication across GPU clusters, allowing you to prepare large-scale diverse training data for LLMs.

What is the best way to clean web scrape data for LLM training?

GPU-accelerated data curation is the best way to clean web scrape data for LLM training, applying 30+ quality heuristics and fuzzy deduplication at scale to filter and remove near-duplicates efficiently.

Do I need a GPU cluster to run multimodal data curation pipelines?

A GPU cluster is required to fully leverage RAPIDS-powered GPU acceleration for multimodal data curation, which enables high-speed fuzzy deduplication, quality filtering, and PII redaction across large-scale datasets.