nemo-curator

Deduplicate and quality-filter multimodal training data with GPU-accelerated pipelines.

Updated May 20, 2026
One-click install
npx skills add https://github.com/SriRamkunamsetty/SITA2.0-HermesAgent --skill nemo-curator-sriramkunamsetty
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/SriRamkunamsetty/SITA2.0-HermesAgent/tree/main/hermes-agent/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/SriRamkunamsetty/SITA2.0-HermesAgent --skill nemo-curator-sriramkunamsetty

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

Nemo Curator accelerates the creation of high-quality ML training data by automating deduplication, quality filtering, PII redaction, and multimodal curation, drastically reducing manual data-cleaning effort.

Core Features & Use Cases

  • Fuzzy, semantic, and exact deduplication across text, image, video, and audio data for large-scale corpora.
  • 30+ quality filters and classifiers to improve dataset quality and safety (PII redaction, NSFW detection).
  • GPU-accelerated pipelines that scale across clusters to streamline end-to-end data curation for LLM training.

Quick Start

Run Nemo Curator on a multi-modal dataset to deduplicate, filter quality, redact PII, and output a clean Parquet dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
What is GPU-accelerated data curation for ML training?

GPU-accelerated data curation uses GPU clusters to automate deduplication, PII redaction, and quality filtering across large-scale multimodal datasets. It processes text, image, video, and audio data to improve dataset quality for LLM training pipelines.

How do I deduplicate multimodal datasets for LLM training?

You can deduplicate multimodal datasets by applying fuzzy, semantic, and exact deduplication across text, image, video, and audio data. This process scales across GPU clusters to clean large-scale corpora effectively.

Does this data curation approach support cross-format I/O like Parquet and JSONL?

Yes, multimodal data curation supports cross-format I/O for both Parquet and JSONL files. It processes these formats across text, image, video, and audio data while managing dependencies within modular GPU pipelines.

Can I apply PII redaction and NSFW detection during data curation?

Yes, you can apply PII redaction and NSFW detection during data curation. The process includes over 30 quality filters and classifiers to ensure dataset safety and improve overall quality for ML training.

What's the best way to scale data curation pipelines for large-scale corpora?

The best way to scale data curation pipelines is using GPU-accelerated execution across clusters. This approach streamlines end-to-end fuzzy and semantic deduplication, quality filtering, and multimodal processing for massive ML training datasets.

When should I use GPU-accelerated deduplication instead of manual data cleaning?

You should use GPU-accelerated deduplication when managing large-scale multimodal datasets where manual cleaning is impractical. It automates fuzzy, semantic, and exact deduplication alongside PII redaction to drastically reduce manual effort.