nemo-curator

Automate GPU-accelerated curation of multimodal LLM training datasets.

Updated Aug 23, 2026
One-click install
npx skills add https://github.com/objval/hermes-agent --skill nemo-curator-objval
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/objval/hermes-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/objval/hermes-agent --skill nemo-curator-objval

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

GPU-accelerated data curation for LLM training. Supports text/image/video/audio. Features fuzzy deduplication (16× faster), quality filtering (30+ heuristics), semantic deduplication, PII redaction, NSFW detection. Scales across GPUs with RAPIDS. Use for preparing high-quality training datasets, cleaning web data, or deduplicating large corpora.

Core Features & Use Cases

  • GPU-accelerated deduplication (exact, fuzzy, semantic) for large-scale datasets
  • multimodal quality filtering (text, image, video, audio) with 30+ heuristics
  • PII redaction and NSFW detection to sanitize data
  • scalable pipelines across GPU clusters using RAPIDS, Dask, and Nemo
  • Use case: curate RedPajama-like training data from web scrapes for safe model fine-tuning

Quick Start

Run the Nemo Curator pipeline on your dataset to produce a cleaned, de-duplicated, and redacted version ready for model fine-tuning.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large-scale multimodal datasets for LLM training?

GPU-accelerated data curation applies exact, fuzzy, and semantic deduplication to multimodal datasets. It processes text, image, video, and audio data across distributed GPU clusters to prepare cleaned training corpora.

How do I redact PII and detect NSFW content in web scrape data?

PII redaction and NSFW detection sanitize web scrape data by identifying and removing sensitive or unsafe content. This ensures the resulting Parquet or JSONL datasets are safe for LLM fine-tuning.

Can I scale data curation pipelines across distributed GPU clusters?

Yes, data curation pipelines scale across distributed GPU clusters using RAPIDS and Dask. This architecture processes massive datasets by applying quality filtering and deduplication efficiently across multiple GPUs.

What is the best way to apply quality filtering to training corpora?

The best way to apply quality filtering is using over 30 built-in heuristics tailored for multimodal data. This automates the cleaning of web data to produce high-quality training datasets.

Does GPU-accelerated fuzzy deduplication work with Parquet and JSONL formats?

Yes, fuzzy deduplication works with Parquet and JSONL formats. The pipeline reads and writes these formats while running 16 times faster than standard methods by leveraging RAPIDS and Dask.

Do I need GPU clusters to run NeMo Curator for data cleaning?

You need GPU clusters to achieve GPU-accelerated data curation and scale fuzzy deduplication across large corpora. The system leverages RAPIDS and Dask to distribute the workload across available GPUs.