nemo-curator

Automates GPU-accelerated data curation for LLM training datasets with deduplication and quality filtering.

31|3|Updated May 7, 2026
One-click install
npx skills add https://github.com/markwang2658/hermes-windows-native --skill nemo-curator-markwang2658
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/markwang2658/hermes-windows-native/tree/main/hermes-agent/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/markwang2658/hermes-windows-native --skill nemo-curator-markwang2658

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes references (resource) components.

What problem does it solve?

GPU-accelerated data curation for large-scale LLM training datasets, enabling scalable cleaning, deduplication, and quality filtering across multi-modal data.

Core Features & Use Cases

  • Fuzzy and semantic deduplication for text, image, video, and audio datasets at scale.
  • 30+ quality filters to clean data and remove low-quality or harmful content.
  • PII redaction and NSFW detection to protect privacy and safety.
  • Multi-modal support and GPU acceleration to speed up preparation of training data.

Use cases include preparing curated training corpora, cleaning web data, and deduplicating large multimedia datasets for LLMs.

Quick Start

Install Nemo Curator to start a GPU-accelerated data-curation workflow on your dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large-scale multimodal datasets for LLM training?

GPU-accelerated data curation for LLM training automates deduplication across text, image, video, and audio datasets. It applies exact, fuzzy, and semantic deduplication techniques at scale using RAPIDS to clean large multimedia corpora.

What is the best way to clean web data and filter low-quality content for LLMs?

Cleaning web data for LLMs uses over 30 quality filtering heuristics to remove low-quality or harmful content. This data curation process ensures your training corpora meet high standards by applying GPU-accelerated quality filters.

Does GPU-accelerated data curation support PII redaction and NSFW detection?

GPU-accelerated data curation includes built-in PII redaction and NSFW detection to protect privacy and safety. These features automatically identify and remove sensitive or unsafe content from large-scale multimodal training datasets.

Can I use RAPIDS and Dask for cross-GPU scaling in data curation workflows?

Yes, data curation workflows achieve cross-GPU scaling using RAPIDS and Dask. This integration allows you to process large-scale LLM training datasets across multiple GPUs, significantly accelerating data cleaning and deduplication tasks.

Do I need Linux or macOS to run GPU-accelerated data curation for LLM training?

GPU-accelerated data curation for LLM training supports Linux and macOS environments. It requires dependencies on nemo-curator, cudf, dask, and rapids to execute scalable data preparation and quality filtering workflows.

How does fuzzy and semantic deduplication work for text and image datasets?

Fuzzy and semantic deduplication identifies and removes similar or contextually identical entries in text and image datasets. This GPU-accelerated process scales across multimodal data to ensure diverse and high-quality LLM training corpora.