nemo-curator

Automate GPU-accelerated curation of large-scale multimodal datasets for LLM training.

Updated Mar 26, 2026
One-click install
npx skills add https://github.com/cloudliness/Hermes-Autonomous-AI-Agent-Dialed-In-For-Windows-11 --skill nemo-curator-cloudliness
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/cloudliness/Hermes-Autonomous-AI-Agent-Dialed-In-For-Windows-11/tree/main/skills/mlops/evaluation/nemo-curator
Command: npx skills add https://github.com/cloudliness/Hermes-Autonomous-AI-Agent-Dialed-In-For-Windows-11 --skill nemo-curator-cloudliness

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

Curates and optimizes large-scale training data for LLMs by removing duplicates, filtering low-quality content, redacting sensitive data, and detecting NSFW content across text, image, video, and audio modalities to improve model performance, safety, and training efficiency.

Core Features & Use Cases

  • Exact, fuzzy, and semantic deduplication to reduce redundancy in web-scraped and internal corpora.
  • 30+ quality filters for automated data cleansing, including language, content quality, and formatting checks.
  • PII redaction and NSFW detection to protect privacy and maintain compliance.
  • Multimodal support enabling curation of text, images, video, and audio data at scale.
  • GPU-accelerated processing with RAPIDS for fast, cost-effective pipelines across large datasets.

Use cases include preparing high-quality training data from web datasets, cleaning noisy multi-terabyte corpora, and deduplicating duplicates to improve model performance and efficiency.

Quick Start

Install nemo-curator in your environment and run a basic data curation pipeline on your dataset to produce a cleaned training set.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large-scale LLM training data?

Deduplicate large-scale LLM training data using GPU-accelerated exact, fuzzy, and semantic deduplication to remove redundancy from web-scraped and internal corpora. This reduces multi-terabyte dataset sizes and improves model training efficiency.

What is the best way to redact PII from multimodal datasets?

Redact PII from multimodal datasets using automated GPU-accelerated PII redaction to protect privacy and maintain compliance across text, images, video, and audio. This ensures sensitive data is removed before LLM training.

Does GPU-accelerated data curation support Parquet and JSONL formats?

GPU-accelerated data curation supports Parquet, JSONL, and CSV formats for processing large-scale multimodal datasets. This allows seamless integration with existing data pipelines using RAPIDS for fast, cost-effective processing.

Can I filter NSFW content from text and image corpora automatically?

Filter NSFW content from text and image corpora automatically using built-in NSFW detection during the data curation pipeline. This removes inappropriate content to maintain safety and compliance across multimodal training datasets.

What quality filters are available for cleaning noisy web-scraped training data?

Over 30 quality filters are available for cleaning noisy web-scraped training data, including automated checks for language, content quality, and formatting. These filters cleanse multi-terabyte corpora to improve LLM performance.

When should I use GPU-acceleration for multimodal data curation pipelines?

Use GPU-acceleration for multimodal data curation pipelines when processing multi-terabyte corpora across text, images, video, and audio. RAPIDS integration provides fast, cost-effective processing required for large-scale LLM training data preparation.