nemo-curator

Curates LLM training data with GPU-accelerated deduplication, filtering, and PII redaction workflows.

Updated Mar 24, 2026
One-click install
npx skills add https://github.com/1thirteeng3/greenmoire --skill nemo-curator-1thirteeng3
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/1thirteeng3/greenmoire/tree/main/integrations/hermes-agent/skills/mlops/evaluation/nemo-curator
Command: npx skills add https://github.com/1thirteeng3/greenmoire --skill nemo-curator-1thirteeng3

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

GPU-accelerated data curation for LLM training. Supports multi-modal data (text, image, video, audio) and scalable GPU clusters, enabling fast deduplication, quality filtering, semantic deduplication, PII redaction, and NSFW detection to produce high-quality training datasets.

Core Features & Use Cases

  • Fuzzy deduplication (16× faster on GPU) for large corpora
  • Quality filtering using 30+ heuristics to improve data quality
  • Semantic deduplication and PII redaction across modalities
  • Scales across RAPIDS-enabled GPUs for large-scale pipelines
  • Use cases include cleaning web data, deduplicating corpora, and preparing multi-modal datasets for LLM training

Quick Start

Install Nemo Curator and run a basic deduplication and quality-filter pipeline on your dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I accelerate fuzzy deduplication for large LLM training corpora?

GPU-accelerated fuzzy deduplication processes large LLM training corpora 16× faster by scaling across RAPIDS-enabled GPU clusters. It identifies and removes near-duplicate entries to improve dataset quality and training efficiency.

Can I perform PII redaction and quality filtering on multi-modal datasets?

Yes, PII redaction and quality filtering support multi-modal datasets including text, image, video, and audio. The pipeline applies over 30 heuristics to filter data quality and redact sensitive information across all modalities.

What data formats does GPU-accelerated data curation support for input and output?

GPU-accelerated data curation supports flexible I/O using Parquet, JSONL, and CSV formats. This allows seamless integration with existing data pipelines for reading raw data and writing curated datasets.

Do I need RAPIDS-enabled GPUs to run data curation workflows for LLM training?

Yes, RAPIDS-backed GPU acceleration is required to run these data curation workflows efficiently. It enables modular stages like quality filtering, deduplication, and redaction to scale across large web-scraped corpora.

What is the best way to clean web-scraped data for LLM training at scale?

The best way to clean web-scraped data for LLM training is using a modular pipeline with semantic deduplication, NSFW detection, and quality filtering. This approach scales across GPU clusters to produce high-quality training datasets.

How does semantic deduplication work for multi-modal data?

Semantic deduplication removes conceptually similar entries across multi-modal data like text, images, and video. It works alongside exact and fuzzy deduplication within the GPU-accelerated pipeline to ensure diverse training data.