nemo-curator

Automate multi-modal data curation for LLM training with deduplication and filtering.

1|1|Updated May 25, 2026
One-click install
npx skills add https://github.com/aayushsoam/clawbot-agent --skill nemo-curator-aayushsoam
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/aayushsoam/clawbot-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/aayushsoam/clawbot-agent --skill nemo-curator-aayushsoam

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes scripts (resource) and references (resource) and assets (resource) components.

What problem does it solve?

Nemo Curator addresses the challenge of preparing high-quality training data for Large Language Models (LLMs) by offering fast and efficient data curation features, including deduplication, quality filtering, and redaction.

Core Features & Use Cases

  • Multi-Modal Curation: Supports text, image, video, and audio data types for LLM training.
  • Fuzzy Deduplication: 16× faster than CPU for deduplication, handling large corpora with precision.
  • Quality Filtering: Employ over 30 heuristic filters for quality assurance and data cleanup.
  • Semantic Deduplication: Remove semantically similar documents with high accuracy.
  • PII Redaction: Safely redact sensitive personal information (PII) to ensure privacy.
  • NSFW Detection: Identifies and filters out inappropriate content.
  • Use Case: Utilize Nemo Curator to curate large datasets for training NLP models, enhancing their accuracy and reducing bias.

Quick Start

To start using Nemo Curator, first install it with uv pip install nemo-curator. Then, run a simple text curation pipeline like this:

python
from nemo_curator import ScoreFilter, Modify
from nemo_curator.datasets import DocumentDataset
import pandas as pd

# Load data
df = pd.DataFrame({"text": ["Good document", "Bad doc", "Excellent text"]})
dataset = DocumentDataset(df)

# Quality filtering
def quality_score(doc):
    return len(doc["text"].split()) > 5  # Filter short docs

filtered = ScoreFilter(quality_score)(dataset)

# Deduplication
from nemo_curator.modules import ExactDuplicates
deduped = ExactDuplicates()(filtered)

# Save
deduped.to_parquet("curated_data/")

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I prepare high-quality training data for Large Language Models?

To prepare training data for Large Language Models, you need automated curation pipelines that perform text deduplication, quality filtering, and PII redaction to ensure high-throughput data cleanup and privacy preservation.

How does fuzzy deduplication work for large text corpora?

Fuzzy deduplication for large text corpora works by utilizing MinHash and LSH algorithms to identify and remove similar documents, achieving high-throughput processing that is 16 times faster than standard CPU methods.

Can I use GPU acceleration for data curation and deduplication?

You can use GPU acceleration for data curation by leveraging RAPIDS and cuDF frameworks, which enable fuzzy and semantic deduplication processes to run 16 times faster than traditional CPU-based approaches.

What is the best way to redact personally identifiable information from NLP datasets?

The best way to redact personally identifiable information from NLP datasets is to apply automated PII redaction filters during the data curation pipeline, ensuring sensitive data is safely removed before model training.

Does Nemo Curator support multi-modal data curation for image and video datasets?

Nemo Curator supports multi-modal data curation for image, video, and audio datasets, extending its Large Language Model training data preparation capabilities beyond text to diverse data types.

What are the limitations of semantic deduplication for training data preparation?

While semantic deduplication removes semantically similar documents with high accuracy, it requires neural network models and GPU dependencies like RAPIDS, making it resource-intensive for simple data preparation tasks.