nemo-curator

Filter, deduplicate, and redact PII from large multimodal datasets.

Updated Apr 12, 2026
One-click install
npx skills add https://github.com/DaddyElonMusk69/motis-agent --skill nemo-curator-daddyelonmusk69
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/DaddyElonMusk69/motis-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/DaddyElonMusk69/motis-agent --skill nemo-curator-daddyelonmusk69

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes references (resource) components.

What problem does it solve?

Large-scale training data is noisy, duplicated, and costly to curate, slowing model development. Nemo Curator provides GPU-accelerated data curation to accelerate quality filtering, deduplication, and multimodal data preparation.

Core Features & Use Cases

  • Quality filtering: 30+ heuristics and classifiers to improve data quality.
  • Deduplication: exact, fuzzy, and semantic deduplication across multimodal data.
  • PII redaction & privacy: automated redaction of sensitive information.
  • Use Case: Prepare RedPajama-like training corpora or curated common crawl datasets for safer model training.

Quick Start

Run Nemo Curator on your dataset to produce a clean, deduplicated, and redacted training corpus.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large multimodal datasets for LLM training?

Deduplicate large multimodal datasets for LLM training using GPU-accelerated exact, fuzzy, and semantic matching. This eliminates duplicate records across text, image, video, and audio pipelines to produce a clean training corpus.

What is GPU-accelerated data curation and how does it work for LLM training?

GPU-accelerated data curation is the process of using parallel processing to filter noisy, low-quality data. It applies stage-based quality heuristics and classifiers to accelerate reliable multimodal model training at scale.

Can I automate PII redaction on training corpora before model training?

Automate PII redaction on training corpora to remove sensitive information before model training. This privacy feature safely processes large text datasets, including RedPajama-like corpora, ensuring compliant data preparation.

Does GPU-accelerated data curation require RAPIDS and Dask to process large datasets?

GPU-accelerated data curation requires RAPIDS, cuDF, and Dask to process large datasets. These dependencies enable distributed GPU processing, ensuring cross-modal compatibility and scalable data preparation.

What is the best way to filter low-quality text from common crawl datasets?

Filter low-quality text from common crawl datasets by applying over 30 quality heuristics and classifiers. This stage-based quality filtering eliminates noisy data, accelerating reliable model training and reproducible curation.

Why is data curation necessary for multimodal LLM pipelines?

Data curation is necessary for multimodal LLM pipelines because large-scale training data is noisy, duplicated, and costly. Curation eliminates low-quality data across text, image, video, and audio formats to accelerate model development.