nemo-curator

Curate multimodal LLM training data with GPU-accelerated filtering, deduplication, and redaction.

Updated Apr 21, 2026
One-click install
npx skills add https://github.com/samuelmukoti/myai-agent --skill nemo-curator-samuelmukoti
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/samuelmukoti/myai-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/samuelmukoti/myai-agent --skill nemo-curator-samuelmukoti

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

Preparing high-quality training data for large language models requires extensive cleaning, deduplication, privacy checks, and multimodal processing. Nemo Curator accelerates this workflow by leveraging GPU-accelerated pipelines to filter, deduplicate, redact PII, and detect NSFW content across text, image, video, and audio data.

Core Features & Use Cases

  • GPU-accelerated quality filtering (30+ heuristics) and best-practice data curation for scalable LLM training datasets.
  • Exact, fuzzy, and semantic deduplication across multi-modal data sources to reduce redundancy.
  • PII redaction and NSFW detection to ensure safer training data and compliance.
  • Multi-node, GPU-accelerated processing to scale curation for web-scraped corpora (e.g., The Pile, RedPajama).

Quick Start

Invoke Nemo Curator to load a dataset and run the deduplication and quality filters to produce a curated Parquet dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I curate large-scale multimodal data for LLM training?

You can curate large-scale multimodal data for LLM training by applying GPU-accelerated quality filters, deduplication, and PII redaction across text, image, video, and audio sources to produce clean datasets.

What is the best way to deduplicate web-scraped corpora like RedPajama?

The best way to deduplicate web-scraped corpora is using GPU-accelerated exact, fuzzy, and semantic deduplication across multimodal data sources to reduce redundancy and yield a curated Parquet dataset.

How does GPU acceleration help with data curation for LLMs?

GPU acceleration helps data curation by scaling quality filtering and deduplication pipelines across multi-node GPU clusters to process large web-derived corpora efficiently.

Can I redact PII and detect NSFW content during dataset preprocessing?

Yes, you can redact PII and detect NSFW content during dataset preprocessing to ensure safer training data and compliance with privacy safeguards.

Does this data curation pipeline support audio and video formats?

Yes, this GPU-accelerated data curation pipeline supports diverse multimodal data sources including text, images, video, and audio formats.

Do I need GPU clusters to run quality filters on training datasets?

You need GPU clusters to scale curation for large web-derived corpora, as the 30+ heuristic quality filters and deduplication pipelines are designed for multi-node GPU-accelerated processing.