nemo-curator

Automate GPU-accelerated filtering, deduplication, PII redaction, and NSFW detection on multimodal datasets.

Updated Jun 28, 2026
One-click install
npx skills add https://github.com/jleechanorg/hermes-agent --skill nemo-curator-jleechanorg
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/jleechanorg/hermes-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/jleechanorg/hermes-agent --skill nemo-curator-jleechanorg

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

Data scientists and ML engineers spend enormous time preparing high-quality, multimodal training data; Nemo Curator provides GPU-accelerated tooling to automate filtering, deduplication, redaction, and NSFW checks across text, image, video, and audio data, enabling scalable datasets for large language models.

Core Features & Use Cases

  • 30+ quality filters for text; exact, fuzzy, and semantic deduplication; PII redaction; NSFW detection; multi-modal support; GPU acceleration; distributed processing.
  • Use cases include preparing large-scale datasets like RedPajama v2 and The Pile, cleaning web-scraped data, and producing production-ready Parquet/JSONL datasets for model training.

Quick Start

Install Nemo Curator and run a GPU-accelerated data-curation pipeline on your dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I automate GPU-accelerated data curation for LLM training?

GPU-accelerated data curation automates quality filtering, deduplication, PII redaction, and NSFW detection on large-scale multimodal datasets. This process uses distributed processing to clean web-scraped text, images, video, and audio, yielding production-ready Parquet or JSONL datasets.

What is the best way to clean web-scraped data for multimodal datasets?

Cleaning web-scraped data for multimodal datasets requires applying 30+ quality filters, exact and fuzzy deduplication, and NSFW detection. GPU acceleration enables scalable distributed processing across text, image, video, and audio formats to ensure high-quality training corpora.

Does GPU-accelerated data curation support both text and image modalities?

Yes, GPU-accelerated data curation supports multimodal datasets including text, image, video, and audio. It applies quality classifiers, deduplication, and PII redaction uniformly across these formats to prepare large-scale corpora for language model training.

How do I remove duplicate entries and redact PII in large-scale training corpora?

To remove duplicates and redact PII in large-scale training corpora, apply exact, fuzzy, and semantic deduplication alongside automated PII redaction modules. GPU acceleration ensures these distributed classifiers process massive datasets efficiently.

Can I use distributed data curation to prepare datasets like RedPajama or The Pile?

Yes, distributed data curation is designed to prepare large-scale datasets like RedPajama v2 and The Pile. GPU-accelerated modules handle quality filtering and multimodal classification to produce reproducible, high-quality training data.

What output formats does GPU-accelerated data curation produce for model training?

GPU-accelerated data curation outputs production-ready Parquet and JSONL datasets for model training. After applying quality filters, deduplication, and PII redaction, the system exports clean multimodal data suitable for immediate LLM consumption.