nemo-curator

Curate large-scale multimodal datasets with quality filtering, deduplication, and PII redaction.

Updated Feb 15, 2026
One-click install
npx skills add https://github.com/ricable/mcai --skill nemo-curator-ricable
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/ricable/mcai/tree/main/.agents/skills/nemo-curator
Command: npx skills add https://github.com/ricable/mcai --skill nemo-curator-ricable

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

This Skill removes the manual burden of cleaning large, messy datasets for AI training by automating quality filtering, deduplication, and sensitive-content removal at scale.

Core Features & Use Cases

  • Multimodal data curation: Handles text, image, video, and audio pipelines for training-data preparation.
  • High-quality filtering: Applies heuristic and classifier-based checks to remove low-value, repetitive, or unsafe content.
  • Exact, fuzzy, and semantic deduplication: Eliminates duplicate and near-duplicate records to improve dataset quality and reduce training bias.
  • Privacy and safety controls: Redacts PII and detects NSFW content before data is used in model training.
  • Use case: Clean a Common Crawl-style web corpus, deduplicate it, redact personal information, and export a curated Parquet dataset ready for LLM training.

Quick Start

Use the nemo-curator skill to load your dataset, apply filtering and deduplication, and save the cleaned output as a curated training corpus.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I clean and deduplicate large web-scraped datasets for LLM training?

To clean and deduplicate large web-scraped datasets for LLM training, you can automate quality filtering, exact and fuzzy deduplication, and PII redaction at scale using GPU-accelerated RAPIDS and Dask-based processing.

Can I use GPU acceleration for fuzzy and semantic deduplication on text corpora?

Yes, you can use GPU acceleration for fuzzy and semantic deduplication on text corpora. The process utilizes RAPIDS and Dask to scale deterministic dataset cleaning and semantic similarity removal across very large multimodal corpora.

Does this data curation tool support PII redaction and NSFW detection for multimodal data?

Yes, this data curation tool supports PII redaction and NSFW detection for multimodal data. It applies privacy and safety controls to redact personal information and screen unsafe content across text, image, video, and audio pipelines.

What is the best way to filter low-quality content from a Common Crawl corpus?

The best way to filter low-quality content from a Common Crawl corpus is applying heuristic and classifier-based checks. This removes low-value, repetitive, or unsafe content, exporting a curated Parquet dataset ready for LLM training.

Do I need RAPIDS and Dask to process multimodal training data for AI models?

Yes, you need RAPIDS and Dask to process multimodal training data for AI models at scale. These GPU-accelerated frameworks are required to scale deterministic dataset cleaning across very large text, image, video, and audio corpora.