nemo-curator

Curate multimodal training corpora with deduplication, filtering, and PII redaction.

Updated Aug 27, 2026
One-click install
npx skills add https://github.com/big4council-prog/b4c-agent --skill nemo-curator-big4council-prog
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/big4council-prog/b4c-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/big4council-prog/b4c-agent --skill nemo-curator-big4council-prog

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

Curating noisy, duplicate, and unsafe web-scale data into high-quality multimodal training datasets is slow and error-prone, which can degrade LLM performance.

Core Features & Use Cases

  • GPU-Accelerated Multimodal Curation: Clean and filter text plus images, video, and audio using NVIDIA/NeMo Curator-style pipelines.
  • Fuzzy & Semantic Deduplication: Remove exact, near-duplicate, and semantically similar samples using GPU-accelerated approaches (fuzzy MinHash/LSH and embedding-based methods).
  • Safety and Quality Controls: Apply PII redaction and NSFW detection alongside 30+ heuristic quality filters to reduce harmful or identifying content.
  • Use Case: Clean and deduplicate a Common Crawl-derived dataset before fine-tuning or pretraining, producing a curated Parquet/JSONL corpus ready for training.

Quick Start

Use nemo-curator to curate your input Parquet/JSONL dataset by running quality filtering, deduplicating, and then exporting the cleaned corpus to Parquet for LLM training.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate and clean a Common Crawl dataset for LLM training?

To clean a Common Crawl dataset for LLM training, you apply GPU-accelerated fuzzy MinHash/LSH and semantic deduplication alongside heuristic quality filters. This removes near-duplicates and low-quality text, outputting a curated Parquet/JSONL corpus ready for fine-tuning.

What is GPU-accelerated dataset curation and when do I need it for multimodal data?

GPU-accelerated dataset curation uses RAPIDS, cuDF, and Dask to process large multimodal corpora at scale. You need it when cleaning web-scale text, images, video, or audio data where CPU-based processing becomes a bottleneck for deduplication and filtering.

Do I need RAPIDS and cuDF support to run fuzzy and semantic deduplication pipelines?

Yes, GPU acceleration with RAPIDS, cuDF, and Dask support is required to run the fuzzy and semantic deduplication pipelines. These frameworks provide the necessary parallel processing power to handle exact, near-duplicate, and embedding-based deduplication at scale.

How do I redact PII and filter NSFW content from web-scraped training corpora?

You redact PII and filter NSFW content by applying built-in safety controls during the curation pipeline. The system automatically detects and redacts sensitive identifying information while removing disallowed NSFW data using 30+ heuristic quality filters.

Can I use this approach to curate image and video datasets alongside text?

Yes, you can curate multimodal datasets containing images, video, and audio alongside text. The pipeline applies the same GPU-accelerated deduplication, quality filtering, and safety controls to clean assets and produce a unified training corpus.

What's the best way to remove semantically similar samples from large pretraining datasets?

The best way to remove semantically similar samples is using GPU-accelerated embedding-based deduplication methods. This approach identifies and filters semantic duplicates alongside exact and fuzzy matches, ensuring high-quality and diverse data for pretraining.