nemo-curator

Filter, deduplicate, and redact large Parquet corpora on GPUs.

Updated May 2, 2026
One-click install
npx skills add https://github.com/qcmuu/AI-Research-Skills --skill nemo-curator-qcmuu
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/qcmuu/AI-Research-Skills/tree/main/05-data-processing/nemo-curator
Command: npx skills add https://github.com/qcmuu/AI-Research-Skills --skill nemo-curator-qcmuu

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes references (resource) components.

What problem does it solve?

NeMo Curator eliminates the time-consuming work of cleaning, filtering, and deduplicating massive web-scale datasets so your LLM training corpus is higher quality and safer.

Core Features & Use Cases

  • GPU-accelerated data curation: Runs high-throughput curation workflows on NVIDIA GPUs using RAPIDS to reduce cost and wall-clock time.
  • Quality filtering with heuristics and classifiers: Applies 30+ filtering heuristics and optional quality/NSFW classifiers to remove low-quality content.
  • Multi-strategy deduplication: Performs exact, fuzzy (MinHash + LSH), and semantic (embedding-based) deduplication to remove duplicates and near-duplicates.
  • PII redaction and multimodal support: Redacts personally identifiable information and supports text and multimodal inputs (image/video/audio).

Quick Start

Use the nemo-curator skill to run a GPU curation pipeline that filters, deduplicates, and redacts a large Parquet corpus into a cleaned output dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate and clean large Parquet datasets for LLM training?

You can clean and deduplicate Parquet datasets for LLM training by applying GPU-accelerated quality filtering, multi-strategy deduplication, and PII redaction to produce high-quality, training-ready outputs.

What is the best way to filter low-quality content from Common Crawl data?

Filtering low-quality content from Common Crawl data is best achieved by applying over 30 heuristic filters and optional quality classifiers to remove undesirable text before model training.

Does GPU acceleration with RAPIDS improve data curation throughput for multimodal inputs?

GPU acceleration with RAPIDS significantly improves data curation throughput by running high-throughput workflows across single- and multi-GPU settings for text and multimodal inputs.

How do I redact personally identifiable information before training language models?

To redact personally identifiable information before training, you apply PII redaction modules during the data curation pipeline, ensuring privacy-safe preprocessing across your web-scale corpora.

Can I perform fuzzy and semantic deduplication on web-scale corpora?

You can perform fuzzy deduplication using MinHash and LSH, alongside semantic embedding-based deduplication, to effectively remove exact and near-duplicates from web-scale corpora.

Do I need NVIDIA GPUs to run the nemo-curator data curation pipeline?

You need NVIDIA GPUs because the curation pipeline requires RAPIDS-based execution and dependencies like cudf and dask to accelerate the filtering and deduplication workflows.