nemo-curator

Automate GPU-accelerated deduplication, quality filtering, and PII redaction for large training corpora.

Updated Apr 19, 2026
One-click install
npx skills add https://github.com/gqf2008/hermez-ai --skill nemo-curator-gqf2008
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/gqf2008/hermez-ai/tree/main/skills/mlops/nemo-curator
Command: npx skills add https://github.com/gqf2008/hermez-ai --skill nemo-curator-gqf2008

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

GPU-accelerated data curation for large multimodal training corpora, enabling fast, scalable cleaning, deduplication, redaction, and quality filtering for high-quality datasets.

Core Features & Use Cases

  • GPU-accelerated deduplication and quality filtering across text, image, video, and audio data
  • PII redaction and content quality controls to meet data governance needs
  • Scales across GPU clusters to prepare training data from web scrapes, open datasets, or large corpora for LLM training

Quick Start

Run a basic Nemo Curator pipeline to clean, deduplicate, and redact PII from your dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I accelerate data curation and deduplication for large multimodal LLM training corpora?

GPU-accelerated data curation automates the cleaning, deduplication, and quality filtering of large multimodal training corpora using RAPIDS for multi-GPU scaling. It enables fast, scalable preparation of web-scraped text, image, video, and audio data for high-quality LLM training.

Can I use GPU acceleration for PII redaction and quality filtering on web-scraped datasets?

Yes, GPU acceleration supports PII redaction and content quality controls across web-scraped datasets. The pipeline applies 30+ quality filters to meet data governance needs while scaling across GPU clusters to prepare large-scale training data efficiently.

What is the best way to perform semantic and fuzzy deduplication for LLM training data?

The best way to perform semantic and fuzzy deduplication for LLM training data is using a GPU-accelerated pipeline that supports exact, fuzzy, and semantic matching. This approach scales across multi-GPU clusters to efficiently remove duplicates from large corpora.

Does this data curation pipeline support stage-based workflows for multimodal collections?

Yes, the data curation pipeline supports stage-based workflows for multimodal collections including text, image, video, and audio data. It integrates 30+ quality filters, multi-level deduplication, and PII redaction within scalable, multi-GPU stage-based processing.

Why use GPU-accelerated RAPIDS for large-scale training data pipelines?

GPU-accelerated RAPIDS is used for large-scale training data pipelines to achieve fast, scalable data cleaning, deduplication, and quality filtering. It leverages multi-GPU clusters to process massive web-scraped datasets and multimodal collections efficiently for LLM training.

What are the limitations of CPU-based data curation for multimodal training corpora?

CPU-based data curation for multimodal training corpora faces significant scaling limitations compared to GPU-acceleration. Processing large-scale web scrapes with 30+ quality filters, semantic deduplication, and PII redaction requires multi-GPU scaling to maintain throughput and efficiency.