nemo-curator

Automate GPU-accelerated multimodal data curation with deduplication and filtering.

1|1|Updated Apr 26, 2026
One-click install
npx skills add https://github.com/BermudaLocals/hermes-agent-lite --skill nemo-curator-bermudalocals
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/BermudaLocals/hermes-agent-lite/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/BermudaLocals/hermes-agent-lite --skill nemo-curator-bermudalocals

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

prepares high-quality training data for LLMs by automating the curation, deduplication, and redaction of multimodal data.

Core Features & Use Cases

  • GPU-accelerated fuzzy, exact, and semantic deduplication for large datasets
  • 30+ quality filters and NSFW/PII redaction for safer training data
  • Multimodal support (text, image, video, audio) with RAPIDS-based scaling
  • Use cases include cleaning web-scraped corpora, deduplicating copies across sources, and curating datasets for model training

Quick Start

Install Nemo Curator and run a sample curation pipeline to prepare a multimodal dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate multimodal datasets for LLM training?

You can deduplicate multimodal datasets for LLM training using GPU-accelerated fuzzy, exact, and semantic deduplication. This process scales across text, image, video, and audio sources using RAPIDS-backed tools to identify and remove duplicate records efficiently.

What is GPU-accelerated data curation for LLM training?

GPU-accelerated data curation for LLM training automates the preparation of high-quality datasets using RAPIDS-backed tools. It applies 30+ quality filters, deduplication, PII redaction, and NSFW detection across multimodal data sources to ensure safer model training.

Can I use RAPIDS for PII redaction and NSFW detection in text corpora?

Yes, you can use RAPIDS-backed tools to perform PII redaction and NSFW detection on text corpora. This workflow applies quality filtering and redaction during the data curation process to produce safer training data for LLMs.

Does GPU-accelerated data curation support web-scraped text and image sources?

GPU-accelerated data curation supports web-scraped text and image sources, alongside video and audio data. It cleans these multimodal inputs by applying quality filters and deduplicating copies across different sources for model training preparation.

What is the best way to scale quality filtering across large multimodal datasets?

The best way to scale quality filtering across large multimodal datasets is using GPU-accelerated workflows with RAPIDS. This approach applies 30+ quality filters and semantic deduplication efficiently, preparing high-quality training data across text, image, video, and audio formats.

Why use semantic deduplication when preparing LLM training data?

Semantic deduplication is used when preparing LLM training data to identify and remove contextually similar records, not just exact matches. This GPU-accelerated process improves dataset quality and reduces redundancy across large multimodal sources before model training.