One-click install
npx skills add https://github.com/davpatel605-beep/hermusagent --skill nemo-curator-davpatel605-beep
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/davpatel605-beep/hermusagent/tree/main/backend/vendor/hermes/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/davpatel605-beep/hermusagent --skill nemo-curator-davpatel605-beep

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

This Skill solves the challenge of preparing massive, noisy datasets for LLM training by automating data cleaning, filtering, deduplication, and privacy processing.

Core Features & Use Cases

  • Dataset Quality Filtering: Applies heuristic and classifier-based filters to remove low-quality, repetitive, or unsafe training data.
  • GPU-Accelerated Deduplication: Performs exact, fuzzy, and semantic deduplication across large text, image, video, and audio datasets.
  • Use Case: Prepare web-scale training corpora by filtering Common Crawl data, removing duplicates, redacting PII, and generating curated datasets for model training.

Quick Start

Use the nemo-curator skill to clean and deduplicate my LLM training dataset while applying quality filters and PII redaction.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I clean and deduplicate large-scale datasets for LLM training?

To clean and deduplicate large-scale datasets for LLM training, apply heuristic and classifier-based quality filters to remove low-quality content, then use exact, fuzzy, and semantic deduplication across your text, image, video, and audio data.

What is GPU-accelerated data curation for web corpus preparation?

GPU-accelerated data curation uses distributed processing to rapidly filter noisy web corpus data, remove duplicate entries, and redact personally identifiable information (PII) at scale, generating high-quality inputs for model training.

Can I apply PII redaction and quality filtering to multimodal datasets?

Yes, you can apply PII redaction and quality filtering to multimodal datasets, as the curation workflows support scalable processing across large text, image, video, and audio corpora simultaneously.

Do I need GPU acceleration for dataset deduplication and quality filtering?

GPU acceleration is required for dataset deduplication and quality filtering to efficiently process massive, web-scale training corpora and perform distributed computing tasks across large text and multimodal datasets.

What's the best way to prepare Common Crawl data for LLM training?

The best way to prepare Common Crawl data for LLM training is to automate data cleaning by filtering low-quality content, removing duplicates, and applying PII redaction to generate a curated training dataset.