dataset-curator

Plans and executes ML/LLM dataset creation and curation workflows.

4|1|Updated Mar 18, 2026
One-click install
npx skills add https://github.com/xcrrr/claude-skills --skill dataset-curator
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: dataset-curator
Source: https://github.com/xcrrr/claude-skills/tree/main/skills/ai-ml/dataset-curator
Command: npx skills add https://github.com/xcrrr/claude-skills --skill dataset-curator

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

This skill covers the full lifecycle of dataset creation and curation for machine learning and LLM tasks. It addresses dataset schema design, data collection strategies, quality filtering, deduplication, class imbalance mitigation, stratified train/val/test splits, annotation guideline writing, and dataset card documentation. Good datasets are the foundation of reliable models — this skill helps teams avoid the most common data quality pitfalls that lead to poor generalization, evaluation leakage, and biased models.

Core Features & Use Cases

  • Define dataset schema, data collection strategy, quality filtering, deduplication, class imbalance mitigation, and documentation through dataset cards.
  • Audit an existing dataset for quality, coverage, and potential biases.
  • Use across ML teams to plan, curate, and document datasets for model training and evaluation.

Quick Start

Define the dataset schema, collection plan, annotation guidelines, deduplication strategy, and stratified train/val/test splits for a new dataset.

Frequently Asked Questions about dataset-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I design a dataset schema and annotation guidelines for machine learning?

Dataset schema and annotation guidelines require explicit field definitions, quality filtering rules, and deduplication strategies to ensure reproducible machine learning training data. This structured approach mitigates class imbalance and prevents evaluation leakage.

What is the best way to handle class imbalance and data deduplication in ML datasets?

Handling class imbalance and data deduplication involves applying quality filtering and mitigation strategies during dataset curation. This ensures clean, balanced training data, preventing biased models and poor generalization caused by duplicate or skewed samples.

How do I create reproducible train, validation, and test splits for LLM tasks?

Creating reproducible train, validation, and test splits requires stratified data partitioning during dataset curation. This ensures consistent evaluation and prevents leakage by maintaining class distributions across splits, which is critical for reliable LLM model assessment.

Can I audit an existing dataset for quality, coverage, and potential biases?

You can audit an existing dataset for quality, coverage, and potential biases by applying curation steps like quality filtering and deduplication. This process identifies data gaps and leakage, ensuring the dataset meets reliability standards for model training.

Do I need dataset cards and documentation for machine learning dataset curation?

Dataset cards and documentation are required for machine learning dataset curation to ensure reproducibility and transparency. They capture schema definitions, annotation guidelines, and auditing steps, which prevent poor generalization and biased model outcomes.

Why does my ML model generalize poorly despite having a large training dataset?

Poor generalization often stems from dataset quality issues like duplicates, class imbalance, or evaluation leakage. Applying dataset curation practices such as quality filtering, deduplication, and stratified splits resolves these foundational data pitfalls.