dataset-curation

Curate AI training datasets for quality, coverage, and quantity.

1|Updated Jun 4, 2026
One-click install
npx skills add https://github.com/hung-phan/ml-skills --skill dataset-curation-hung-phan
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: dataset-curation
Source: https://github.com/hung-phan/ml-skills/tree/main/skills/ml-review/references/data-prep/dataset-curation
Command: npx skills add https://github.com/hung-phan/ml-skills --skill dataset-curation-hung-phan

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes scripts (resource) and references (resource) components.

What problem does it solve?

This Skill helps curate and synthesize high-quality datasets for AI training, addressing data quality, coverage, and quantity concerns.

Core Features & Use Cases

  • Data Quality: Ensures relevance, alignment, consistency, correct formatting, uniqueness, and compliance.
  • Data Coverage: Balances domain, format, length, language, locale, and task type coverage.
  • Data Quantity: Determines optimal data size based on training phase and model requirements.
  • Use Case: When preparing instruction-tuning data, generating synthetic data, building pretraining or RAG corpora, or debugging data-driven quality issues.

Quick Start

Use the dataset-curation skill to evaluate the quality of your dataset before using it for AI training.

Frequently Asked Questions about dataset-curation

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I improve dataset quality and diversity for AI training?

To improve dataset quality and diversity for AI training, you must ensure data relevance, alignment, and consistency while balancing domain, format, and task coverage. This involves applying data deduplication, filtering techniques, and continuous manual inspection.

What is the best way to balance data coverage and quantity for instruction tuning?

Balancing data coverage and quantity for instruction tuning requires determining optimal data size based on training phase requirements while ensuring domain, format, length, language, locale, and task type coverage are proportionally represented.

How do I prepare a pretraining or RAG corpus to ensure relevance and consistency?

Preparing a pretraining or RAG corpus for relevance and consistency involves applying data deduplication and filtering techniques. You must enforce correct formatting, uniqueness, and compliance through both AI-assisted curation and manual inspection.

Why do I need data versioning practices when curating synthetic data?

Data versioning practices are necessary when curating synthetic data to track changes during filtering and deduplication. Versioning maintains consistency and alignment across iterations, ensuring reproducible AI training outcomes and debugging.

Can I use AI-assisted curation to debug data-driven quality issues in my dataset?

Yes, you can use AI-assisted curation to debug data-driven quality issues in your dataset. It helps identify and resolve alignment, formatting, and uniqueness problems while maintaining compliance and balancing coverage.