training-data-curation

Standardize LLM post-training data collection and evaluation across SFT, DPO, and RLHF workflows.

3|Updated Dec 22, 2025
One-click install
npx skills add https://github.com/M4n5ter/skills --skill training-data-curation
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: training-data-curation
Source: https://github.com/M4n5ter/skills/tree/main/training-data-curation
Command: npx skills add https://github.com/M4n5ter/skills --skill training-data-curation

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Provides a standardized approach to create, curate, and evaluate training data for LLM post-training, reducing data quality risks and inconsistencies.

Core Features & Use Cases

  • Establishes format guidelines for SFT (JSONL conversations), DPO/ORPO/KTO paired data, and RLHF ranking.
  • Defines quality checks (deduplication, language consistency, bias controls) and provenance requirements to ensure reliable fine-tuning datasets.

Quick Start

Follow these guidelines to prepare a high-quality training dataset for LLM fine-tuning.

Frequently Asked Questions about training-data-curation

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
What format should I use for LLM fine-tuning data in SFT and DPO workflows?

For LLM fine-tuning data, use JSONL conversations for SFT, paired comparisons for DPO/ORPO/KTO, and ranking formats for RLHF to ensure clean and well-structured datasets.

How do I improve LLM training data quality before fine-tuning?

Improve LLM training data quality by applying standardized curation checks for deduplication, language consistency, bias controls, and provenance tracking before running fine-tuning workflows.

When do I need paired comparison data for DPO or ORPO training?

You need paired comparison data for DPO or ORPO training when aligning model outputs with human preferences, requiring structured formats that contrast chosen and rejected responses.

Can I apply the same data curation standards across SFT, DPO, and RLHF?

Yes, you can apply the same data curation standards across SFT, DPO, and RLHF to enforce consistent quality, provenance, and language consistency across all post-training datasets.

Why does my LLM fine-tuning dataset require provenance and deduplication checks?

LLM fine-tuning datasets require provenance and deduplication checks to reduce data quality risks, prevent memorizing duplicate samples, and ensure reliable, diverse training distributions.

What is the best way to structure RLHF ranking data for language model training?

The best way to structure RLHF ranking data is to format multiple model responses in explicit ranking order, enabling reliable reward model training and consistent preference alignment.