data-cleaning

Clean and transform messy datasets in Python, R, or Stata with codebook documentation.

Updated Apr 15, 2026
One-click install
npx skills add https://github.com/sheehe/coase --skill data-cleaning-sheehe
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: data-cleaning
Source: https://github.com/sheehe/coase/tree/main/%E5%AE%9E%E8%AF%81%E7%A7%91%E7%A0%94%E6%8F%92%E4%BB%B6/econometrics/econometrics/skills/data-cleaning
Command: npx skills add https://github.com/sheehe/coase --skill data-cleaning-sheehe

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Clean and transform messy data for analysis in Python, R, or Stata, ensuring reproducibility and proper handling of data quality issues across datasets.

Core Features & Use Cases

  • Automated data cleaning pipelines that detect and fix common quality issues.
  • Handle missing values, duplicates, and outliers; create analysis-ready panels.
  • Document transformations with a codebook and labeled variables to support replication.

Quick Start

Upload your raw dataset and specify the analysis variables to generate a complete cleaning pipeline.

Frequently Asked Questions about data-cleaning

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I clean messy survey data and prepare it for econometric analysis?

Cleaning survey data for econometric analysis involves detecting and fixing quality issues, handling missing values, removing duplicates, and managing outliers. This creates analysis-ready panels with labeled variables and codebooks for replication.

How do I handle missing values and outliers in a Python or R dataset?

Handling missing values and outliers in Python or R requires applying automated data cleaning pipelines to detect and resolve these issues. This creates derived variables and analysis-ready panels while documenting transformations for replication.

What is the best way to ensure reproducibility when transforming administrative data?

Ensuring reproducibility when transforming administrative data requires generating a codebook, labeling variables, and using versioned scripts. This documents all transformations and data quality fixes to support complete replication.

Can I use automated data cleaning pipelines with Stata for administrative datasets?

Yes, you can apply automated data cleaning pipelines with Stata to process administrative datasets. The pipeline detects and fixes common quality issues, creates derived variables, and generates codebooks for econometric cleanup and replication.

How do I document data transformations to create a codebook for replication?

To document data transformations for a replication codebook, you generate labeled variables and versioned scripts alongside your cleaning pipeline. This records all handling of missing data, duplicates, and outliers to satisfy reproducibility requirements.