sodadatasodadataOfficialยท1 Agent Skills Included

messydata

Generate realistic messy datasets with configurable anomalies

Generates realistic synthetic datasets from simple YAML configs with full control over distributions and row counts. Injects configurable data quality problems like missing values, duplicates, invalid categories, bad dates, and outliers. Eliminates hand-crafting test data so teams can validate pipelines, data quality checks, and ML workflows faster.
npx skills add sodadata/messydata --all -g -y

All Skills in This Repository (1)

Pure Emerald Level Indicators

Frequently Asked Questions

FAQPage Schema
How to install MessyData?โ–ผ

Run `npx skills add sodadata/messydata --all -g -y` in your terminal to install this skill globally.

How to generate synthetic dirty data for testing?โ–ผ

Define your columns and distributions in a YAML config, then run the generate command to get a messy dataset with missing values, duplicates, and outliers injected automatically.

What anomalies can MessyData inject?โ–ผ

It supports missing values, duplicate rows, invalid categories, invalid dates, and statistical outliers, each with configurable probability and rate.

Does MessyData work with Claude Code?โ–ผ

Yes. The included SKILL.md teaches your agent to write and validate configs from plain-English requests, then run the CLI to produce the data file.

Can I generate date-aware daily data?โ–ผ

Yes. Mark one field as temporal and use single-date or date-range modes to generate realistic day-by-day data, ideal for simulating daily pipeline runs.

Related Repositories in Data & Analytics

View All in Data & Analyticsโ†’