Data Cleaning Pipeline

Clean tabular datasets by imputing missing values, removing duplicates, detecting outliers, and standardizing data types.

Updated Feb 22, 2026
One-click install
npx skills add https://github.com/KaranKathur06/Metal-Hub --skill data-cleaning-pipeline-karankathur06
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: Data Cleaning Pipeline
Source: https://github.com/KaranKathur06/Metal-Hub/tree/main/.cursor/skills/data-cleaning-pipeline
Command: npx skills add https://github.com/KaranKathur06/Metal-Hub --skill data-cleaning-pipeline-karankathur06

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

It standardizes and repairs real-world datasets by handling missing values, duplicates, outliers, and inconsistent data types so downstream analysis and modeling can run reliably.

Core Features & Use Cases

  • Missing value handling: Delete critical rows or impute numeric/categorical fields using rules like median or KNN.
  • Outlier detection & treatment: Use IQR-based bounds to remove or cap anomalous values in numeric columns.
  • Data standardization & validation: Normalize/scaling, clean text fields, enforce datetime/type conversions, and run integrity checks with a quality report.

Quick Start

Ask the assistant to generate a pandas-based end-to-end cleaning pipeline that imputes missing values, removes duplicates, caps IQR outliers, standardizes types, cleans text, scales numeric features, and outputs a before/after quality metrics report.

Frequently Asked Questions about Data Cleaning Pipeline

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I automate data cleaning and preprocessing with pandas for messy datasets?

Build a pandas pipeline that imputes missing values, removes duplicates, caps IQR outliers, standardizes data types, and scales numeric features. This yields an analysis-ready dataset and a before/after quality metrics report for reliable preprocessing.

What is the best way to handle missing values and outliers in tabular data preparation workflows?

Apply IQR-based bounds to detect and cap outliers in numeric columns, and impute missing values using median or KNN rules. This removes noisy records and standardizes inconsistent formatting for reliable downstream analysis.

Can I generate a data quality report that quantifies missingness and rows removed during preprocessing?

Generate a data quality report by running integrity checks that output before/after metrics on rows removed and remaining missingness. This validates that deterministic cleaning steps successfully repaired inconsistent formatting and noisy records.

Does this data preprocessing approach work for inconsistent formatting and noisy records in automated pipelines?

This approach suits automated data quality pipelines by enforcing type conversions, cleaning text fields, and applying deterministic imputation. It standardizes inconsistent formatting and noisy records to ensure reliable inputs for downstream analysis.

How do I standardize data types and clean text fields for analysis-ready data?

Standardize data types by enforcing datetime conversions and cleaning text fields to repair inconsistent formatting. This yields analysis-ready data that ensures downstream analysis and modeling run reliably without type errors.