data-cleaning-pipeline-generator

Generate data cleaning pipelines for pandas, polars, or PySpark datasets.

6|2|Updated Oct 31, 2025
One-click install
npx skills add https://github.com/Dexploarer/claudius-skills --skill data-cleaning-pipeline-generator
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: data-cleaning-pipeline-generator
Source: https://github.com/Dexploarer/claudius-skills/tree/main/examples/intermediate/data-science-skills/data-cleaning-pipeline
Command: npx skills add https://github.com/Dexploarer/claudius-skills --skill data-cleaning-pipeline-generator

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

It builds end-to-end data cleaning pipelines to handle missing values, duplicates, outliers, and type conversions.

Core Features & Use Cases

  • Pipeline modules: Missing value handling, deduplication, outlier removal
  • Type normalization: Data type conversion and validation
  • Documentation: Example usage and tests

Quick Start

Generate a pandas-based cleaning pipeline for data.csv.

Frequently Asked Questions about data-cleaning-pipeline-generator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I handle missing values and duplicates in my pandas or polars dataset?

Data cleaning pipelines automate missing value handling and deduplication across pandas or polars DataFrames. This Skill generates a complete pipeline with built-in methods to remove duplicates and fill or drop missing values, delivering validated, deduplicated data ready for analysis.

Can I automatically detect and remove outliers from my dataset?

Yes, the pipeline includes outlier detection and removal functionality for numerical columns. It applies statistical methods to identify and filter anomalies, returning a cleaned dataset with outliers removed and data quality validated.

What's the best way to standardize data types and normalize text across messy datasets?

Data cleaning pipelines fix inconsistent data types, normalize text formatting, and encode categorical variables in one configurable workflow. This ensures type consistency and text uniformity across your pandas or polars dataset without manual intervention.

How do I validate data quality after cleaning?

The generated pipeline includes built-in validation steps and dataset analysis to assess data quality post-cleaning. It provides reports on completeness, type correctness, and statistical properties, confirming your data meets quality standards.

Does this work with large datasets in PySpark?

Yes, the pipeline generator supports pandas, polars, and PySpark. Choose your framework based on dataset size and infrastructure; polars and PySpark handle larger-scale data cleaning operations efficiently.

Can I customize the cleaning steps for my specific data issues?

The generated pipeline is fully configurable with individual methods for removing duplicates, handling missing values, fixing types, removing outliers, normalizing text, and encoding categories. Combine or skip steps based on your dataset's unique cleaning needs.