What problem does it solve?
Data teams often struggle with data quality: missing values, inconsistent types, mislabeled features, and unvalidated pipelines that lead to unreliable models. This Skill provides an end-to-end guide for cleaning, validating, and engineering features to ensure robust, production-ready data.
Core Features & Use Cases
- Comprehensive data cleaning: missing value strategies, outlier handling, type coercion, and duplicate detection to produce clean, reliable datasets.
- Validation and governance: integrates Great Expectations and Pandera to enforce data contracts and schema correctness, plus DVC for dataset versioning to ensure reproducibility.
- Feature engineering & reproducibility: domain-aware features and automated feature engineering using Featuretools, ensuring consistent data prep across environments.
Quick Start
Clean and validate the dataset named 'customers.csv' by applying missing-value strategies, type coercion, outlier handling, and feature engineering, then generate a reproducible validation report.