data-transform

Transform raw tabular data into cleaned, structured datasets using pandas and numpy.

1.2k|145|Updated Mar 22, 2021
One-click install
npx skills add https://github.com/Starlitnightly/omicverse --skill data-transform
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: data-transform
Source: https://github.com/Starlitnightly/omicverse/tree/main/.claude/skills/data-transform
Command: npx skills add https://github.com/Starlitnightly/omicverse --skill data-transform

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

This Skill automates data transformation tasks that are laborious and error-prone when done manually. It provides a local pipeline for cleaning, normalizing, reshaping, and feature engineering using pandas, numpy, and scikit-learn, ensuring privacy and provider-agnostic workflows.

Core Features & Use Cases

  • Data Cleaning: handle missing values, remove duplicates, drop outliers, and unify formats.
  • Normalization and Scaling: apply StandardScaler, MinMaxScaler, RobustScaler for numeric features.
  • Data Reshaping: melt/pivot between wide and long formats, and create summary tables.
  • Filtering and Subsetting: conditional selection, grouping, and feature engineering.
  • Use Case: From a raw CSV, clean data, scale numeric features, reshape to long format, and prepare for modeling.

Quick Start

Load data.csv, drop duplicates and missing values, apply median imputation for numeric columns, and save cleaned_data.csv.

Frequently Asked Questions about data-transform

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I clean and prepare raw CSV data for machine learning?

Data transformation handles missing values, removes duplicates and outliers, and normalizes numeric features using pandas and numpy. Load your CSV, apply cleaning steps like median imputation and deduplication, then scale features with StandardScaler or MinMaxScaler to prepare data for modeling.

Can I reshape data between wide and long formats with pandas?

Yes. Data transformation provides melt and pivot operations to restructure tabular datasets. Convert wide format to long format for analysis or reshape summary tables, enabling flexible data organization for analytics and reporting pipelines.

What's the best way to handle missing values and outliers in a dataset?

Data transformation applies median imputation for numeric columns and removes outliers using statistical methods. Handle missing data systematically across your entire dataset, then filter or drop extreme values to improve data quality before analysis.

How do I apply scaling and normalization to numeric features?

Scaling transforms numeric features using StandardScaler, MinMaxScaler, or RobustScaler from scikit-learn. Normalize ranges across your dataset to ensure features contribute equally to machine learning models and prevent bias toward high-magnitude columns.

Does this work for local Python environments without cloud dependencies?

Yes. Data transformation runs entirely locally using pandas, numpy, and scikit-learn. Execute cleaning, reshaping, and feature engineering on your machine without external providers, maintaining data privacy for tabular datasets.

Can I combine filtering, merging, and feature engineering in one pipeline?

Data transformation supports conditional filtering, joining datasets, and creating engineered features end-to-end. Chain operations like grouping, subsetting, and joining in a single local pipeline to prepare data for reporting and model training.