data-science-expert

Clean pandas DataFrames and perform statistical modeling with Python libraries.

41|9|Updated Jan 13, 2026
One-click install
npx skills add https://github.com/personamanagmentlayer/pcl --skill data-science-expert
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: data-science-expert
Source: https://github.com/personamanagmentlayer/pcl/tree/main/stdlib/ai/data-science-expert
Command: npx skills add https://github.com/personamanagmentlayer/pcl --skill data-science-expert

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires pandas, numpy, matplotlib, seaborn, scikit-learn, statsmodels, scipy, and includes scripts (resource) and references (resource) components.

What problem does it solve?

This Skill provides expert-level assistance for complex data science tasks, including cleaning, analysis, visualization, feature engineering, and statistical modeling, enabling users to derive meaningful insights from their data.

Core Features & Use Cases

  • Data Cleaning & EDA: Handle missing values, remove duplicates, identify outliers, and generate summary statistics and visualizations.
  • Feature Engineering: Create interaction and polynomial features, bin numeric data, and encode categorical variables.
  • Statistical Modeling: Perform time series analysis (decomposition, stationarity testing, ARIMA) and A/B testing (t-tests, proportion tests).
  • Use Case: Analyze customer churn data by cleaning the dataset, engineering features like customer tenure bins, visualizing correlations, and building a predictive model.

Quick Start

Use the data-science-expert skill to clean the provided pandas DataFrame by dropping rows with missing values and removing duplicate entries.

Frequently Asked Questions about data-science-expert

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I perform exploratory data analysis and clean a pandas DataFrame in Python?

Exploratory data analysis and data cleaning involve handling missing values, removing duplicate rows, and identifying outliers. You can use pandas to drop incomplete entries and generate summary statistics to prepare datasets for modeling.

What is the best way to engineer features and encode categorical variables for machine learning?

Feature engineering transforms raw data into predictive signals by creating interaction and polynomial features. You can bin numeric data and encode categorical variables using scikit-learn to improve statistical modeling performance.

How do I run time series analysis and stationarity testing using Python?

Time series analysis decomposes temporal data to identify trends and seasonality. You can perform stationarity testing and apply ARIMA models using statsmodels and pandas to forecast sequence-driven metrics.

Can I use Python for A/B testing and statistical modeling with scipy?

Yes, you can conduct A/B testing for data-driven decision-making using scipy and statsmodels. Statistical modeling supports t-tests and proportion tests to validate hypotheses and measure significance between groups.

How do I visualize correlations and data distributions using matplotlib and seaborn?

Data visualization plots variable correlations and distributions to reveal underlying patterns. You can generate charts using matplotlib and seaborn to interpret exploratory data analysis results effectively.