What problem does it solve?
This Skill solves the problem of building dependable machine learning workflows for tabular (rows/columns) data without data leakage, while accelerating common tasks like preprocessing, cross-validation, hyperparameter search, and model evaluation.
Core Features & Use Cases
- Estimator API workflows: fit/predict/transform/score patterns for classical ML estimators, including custom estimators and contract testing.
- Leak-proof composition: end-to-end Pipeline and ColumnTransformer patterns that keep preprocessing inside the proper train/validation boundaries.
- Model selection at scale: GridSearchCV, RandomizedSearchCV, and HalvingGridSearchCV over Pipelines, plus diagnostics like learning/validation curves.
- Practical evaluation for real data: correct metric choices for imbalance (e.g.,
roc_auc, average_precision, balanced_accuracy) and multi-metric cross-validation.
- Production readiness: safe model persistence guidance across joblib, skops.io, and ONNX, including versioning and trust boundaries.
Quick Start
Use scikit-learn to build and evaluate a tabular classification baseline by fitting a preprocessing-plus-model Pipeline with cross-validation and reporting the right metrics for class imbalance.