What problem does it solve? Choosing the right algorithm, preprocessing steps, and evaluation strategy for classical machine learning tasks is error-prone, and mistakes like fitting scalers on full datasets cause data leakage and misleading results. ## Core Features & Use Cases - Algorithm Selection: Decision tables for classification, regression, clustering, and dimensionality reduction map algorithms like Random Forest, SVM, KMeans, and PCA to their best-fit scenarios. - Pipeline & Preprocessing Guidance: Explains Pipeline, ColumnTransformer, imputation, scaling, and encoding flows that prevent data leakage. - Evaluation & Tuning: Covers cross-validation strategies, task-appropriate metrics, and GridSearchCV versus RandomizedSearchCV trade-offs. - Use Case: When building a churn classifier on an imbalanced dataset, follow the guidance to use StratifiedKFold, F1-score instead of accuracy, and a pipeline that scales features only on training folds. ## Quick Start Ask the agent to build a scikit-learn pipeline that preprocesses numeric and categorical columns, trains a random forest classifier, and evaluates it with stratified cross-validation.