What problem does it solve?
This Skill provides a comprehensive toolkit for evaluating models on imbalanced datasets, addressing the limitations of accuracy and offering robust metrics and techniques to ensure better model performance on underrepresented classes.
Core Features & Use Cases
- Class Imbalance Techniques: Offers techniques like SMOTE, ADASYN, and RandomOverSampler to handle imbalanced datasets.
- Evaluation Metrics: Computes precision, recall, F1-score, ROC-AUC, PR-AUC, MCC, Kappa, Log Loss, and Brier Score for model evaluation.
- Multi-Class Metrics and Confusion Matrix: Provides multi-class evaluation metrics and visualization of confusion matrices.
- Probability Calibration: Calibrates probabilities using Platt scaling and isotonic regression for better reliability.
- Threshold Optimization: Finds optimal thresholds using Youden's J Statistic, F1-optimal threshold, and cost-matrix optimization.
- Statistical Model Comparison: Compares models using paired t-test, corrected resampled t-test, Wilcoxon Signed-Rank, McNemar's Test, Friedman + Nemenyi, and Nemenyi post-hoc tests.
- Learning Curves for Diagnosis: Visualizes learning curves to diagnose model bias and variance.
- Complete Evaluation Pipeline with Imbalanced-Learn: Integrates with imbalanced-learn for a robust evaluation pipeline.
- "Too-Good-To-Be-True" — Leakage and Sanity-Check Playbook: Provides a checklist to avoid common pitfalls in model evaluation.
Quick Start
To evaluate a model, use the evaluation skill with the following command: /evaluation I have a binary classification model. How can I evaluate its performance on an imbalanced dataset?