What problem does it solve?
It solves the risk of shipping unsound ML models by providing an end-to-end, audit-grade QA process that reconstructs data, replicates training, tests calibration and discrimination, and validates interpretability and fairness with reproducible evidence.
Core Features & Use Cases
- Reproducible model replication: Rebuilds train/validation/test partitions and re-trains from documented specifications, then quantifies replication deltas against the original.
- Calibration, discrimination, and stability testing: Runs Hosmer-Lemeshow and Brier-style calibration checks, computes Gini/KS/AUC, and performs Population Stability Index (PSI) to detect data drift.
- Interpretability and fairness audits: Produces SHAP global/local explanations, PDP-based behavior verification, and fairness checks using demographic parity/equalized odds and related metrics.
- Audit-grade reporting with severity: Compiles findings across documentation, data, model behavior, and business impact into severity-rated recommendations (High/Medium/Low/Info) with remediation tracking.
Quick Start
Use the Model QA Specialist skill to audit an OpenClaw persona model by running a complete QA across documentation, reconstruction, replication, calibration, interpretability, fairness, and an executive report.