probability-calibration

Verify model probability outputs and calibration error with reliability diagrams and Brier score analysis.

1|Updated May 5, 2026
One-click install
npx skills add https://github.com/sports-data-hq/hockey-skills --skill probability-calibration-sports-data-hq
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: probability-calibration
Source: https://github.com/sports-data-hq/hockey-skills/tree/main/skills/probability-calibration
Command: npx skills add https://github.com/sports-data-hq/hockey-skills --skill probability-calibration-sports-data-hq

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

This Skill checks whether a sports model’s predicted win probabilities actually match real-world outcomes, so you can trust the numbers behind betting decisions, expected value, and automated decision-making.

Core Features & Use Cases

  • Calibration Diagnostics: Measures reliability, Brier score, and bin-level errors to reveal overconfidence or underconfidence.
  • Correction Methods: Guides when to use Platt scaling or isotonic regression to improve probability quality.
  • Drift Monitoring: Detects when calibration degrades over time and recommends refitting on recent games.
  • Use Case: A model that says 63% must behave like 63% in practice; this Skill helps confirm that before you rely on it for wagers or downstream analytics.

Quick Start

Load the probability-calibration skill and compare my model’s predicted win probabilities against historical game outcomes to assess calibration and recommend the right correction method.

Frequently Asked Questions about probability-calibration

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I check if my sports prediction model probabilities are accurate?

Probability calibration verifies model outputs by comparing predicted win probabilities against actual historical outcomes using reliability diagrams and Brier score analysis to detect overconfidence or underconfidence.

What is the difference between Platt scaling and isotonic regression for probability correction?

Platt scaling fits a logistic regression curve to calibrate probabilities, while isotonic regression uses a non-parametric approach. Calibration analysis guides which method best improves your model's probability quality.

How do I calculate Brier score and reliability diagrams for my betting model?

Brier score and reliability diagrams are calculated by binning predicted probabilities into intervals and comparing observed win rates against predicted rates, requiring paired predictions and actual outcomes from historical games.

Can I detect probability drift in my sports prediction model over time?

Drift monitoring detects when calibration degrades over time by comparing bin-level metrics across periods, recommending refitting correction methods on recent games when reliability drops below acceptable thresholds.

What sample size do I need for reliable probability calibration metrics?

Probability calibration requires enough historical games with paired predicted probabilities and actual outcomes to compute bin-level metrics. Sufficient sample size ensures statistical significance for reliability diagrams and post-calibration comparisons.

Why does my model predict 63% but win only 55% of the time?

This miscalibration indicates overconfident probabilities. Calibration diagnostics measure this bin-level error using reliability diagrams and Brier scores, then recommend Platt scaling or isotonic regression to correct the outputs.