What problem does it solve?
Helps engineering and SRE teams define measurable SLIs/SLOs, manage error budgets, reduce operational toil through automation, and run incident response and chaos experiments so production systems stay reliable without blocking feature delivery.
Core Features & Use Cases
- SLO & SLI design: quantitative SLO definitions, error budget calculations, and multi-window tracking patterns.
- Monitoring & alerting: Prometheus/Grafana queries, golden-signal recording rules, and SLO-driven alert templates.
- Automation & runbooks: self-healing examples, automated runbook execution, capacity planning scripts, and toil-tracking utilities.
- Incident & chaos practices: incident response templates, blameless postmortem structure, chaos experiment patterns and safe runners.
- Use Case: evaluate a service's 30-day availability SLO, compute burn rate, generate alerts, and produce a prioritized remediation and deployment policy.
Quick Start
Assess the payment-api SLOs using provided metrics, calculate current error budget remaining, and recommend immediate mitigation steps and runbook actions.