What problem does it solve?
Provides clear guidance for querying, visualizing, and alerting on time-series metrics so engineers can quickly identify performance regressions and reliability issues without guessing PromQL syntax or architecture patterns.
Core Features & Use Cases
- PromQL reference and patterns: Examples of instant vector selectors, range vectors, rate functions, aggregations, and common query patterns for error rates, saturation, and prediction.
- Alerting and recording rules: Guidance for creating recording rules to precompute expensive queries and authoring alert expressions for Alertmanager and Grafana unified alerting.
- Architecture and integrations: Explanations of pull-based scraping, service discovery, push gateway use cases, and remote write/read integration with Grafana Cloud Metrics and Mimir.
- Use Case: Craft a dashboard panel that shows grouped per-service 5m error rate, add a recording rule for the metric, and propose an alerting policy with notification routing.
Quick Start
Use the prometheus skill to craft a PromQL query that calculates the 5 minute error rate for service api-server, propose a recording rule, and suggest an alert expression and notification policy.