reliability-standards

Evaluate production reliability and operational readiness using SRE and NALSD standards.

2|Updated May 18, 2022
One-click install
npx skills add https://github.com/alexfalkowski/bin --skill reliability-standards
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: reliability-standards
Source: https://github.com/alexfalkowski/bin/tree/main/skills/reliability-standards
Command: npx skills add https://github.com/alexfalkowski/bin --skill reliability-standards

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

This skill addresses the lack of consistency and rigor in evaluating production reliability, helping teams identify hidden failure modes, missing operational controls, and unverified assumptions in their systems.

Core Features & Use Cases

  • Reliability Gap Analysis: Systematically audit services, APIs, and infrastructure for failure recovery, observability, and SLO compliance.
  • Design Review: Apply NALSD (Non-Abstract Large System Design) principles to evaluate capacity, scaling, and failure domains.
  • Use Case: When preparing for a major release, use this skill to perform a reliability audit that identifies potential cascading failure paths and ensures that rollback procedures and observability signals are properly defined.

Quick Start

Use the reliability-standards skill to perform a comprehensive reliability-gap audit on the current repository.

Frequently Asked Questions about reliability-standards

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I audit production reliability and identify hidden failure modes?

A reliability gap analysis systematically evaluates services, APIs, and infrastructure against SRE and NALSD standards to identify hidden failure modes. It validates failure recovery procedures, observability signals, and capacity planning to ensure operational readiness.

What is NALSD and how does it apply to system design reviews?

NALSD principles provide a framework to evaluate capacity, scaling, and failure domains during system design reviews. Applying these standards validates non-functional requirements and operational controls against documented system promises and failure modes.

How do I ensure SLO compliance and observability before a major release?

Performing a comprehensive reliability audit before a major release ensures SLO compliance and observability. This validates that rollback procedures and observability signals are properly defined to catch potential cascading failure paths.

Can I use this to evaluate operational readiness for APIs and infrastructure?

Yes, you can evaluate operational readiness for APIs and infrastructure by validating non-functional requirements and operational controls. The audit checks failure recovery mechanisms and system resilience against documented system promises.

What is the best way to validate non-functional requirements for system resilience?

The best way to validate non-functional requirements for system resilience is to apply SRE standards that assess failure recovery and operational controls. This verifies that infrastructure scaling and failure domains meet documented system promises.