Failure Mode Analysis

Enumerate system component failure modes and design mitigations for resilience.

1|1|Updated Feb 21, 2026
One-click install
npx skills add https://github.com/dtsong/claude-code-windows-setup --skill failure-mode-analysis-dtsong
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: Failure Mode Analysis
Source: https://github.com/dtsong/claude-code-windows-setup/tree/main/skills/council/skeptic/failure-mode-analysis
Command: npx skills add https://github.com/dtsong/claude-code-windows-setup --skill failure-mode-analysis-dtsong

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

This Skill helps proactively identify potential failure scenarios in systems and design effective mitigation strategies to ensure resilience and availability.

Core Features & Use Cases

  • Systematic Failure Discovery: Enumerate potential failure modes for each component of a system.
  • Cascade Risk Assessment: Map how failures in one component can impact others.
  • Mitigation Design: Develop strategies for graceful degradation, retries, and fallbacks.
  • Monitoring & Rollback Planning: Define signals for detection and plan rollback procedures.
  • Use Case: Before deploying a new microservice, use this Skill to brainstorm all the ways it could fail (e.g., database connection issues, API timeouts, resource exhaustion) and define how the system will behave and recover in each scenario.

Quick Start

Analyze potential failure modes for the new user authentication service.

Frequently Asked Questions about Failure Mode Analysis

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I systematically identify potential failure scenarios for new system features?

Systematically identify potential failure scenarios by enumerating system components, mapping failure modes per component, assessing cascade potential, and designing mitigations to maintain system resilience and availability.

What is the best way to assess cascade risks when a microservice component fails?

Assess cascade risks by mapping how component failures impact other system parts, evaluating cascade potential across the architecture to design targeted mitigations like graceful degradation and fallbacks.

How do I design mitigations for database connection issues and API timeouts?

Design mitigations for database connection issues and API timeouts by developing strategies for graceful degradation, retries, and fallbacks to ensure system resilience during component failures.

Do I need detailed system architecture to perform a failure mode analysis?

Yes, you need detailed system architecture and reliability requirements to accurately enumerate components, identify per-component failure modes, and design effective mitigations for system resilience.

How do I define monitoring signals and plan a rollback strategy for system resilience?

Define monitoring signals to detect failures and plan rollback procedures by establishing detection metrics and recovery steps that ensure system availability and graceful recovery during incidents.