What problem does it solve?
This Skill provides a structured approach to design, operate, and maintain reliable production server environments, emphasizing process control, visibility, and resilience to minimize downtime and manual firefighting.
Core Features & Use Cases
- Process management principles: selecting tooling, restart strategies, and graceful reloads for Node.js apps, containers, and services.
- Monitoring principles: defining metrics, alerting, and observability to detect degradations early.
- Log management principles: structured logging, rotation, and log integrity for auditability.
- Scaling decisions: guidance on when to scale horizontally or vertically based on load and resource metrics.
- Health check principles: basic and deep health checks aligned with load balancer requirements.
- Security principles: governance around least privilege, secrets management, and patching discipline.
- Troubleshooting priority: step-by-step guidance to diagnose and remediate common failures.
- Anti-patterns: warnings about misconfigurations that cause instability.
Quick Start
Implement a production-ready server-management plan by applying process management, monitoring, logging, scaling, health checks, security, and troubleshooting best practices.