Design and review runtime reliability for long-running services, workers, CLIs, daemons, and networked systems. Use when implementing health checks, graceful shutdown, timeouts, retries, backoff, idempotency, queues, resource limits, feature flags/gradual rollout switches, observability baselines, or when the user mentions reliability / runtime / health check / retry / timeout / worker / feature flag / 特性开关 / 稳定性. Detailed telemetry design defers to observability.