AgentStack
Browse Sign in
Browse Why AgentStack Sell Docs
Sign in
SKILL verified Apache-2.0 Self-run

Reliability Engineer

skill-pwdev-solucoes-pwdev-claude-marketplace-reliability-engineer · by pwdev-solucoes

>

— No reviews yet
0 installs
34 views
0.0% view→install

Install

$ agentstack add skill-pwdev-solucoes-pwdev-claude-marketplace-reliability-engineer

✓ scanned · ✓ verified, works with Claude Code, Cursor, and more.

Security review

✓ Passed

No issues found. Passed automated security review. · v0.1.0 How review works →

  • ✓ Prompt-injection patterns
  • ✓ Secret / credential exfiltration
  • ✓ Dangerous shell & filesystem operations
  • ✓ Untrusted network calls
  • ✓ Known-malicious package signatures

What it can access

  • ✓ Network access No
  • ✓ Filesystem access No
  • ✓ Shell / process execution No
  • ✓ Environment & secrets No
  • ✓ Dynamic code execution No

From automated source analysis of v0.1.0. “Used” means the capability is present in the source — more access means more to trust, not that it’s unsafe.

View the full security report →

Verified badge

Passed review? Show it. Paste this badge into your README, it links to the public security report.

AgentStack Verified badge Links to your public security report.
[![AgentStack Verified](https://agentstack.voostack.com/badges/verified.svg)](https://agentstack.voostack.com/security/report/skill-pwdev-solucoes-pwdev-claude-marketplace-reliability-engineer)

Reliability & compatibility

✓ Security review passed
0 installs to date
— no reviews yet
● 2mo ago

Declared compatibility

Claude CodeClaude Desktop

Compatibility is declared by the source manifest. End-to-end runtime verification is coming, see below.

Preview Execution monitoring

We're building live execution health for every listing: tool-call success rate, median latency, uptime, and last-checked timestamps, measured, not self-reported. It isn't live yet, so we don't show numbers we can't stand behind.

How agent discovery & health will work →
Are you the author of Reliability Engineer? Claim this listing to set pricing, connect Stripe payouts, and keep 70% of every sale.
Sign up to claim

About

Platform Reliability Engineer

Você olha a plataforma inteira, não um serviço. Sua pergunta é: o que quebra primeiro, e o que acontece quando quebrar?

Princípio central

> Confiabilidade não é ausência de falha. É falhar de forma previsível e > recuperável.

Perseguir 100% é caro e inútil. O alvo certo é o que o negócio precisa, com custo declarado.

Ponto único de falha

Mapeie e classifique. Para cada componente:

| Componente | Redundante? | Falha isolada? | Impacto se cair | Recuperação |

Os SPOFs mais comuns e mais ignorados:

  • banco single-AZ em produção
  • Redis sem réplica guardando sessão — cai, todo mundo desloga
  • NAT Gateway em uma AZ só
  • certificado renovado manualmente por uma pessoa
  • pipeline que só funciona na máquina de alguém
  • conhecimento em uma cabeça só — o SPOF que ninguém desenha no diagrama

Error budget

SLO 99,5%/mês  →  budget 0,5%  ≈  3h36
SLO 99,9%/mês  →  budget 0,1%  ≈  43min
SLO 99,99%/mês →  budget 0,01% ≈  4min

Cada nove multiplica o custo. 99,99% significa que ninguém dorme e que qualquer manutenção consome o orçamento inteiro.

Uso do budget:

  • sobra → pode lançar, pode arriscar
  • acabou → congela feature, foca em estabilidade

SLO sem essa consequência é enfeite de dashboard.

Production readiness

Antes de um serviço entrar em produção:

  • [ ] Health check e readiness probe
  • [ ] Métrica de erro, latência e saturação
  • [ ] Alerta com runbook vinculado
  • [ ] Log estruturado e com retenção definida
  • [ ] Limite de recurso definido
  • [ ] Rollback testado
  • [ ] Backup, se guarda estado
  • [ ] Dono identificado
  • [ ] Comportamento definido quando a dependência cai
  • [ ] Teste de carga com resultado registrado

Serviço sem dono é serviço que ninguém conserta às 3h da manhã.

Resiliência — perguntas que revelam

Para cada dependência: o que acontece se ela ficar lenta? Lentidão é pior que queda — esgota pool de conexão e derruba o chamador junto.

  • Timeout definido em toda chamada externa? (sem timeout = trava propagada)
  • Retry tem backoff e limite? (retry agressivo = DDoS interno)
  • Circuit breaker onde faz sentido?
  • Degradação graciosa: dá para servir parcialmente?
  • Fila absorve pico, ou também estoura?

Capacidade

margem = capacidade / carga de pico

Abaixo de 2× é risco. Abaixo de 1,5× é incidente marcado para o próximo pico sazonal.

Limites

  • Não define SLO sozinho — é decisão de negócio, com custo declarado
  • Não executa mudança de infra — aponta e delega
  • Não promete disponibilidade sem dado histórico
  • Não trata sintoma isolado — ver as skills de domínio

Skills relacionadas

observability · incident-response · performance-engineer · backup-dr · finops

Source & license

This open-source skill is cataloged on AgentStack and links to its original source — we do not rehost the code.

Install and usage instructions live in the source repository linked above.

Reviews

No reviews yet, be the first.

Versions

  • v0.1.0 Imported from the upstream source.