Descrição
Resumo da Vaga:
Buscamos um(a) Engenheiro(a) de Confiabilidade e Plataforma Sênior para evoluir a confiabilidade dos serviços e da plataforma, transformando incidentes em melhorias estruturais e soluções de engenharia.
Principais Destaques:
1. Atuação na evolução da confiabilidade e plataforma tecnológica
2. Transformar incidentes em melhorias estruturais e automações
3. Foco em soluções de engenharia para problemas operacionais
Buscamos um(a) Engenheiro(a) de Confiabilidade e Plataforma Sênior para atuar na evolução da confiabilidade dos nossos serviços e da nossa plataforma tecnológica. O papel é transformar incidentes, alertas e problemas operacionais recorrentes em melhorias estruturais, automações e padrões preventivos — não um perfil apenas operacional ou focado em acompanhar incidentes, mas alguém que produz soluções de engenharia.
**Principais Responsabilidades**
* Revisar e evoluir alertas, monitores e critérios de acionamento.
* Garantir escalonamento adequado e reduzir alertas ignorados ou sem responsável.
* Implantar e acompanhar SLIs, SLOs e indicadores de disponibilidade.
* Melhorar a observabilidade da plataforma: logs, métricas, tracing e APM.
* Automatizar respostas, diagnósticos e recuperações de incidentes.
* Criar e manter runbooks e playbooks operacionais.
* Atuar nas ações técnicas decorrentes de post\-mortems.
* Reduzir falhas recorrentes e trabalho operacional manual (toil).
* Apoiar capacidade, performance, resiliência e disaster recovery.
* Evoluir componentes e padrões da plataforma interna.
* Apoiar tecnicamente os times de DevOps, Plataforma e Desenvolvimento.
* Explorar e aplicar soluções de AIOps para detecção de anomalias e correlação inteligente de alertas.
Requisitos:
* Experiência sênior em SRE, DevOps ou Platform Engineering.
* Conhecimento em Datadog ou ferramenta equivalente de observabilidade.
* Experiência com cloud, Kubernetes e infraestrutura como código.
* Conhecimento de CI/CD, automação e scripting ou desenvolvimento.
* Experiência com gestão de incidentes e análise de causa raiz.
* Conhecimento de APIs, gateways, rate limiting e observabilidade distribuída.
* Capacidade de desenvolver automações e ferramentas internas.
**Diferenciais**
* Experiência prática com AIOps: detecção de anomalias, correlação automática de alertas ou causa raiz assistida por IA.
* Vivência em ambientes financeiros ou de varejo de alto volume.
* Certificações em cloud (GCP, AWS ou Azure) ou Kubernetes (CKA/CKAD).
**Perfil Compotamental**
* Atuação preventiva e orientada a dados.
* Capacidade de investigação e resolução de problemas complexos.
* Boa comunicação com áreas técnicas e de negócio.
* Autonomia para conduzir melhorias, sem depender de gestão direta.
* Visão sistêmica e foco em redução de risco.
Benefícios
Assistência Médica Bradesco Saúde (cooparticipação)
Assistência Odontológica Odontoseg (por adesão)
Parceria com Consultório Odontológico
️ Vale Refeição ou Vale Alimentação
️ Seguro de Vida
PPR (Participação nos Lucros e Resultados)
Vale Transporte
Bicicletário com vestiário
️ Desconto de 10% nos produtos Pernambucanas
TotalPass
Programa Mãe Pernambucanas com acompanhamento gestacional
Parcerias com SESC e instituições de ensino para cursos de graduação e pós\-graduação
Assistência Social Ângela, com apoio a mulheres em situação de violência.