Engenheiro(a) de Confiabilidade e Plataforma Sênior

Empresa
Descrição
Resumo da Vaga: Buscamos um(a) Engenheiro(a) de Confiabilidade e Plataforma Sênior para evoluir a confiabilidade dos serviços e da plataforma, transformando incidentes em melhorias estruturais e soluções de engenharia. Principais Destaques: 1. Atuação na evolução da confiabilidade e plataforma tecnológica 2. Transformar incidentes em melhorias estruturais e automações 3. Foco em soluções de engenharia para problemas operacionais Buscamos um(a) Engenheiro(a) de Confiabilidade e Plataforma Sênior para atuar na evolução da confiabilidade dos nossos serviços e da nossa plataforma tecnológica. O papel é transformar incidentes, alertas e problemas operacionais recorrentes em melhorias estruturais, automações e padrões preventivos — não um perfil apenas operacional ou focado em acompanhar incidentes, mas alguém que produz soluções de engenharia. **Principais Responsabilidades** * Revisar e evoluir alertas, monitores e critérios de acionamento. * Garantir escalonamento adequado e reduzir alertas ignorados ou sem responsável. * Implantar e acompanhar SLIs, SLOs e indicadores de disponibilidade. * Melhorar a observabilidade da plataforma: logs, métricas, tracing e APM. * Automatizar respostas, diagnósticos e recuperações de incidentes. * Criar e manter runbooks e playbooks operacionais. * Atuar nas ações técnicas decorrentes de post\-mortems. * Reduzir falhas recorrentes e trabalho operacional manual (toil). * Apoiar capacidade, performance, resiliência e disaster recovery. * Evoluir componentes e padrões da plataforma interna. * Apoiar tecnicamente os times de DevOps, Plataforma e Desenvolvimento. * Explorar e aplicar soluções de AIOps para detecção de anomalias e correlação inteligente de alertas. Requisitos: * Experiência sênior em SRE, DevOps ou Platform Engineering. * Conhecimento em Datadog ou ferramenta equivalente de observabilidade. * Experiência com cloud, Kubernetes e infraestrutura como código. * Conhecimento de CI/CD, automação e scripting ou desenvolvimento. * Experiência com gestão de incidentes e análise de causa raiz. * Conhecimento de APIs, gateways, rate limiting e observabilidade distribuída. * Capacidade de desenvolver automações e ferramentas internas. **Diferenciais** * Experiência prática com AIOps: detecção de anomalias, correlação automática de alertas ou causa raiz assistida por IA. * Vivência em ambientes financeiros ou de varejo de alto volume. * Certificações em cloud (GCP, AWS ou Azure) ou Kubernetes (CKA/CKAD). **Perfil Compotamental** * Atuação preventiva e orientada a dados. * Capacidade de investigação e resolução de problemas complexos. * Boa comunicação com áreas técnicas e de negócio. * Autonomia para conduzir melhorias, sem depender de gestão direta. * Visão sistêmica e foco em redução de risco. Benefícios Assistência Médica Bradesco Saúde (cooparticipação) Assistência Odontológica Odontoseg (por adesão) Parceria com Consultório Odontológico ️ Vale Refeição ou Vale Alimentação ️ Seguro de Vida PPR (Participação nos Lucros e Resultados) Vale Transporte Bicicletário com vestiário ️ Desconto de 10% nos produtos Pernambucanas TotalPass Programa Mãe Pernambucanas com acompanhamento gestacional Parcerias com SESC e instituições de ensino para cursos de graduação e pós\-graduação Assistência Social Ângela, com apoio a mulheres em situação de violência.
Publicado por

João Silva
Indeed · HR






