Descrição
Resumo:
Procuramos um Engenheiro de Dados Sênior para assumir a propriedade e construir uma plataforma crítica de dados, transformando dados reais desordenados em entradas confiáveis para modelos e produtos, com foco na excelência operacional e na confiabilidade dos sistemas.
Pontos principais:
1. Construir e operar o coração de uma plataforma crítica de dados, transformando dados desordenados em dados confiáveis
2. Trabalhar em todas as etapas: ingestão, orquestração, modelos de data warehouse e infraestrutura
3. Focar na excelência operacional, garantindo que os sistemas resistam ao teste do tempo e da escala
**A função**
============
Por trás da IA Fundacional da Avra existe uma camada crítica: uma plataforma de dados que ingere, estrutura e opera dados reais desordenados, transformando-os em entradas confiáveis para nossos modelos e produtos.
Como Engenheiro de Dados Sênior, você desempenhará um papel fundamental na construção e operação do coração dessa plataforma de dados. **Isso não se trata apenas de “mover dados de A para B”.** Você assumirá a responsabilidade por sistemas que convertem dados externos desordenados e imprevisíveis em conjuntos de dados confiáveis — alimentando nossos modelos, orientando decisões e impulsionando receita.
Você terá a oportunidade de atuar em todas as partes de nossa plataforma: desde pipelines de ingestão de dados e camadas de orquestração até modelos de data warehouse e infraestrutura. Ao longo do caminho, você fará escolhas técnicas ponderadas e sempre buscará maneiras de tornar nossos sistemas melhores e mais eficientes.
Esta função é ideal para alguém que entende que engenharia de dados é, de fato, uma prática operacional. Você não apenas construirá pipelines — será responsável por garantir que os sistemas que criar resistam ao teste do tempo, mantendo sua confiabilidade mesmo à medida que mudanças e escalas ocorram. Estamos procurando alguém animado para assumir esse desafio!
**Remoto (Brasil)**
**Responsabilidades**
====================
* **Orquestração de pipelines e fluxos de trabalho.** Projetar e operar fluxos de trabalho orquestrados, garantindo semântica clara de execução, observabilidade e resiliência.
* **Modelagem e transformação de dados.** Projetar e manter camadas escaláveis de transformação usando dbt, BigQuery, Spark, Ray ou ferramentas equivalentes, possibilitando consumo confiável por sistemas downstream.
* **Qualidade de dados e padrões da plataforma.** Definir e impor padrões relacionados à qualidade dos dados, contratos, validação de esquemas, rastreabilidade (lineage) e metadados.
* **Lidando com a complexidade dos dados do mundo real.** Trabalhar com fontes de dados incompletas, inconsistentes e em constante evolução. Lidar com deriva de esquema (schema drift), casos extremos (edge cases) e falhas operacionais com sólido julgamento técnico.
* **Integração com nuvem e infraestrutura.** Operar em ambientes nativos de nuvem (GCP/AWS), trabalhando com armazenamento, mensageria (ex.: Pub/Sub) e infraestrutura como código.
* **Melhoria e simplificação da plataforma.** Melhorar continuamente os sistemas aumentando a observabilidade, reduzindo riscos operacionais e simplificando a arquitetura.
**Você se destaca se**
====================
* Você possui forte experiência operando **sistemas de dados em produção**, não apenas construindo-os uma vez
* Você já trabalhou com ferramentas de orquestração como **Dagster**, Airflow ou Prefect
* Você tem experiência projetando modelos de dados robustos e camadas de transformação
* Você possui forte experiência prática com **Python** para engenharia de dados (pipelines, ferramentas e sistemas em produção)
* Você pensa em termos de sistemas, confiabilidade e manutenibilidade a longo prazo
* Você **simplifica a complexidade**, em vez de adicionar abstrações desnecessárias
* Experiência com **GCP**, **dbt**, BigQuery ou **arquiteturas orientadas a eventos** é um diferencial significativo
**Qualificações**
==================
* **Experiência \-** Pelo menos 5 anos de experiência construindo e operando sistemas de dados em ambientes de produção
* **Proficiência técnica \-** Excelentes habilidades em Python e SQL, com experiência em pipelines de dados, orquestração e modelagem de data warehouse
* **Mentalidade operacional \-** Experiência gerenciando qualidade de dados, observabilidade, modos de falha e fluxos de trabalho em produção de longa duração
* **Colaboração \-** Excelentes habilidades de comunicação e capacidade de trabalhar com equipes de engenharia, produto e negócios
**O que oferecemos**
=================
* **Compensação competitiva \-** Salário atrativo e participação acionária
* **Propriedade e impacto \-** Influência direta na fundação da plataforma de dados da Avra e em sua evolução
* **Ambiente técnico \-** Trabalhe em problemas reais de dados envolvendo ingestão complexa, confiabilidade e sistemas em larga escala
* **Equipe enxuta e de alta qualidade \-** Trabalhe de perto com engenheiros experientes e fundadores em um ambiente de alto contexto
* **Cultura flexível \-** Remoto primeiro (Brasil), com folga flexível e forte ênfase na autonomia
Se você é motivado por construir e operar sistemas reais de dados — não apenas projetá-los — e deseja trabalhar em problemas difíceis envolvendo dados desordenados e confiabilidade em produção, gostaríamos de conversar com você.