Marketing

\- Criatividade e proatividade; \- Boa comunicação; \- Conhecimento em redes sociais; \- Experiência com criação de conteúdo; \- Noções de design
- Create social media content
- Plan marketing campaigns
- Promotional art and text production

Estamos procurando um **Engenheiro Líder de Rede HPC** para liderar a estratégia, a arquitetura e a excelência em engenharia por trás da infraestrutura avançada de IA, pesquisa e GPU baseada em Kubernetes para um importante cliente global de tecnologia. O cargo concentra-se na definição da visão técnica, na liderança das decisões arquitetônicas e no estabelecimento de padrões de engenharia para tecidos de rede de alto desempenho que suportam cargas de trabalho distribuídas de IA e LLM em larga escala, incluindo InfiniBand/RDMA, Ethernet de alta velocidade, redes Kubernetes, redes de GPU no lado do host, tecnologias SmartNIC/DPU e observabilidade profunda de rede. Como líder técnico, você orientará engenheiros seniores, influenciará as roadmaps do cliente e será responsável pela entrega ponta a ponta de plataformas de rede críticas à missão. O candidato ideal combina conhecimento especializado em InfiniBand NDR/HDR e tecidos de próxima geração, RDMA/RoCE, redes NVIDIA/Mellanox, padrões de comunicação NCCL/MSCCL, redes Linux no lado do host, topologia PCIe/GPU/NIC e redes Kubernetes para clusters de GPU, com histórico comprovado de liderança de equipes de engenharia e de definição de plataformas de rede HPC/IA em larga escala. **Responsabilidades** * Assumir a visão arquitetônica e o roadmap de longo prazo para tecidos de rede de alto desempenho InfiniBand/RDMA e Ethernet que suportem clusters de GPU em larga escala e cargas de trabalho distribuídas de IA/LLM * Liderar o projeto, a avaliação e a seleção de topologias de rede de cluster, incluindo Fat-tree, Clos, Rail-otimizadas e Dragonfly, além de definir estruturas de decisão alinhadas às restrições de escala, desempenho e custo das cargas de trabalho * Estabelecer padrões de engenharia e boas práticas para redes no lado do host, incluindo configuração de NICs, drivers, firmware, afinidade de IRQ, posicionamento NUMA, topologia PCIe e caminhos de comunicação entre GPU e NIC * Impulsionar iniciativas de engenharia de desempenho para RDMA/RoCE, NCCL/MSCCL e comunicação coletiva em cargas de trabalho de treinamento multi-nó com GPU, além de liderar investigações complexas de causa-raiz * Definir a arquitetura de referência para redes Kubernetes em clusters de GPU, incluindo plugins CNI, políticas de rede, pods com múltiplas NICs, plugins de dispositivos RDMA/GPU e integração com orquestração de cargas de trabalho * Liderar a estratégia de adoção e integração de tecnologias SmartNIC/DPU, como NVIDIA BlueField, incluindo casos de uso de SR-IOV, offload, isolamento e segurança * Moldar a estratégia de observabilidade de rede, definindo métricas, dashboards, alertas, detecção de congestionamento, rastreamento de latência, frameworks de SLO e metodologias de análise de capacidade/desempenho * Orientar e liderar tecnicamente engenheiros nas áreas de rede, Kubernetes, armazenamento, infraestrutura de GPU, observabilidade e pesquisa em IA, promovendo alinhamento multifuncional e resolução de gargalos complexos * Representar a equipe de engenharia em fóruns com clientes e partes interessadas, influenciando a direção técnica, comunicando trade-offs e garantindo a entrega de plataformas de rede confiáveis e escaláveis **Requisitos** * 6+ anos de experiência em redes, infraestrutura, HPC, SRE ou funções de engenharia similares, com 3+ anos focados em redes de HPC, IA/ML ou clusters de GPU, incluindo liderança técnica comprovada em iniciativas em larga escala (1+ ano) * Experiência comprovada na liderança da arquitetura e entrega de tecidos InfiniBand/RDMA, Ethernet de alta velocidade e redes Linux em ambientes distribuídos de computação críticos ao desempenho * Conhecimento especializado em redes no lado do host, incluindo NICs, drivers e firmware, bem como topologia PCIe, consciência NUMA e afinidade GPU-NIC, com capacidade de definir padrões e orientar outros engenheiros * Compreensão sólida dos padrões de comunicação em treinamento distribuído de IA, incluindo cargas de trabalho baseadas em NCCL e operações coletivas como all-reduce e all-gather, além da capacidade de orientar o co-projeto entre carga de trabalho e rede * Conhecimento avançado em Kubernetes e redes de contêineres para cargas de trabalho com GPU ou distribuídas, incluindo conceitos CNI, políticas de rede, padrões de múltiplas NICs e integração de dispositivos RDMA/GPU * Proficiência avançada em conceitos de redes RDMA, incluindo InfiniBand, RoCE/RoCEv2, padrões relacionados ao GPUDirect, comportamento de congestionamento e ajuste de desempenho em escala * Domínio das redes Linux e da solução de problemas no lado do host, incluindo afinidade de IRQ, MTU, offloads e diagnósticos de desempenho * Responsabilidade comprovada pela estratégia de observabilidade e gestão de desempenho de rede, incluindo telemetria, monitoramento de tráfego, detecção de congestionamento, análise de latência, SLOs, planejamento de capacidade e alertas/solução de problemas nas camadas L1-L4, tecido e RDMA * Excelentes habilidades de liderança, mentoria, gestão de partes interessadas e comunicação, com experiência em orientar equipes de engenharia, influenciar decisões arquitetônicas de clientes e conduzir consenso entre pesquisadores e stakeholders da plataforma * Excelentes habilidades escritas e verbais em inglês (nível B2+) **Desejável** * Experiência prática com redes Azure, Ethernet e tecnologias GPGPU/GPU em nível arquitetônico * Domínio sólido de Grafana, Prometheus e administração de redes, com experiência na definição de padrões de observabilidade * Capacidade comprovada de projetar, desenvolver e governar Infraestrutura como Código em larga escala * Proficiência em Python e scripts de shell UNIX para automação, ferramentas e aumento da produtividade da equipe

João Silva
Indeed · HR