Chat rápido, melhores ofertas — Baixar

Gerente de Engenharia de Rede HPC – Infraestrutura de IA

Indeed

Empresa

Tipo de empregoTempo Integral
Modalidade de TrabalhoRemoto
Nível de ExperiênciaMais de 10 Anos
Nível de EducaçãoDoutorado

Descrição

Estamos buscando um **Gerente de Engenharia de Rede HPC – Infraestrutura de IA** para orientar a arquitetura e a direção técnica para pesquisas em IA e infraestrutura de GPU baseada em Kubernetes. Você liderará os padrões para InfiniBand/RDMA, Ethernet, redes Kubernetes, SmartNIC/DPU e observabilidade em grandes programas, ao mesmo tempo em que mentorará engenheiros seniores. Junte-se a nós para moldar plataformas de rede confiáveis e escaláveis para cargas de trabalho distribuídas massivas de IA — candidate-se agora. **Responsabilidades** * Definir e assumir a propriedade de uma visão arquitetônica e roteiro estratégico plurianual para tecidos InfiniBand/RDMA e Ethernet de alta velocidade que suportem grandes clusters de GPU e cargas de trabalho distribuídas de IA/LLM em todo o portfólio do cliente * Regular a avaliação e padronização de topologias de rede de cluster, como Fat-tree, Clos, Rail-otimizada e Dragonfly, e estabelecer estruturas decisórias alinhadas às restrições de escala, desempenho e custo * Estabelecer e impor padrões de engenharia para redes no lado do host, incluindo configuração de NICs, drivers, firmware, afinidade de IRQ, posicionamento NUMA, topologia PCIe e caminhos de comunicação entre GPU e NIC * Impulsionar a engenharia estratégica de desempenho em RDMA/RoCE, NCCL/MSCCL e comunicação coletiva para treinamento multi-nó de GPU, além de supervisionar a resolução dos mais difíceis problemas sistêmicos de desempenho * Definir a arquitetura de referência para redes Kubernetes em clusters de GPU, incluindo plugins CNI, políticas de rede, pods com múltiplas NICs, plugins de dispositivos RDMA/GPU e integração com orquestração de cargas de trabalho, liderando sua adoção em diversos programas * Assumir a estratégia e governança de tecnologias SmartNIC/DPU, como NVIDIA BlueField, incluindo SR-IOV, descarga (offload), isolamento e casos de uso de segurança, alinhando sua implantação à rota estratégica mais ampla da infraestrutura * Definir a estratégia de observabilidade de rede corporativa, regulando métricas, painéis, alertas, detecção de congestionamento, rastreamento de latência, estruturas SLO e métodos de análise de capacidade/desempenho * Fornecer liderança técnica e mentoramento a engenheiros líderes e principais nas equipes de redes, Kubernetes, armazenamento, infraestrutura de GPU, observabilidade e pesquisa em IA, promovendo o alinhamento transversal * Representar a autoridade técnica principal em fóruns executivos de partes interessadas, moldando direções, negociando trade-offs entre programas e garantindo a entrega de plataformas de rede confiáveis e escaláveis em todos os projetos * Contribuir para a comunidade de engenharia por meio de liderança intelectual, construção interna de práticas e representação em eventos setoriais **Requisitos** * 9+ anos de experiência em redes, infraestrutura, HPC, SRE ou funções de engenharia similares, com 5+ anos focados em redes HPC, IA/ML ou clusters de GPU, incluindo liderança técnica comprovada em nível de programa ou portfólio (3+ anos) * Histórico comprovado na definição de arquitetura e governança de entregas para tecidos InfiniBand/RDMA, Ethernet de alta velocidade e redes Linux em ambientes distribuídos de computação em larga escala e sensíveis ao desempenho * Expertise autoritária em redes no lado do host (NICs, drivers, firmware), além de topologia PCIe, consciência NUMA e afinidade entre GPU e NIC, com capacidade demonstrada de definir padrões corporativos e elevar as práticas de engenharia * Profundo entendimento dos padrões de comunicação em treinamento distribuído de IA, incluindo cargas de trabalho baseadas em NCCL e operações coletivas como all-reduce e all-gather, com capacidade de impulsionar o co-design entre cargas de trabalho e rede em larga escala * Conhecimento autoritário de Kubernetes e redes de contêineres para cargas de trabalho com GPU ou distribuídas, incluindo conceitos CNI, políticas de rede, padrões de múltiplas NICs e integração de dispositivos RDMA/GPU, com experiência na definição de arquiteturas de referência * Domínio especializado em redes RDMA, incluindo InfiniBand, RoCE/RoCEv2, padrões relacionados ao GPUDirect, comportamento de congestionamento e ajuste de desempenho em escala muito grande * Domínio avançado de redes Linux e solução de problemas no lado do host, incluindo afinidade de IRQ, MTU, offloads e diagnósticos de desempenho, com capacidade de definir metodologias diagnósticas repetíveis para equipes mais amplas * Propriedade comprovada sobre a estratégia de observabilidade e gerenciamento de desempenho de redes, incluindo telemetria, monitoramento de tráfego, detecção de congestionamento, análise de latência, SLOs, planejamento de capacidade e alertas/solução de problemas nas camadas L1–L4, tecido e RDMA * Excelentes habilidades de liderança, mentoramento, gestão de partes interessadas e comunicação executiva, com experiência comprovada liderando múltiplas equipes de engenharia, influenciando decisões arquitetônicas de clientes no nível C-level e promovendo o alinhamento entre stakeholders de pesquisa e plataforma * Proficiência avançada no idioma inglês (nível C1) **Desejável** * Experiência prática arquitetônica e estratégica com Azure Networking, Ethernet e tecnologias GPGPU/GPU * Comando autoritário de Grafana e Prometheus, além de experiência em administração de redes definindo padrões de observabilidade em toda uma organização de engenharia * Capacidade comprovada de definir estratégia, governar e dimensionar práticas de Infraestrutura como Código (IaC) em múltiplas equipes e programas * Proficiência em Python e scripts de shell UNIX para automação, ferramentas e melhoria da produtividade de engenharia * Histórico de liderança intelectual por meio de palestras em conferências, publicações, patentes ou contribuições open-source no domínio de redes HPC/IA

Alguns conteúdos foram traduzidos automaticamente pelo sistema

Publicado por

João Silva

Indeed · HR

Localização

João Silva

Indeed · HR

Vagas semelhantes

Gerente de Engenharia de Rede HPC – Infraestrutura de IA vaga da Indeed em 2026 | ok.com