Chat rápido, melhores ofertas — Baixar

Engenheiro Sênior de Rede HPC - Infraestrutura de IA

Indeed

Empresa

Tipo de empregoTempo Integral
Modalidade de TrabalhoRemoto
Nível de Experiência6 a 10 Anos
Nível de EducaçãoDiploma de Graduação

Descrição

Estamos buscando um **Engenheiro Sênior de Rede HPC** para apoiar infraestruturas avançadas de IA, pesquisa e baseadas em Kubernetes com GPUs para um importante cliente global de tecnologia. O cargo concentra-se em projetar, operar e otimizar tecidos de rede de alto desempenho para cargas de trabalho de IA distribuída e de grandes modelos de linguagem (LLM), incluindo InfiniBand/RDMA, Ethernet de alta velocidade, redes Kubernetes, redes de GPU no lado do host, tecnologias SmartNIC/DPU e observabilidade avançada de rede. O candidato ideal possui forte experiência prática com InfiniBand NDR/HDR e tecidos de nova geração, RDMA/RoCE, redes NVIDIA/Mellanox, padrões de comunicação NCCL/MSCCL, redes Linux no lado do host, topologia PCIe/GPU/NIC e redes Kubernetes para clusters de GPU. **Responsabilidades** * Projetar, operar e solucionar problemas em tecidos de rede de alto desempenho InfiniBand/RDMA e Ethernet para clusters de GPU em larga escala e cargas de trabalho de IA/LLM distribuídas * Projetar e avaliar topologias de rede de cluster, incluindo Fat-tree, Clos, Rail-otimizadas e Dragonfly, com base na escala da carga de trabalho e nas necessidades de desempenho * Otimizar redes no lado do host, incluindo configuração de NIC, drivers, firmware, afinidade de IRQ, posicionamento NUMA, topologia PCIe e caminhos de comunicação entre GPU e NIC * Ajustar e solucionar problemas de desempenho de RDMA/RoCE, NCCL/MSCCL e operações coletivas para cargas de treinamento multi-nó com GPU * Projetar e manter redes Kubernetes para clusters de GPU, incluindo plugins CNI, políticas de rede, pods com múltiplas NICs, plugins de dispositivos RDMA/GPU e integração com orquestração de cargas de trabalho * Apoiar tecnologias SmartNIC/DPU, como NVIDIA BlueField, conforme aplicável, incluindo casos de uso de SR-IOV, descarga (offload), isolamento e segurança * Construir e aprimorar a observabilidade de rede, incluindo métricas, dashboards, alertas, detecção de congestionamento, rastreamento de latência, relatórios de SLO e análise de capacidade/desempenho * Colaborar com equipes de Kubernetes, armazenamento, infraestrutura de GPU, observabilidade e pesquisa em IA para resolver gargalos de rede e E/S e melhorar a confiabilidade das cargas de trabalho **Requisitos** * 5+ anos de experiência em redes, infraestrutura, HPC, SRE ou funções de engenharia similares, com 2+ anos focados em redes HPC, IA/ML ou clusters de GPU * Experiência comprovada prática com tecidos InfiniBand/RDMA, Ethernet de alta velocidade e redes Linux em ambientes de computação distribuída críticos para desempenho * Conhecimento de redes no lado do host, incluindo NICs, drivers e firmware, além de topologia PCIe, consciência NUMA e afinidade entre GPU e NIC * Conhecimento dos padrões de comunicação em treinamento distribuído de IA, incluindo cargas de trabalho baseadas em NCCL e operações coletivas como all-reduce e all-gather * Especialização em Kubernetes e redes de contêineres para cargas de trabalho com GPU ou distribuídas, incluindo conceitos CNI, políticas de rede, padrões de múltiplas NICs e integração de dispositivos RDMA/GPU * Domínio de conceitos de redes RDMA, incluindo InfiniBand, RoCE/RoCEv2, padrões relacionados ao GPUDirect, comportamento de congestionamento e ajuste de desempenho * Habilidades em redes Linux e solução de problemas no lado do host, incluindo afinidade de IRQ, MTU, offloads e diagnósticos de desempenho * Experiência em observabilidade e gerenciamento de desempenho de rede, incluindo telemetria, monitoramento de tráfego e detecção de congestionamento, bem como análise de latência, SLOs e planejamento de capacidade, além de alertas e solução de problemas nas camadas L1–L4, tecido e RDMA * Fortes habilidades de solução de problemas, análise de causa-raiz, documentação e comunicação para trabalhar com equipes de engenharia do cliente, pesquisadores e partes interessadas na plataforma * Nível de inglês mínimo B2 (Intermediário Superior) para comunicação eficaz **Desejável** * Familiaridade com redes Azure, Ethernet e tecnologias GPGPU/GPU * Competência em Grafana, Prometheus e administração de redes * Capacidade de desenvolver e manter Infraestrutura como Código * Flexibilidade para usar Python e scripts de shell UNIX para automação e ferramentas

Alguns conteúdos foram traduzidos automaticamente pelo sistema

Publicado por

João Silva

Indeed · HR

Localização

João Silva

Indeed · HR

Vagas semelhantes

Engenheiro Sênior de Rede HPC - Infraestrutura de IA da Indeed em 2026 | ok.com