Chat rápido, melhores ofertas — Baixar

Engenheiro de Pesquisa em IA (Otimização de Kernel e Inferência)

Indeed

Empresa

Tipo de empregoTempo Integral
Modalidade de TrabalhoRemoto
Nível de ExperiênciaMais de 10 Anos
Nível de EducaçãoDoutorado

Descrição

***Junte-se à Tether e Ajude a Moldar o Futuro das Finanças Digitais*** Na Tether, não estamos apenas desenvolvendo produtos: estamos pioneirando uma revolução financeira global. Nossas soluções de ponta capacitam empresas — desde exchanges e carteiras até processadores de pagamentos e caixas eletrônicos — a integrar de forma transparente tokens lastreados em reservas em múltiplas blockchains. Ao aproveitar o poder da tecnologia blockchain, a Tether permite que você armazene, envie e receba tokens digitais instantaneamente, com segurança e em escala global, a uma fração do custo. A transparência é a pedra angular de tudo o que fazemos, garantindo confiança em cada transação. ***Inove com a Tether*** **Tether Finance:** Nossa inovadora suíte de produtos inclui a stablecoin mais confiável do mundo, **USDT**, utilizada por centenas de milhões de pessoas em todo o planeta, além de serviços pioneiros de tokenização de ativos digitais. Mas isso é apenas o começo: **Tether Power:** Impulsionando um crescimento sustentável, nossas soluções energéticas otimizam energia excedente para mineração de Bitcoin, empregando práticas ecologicamente responsáveis em instalações de última geração e geograficamente diversificadas. **Tether Data:** Impulsionando avanços em IA e tecnologia ponto a ponto, reduzimos os custos de infraestrutura e aprimoramos as comunicações globais com soluções de ponta como **KEET**, nosso aplicativo principal que redefine o compartilhamento seguro e privado de dados. **Tether Education**: Democratizando o acesso à educação digital de alto nível, capacitamos indivíduos a prosperar nas economias digital e de prestação de serviços, impulsionando o crescimento e as oportunidades globais. **Tether Evolution**: Na interseção entre tecnologia e potencial humano, estamos expandindo os limites do possível, criando um futuro no qual inovação e capacidades humanas se fundem de maneira poderosa e sem precedentes. ***Por Que se Juntar a Nós?*** Nossa equipe é um verdadeiro centro global de talentos, trabalhando remotamente de todos os cantos do mundo. Se você tem paixão por deixar sua marca no setor de fintech, esta é sua oportunidade de colaborar com algumas das mentes mais brilhantes, desafiando limites e estabelecendo novos padrões. Crescemos rapidamente, mantivemo-nos enxutos e consolidamos nossa posição como líderes na indústria. Se você possui excelentes habilidades de comunicação em inglês e está pronto para contribuir com a plataforma mais inovadora do planeta, a Tether é o seu lugar. **Você está pronto para fazer parte do futuro?** **Sobre a vaga** Como membro de nossa equipe de modelos de IA, você impulsionará a inovação em arquiteturas de serviço e inferência de modelos para sistemas avançados de IA. Seu trabalho concentrar-se-á na otimização da implantação de modelos e das estratégias de inferência, visando entregar desempenho altamente responsivo, eficiente e escalável em aplicações do mundo real. Você trabalhará em um amplo espectro de sistemas, variando desde modelos eficientes em recursos, projetados para ambientes de hardware limitado, até arquiteturas complexas multimodais que integram dados como texto, imagens e áudio. Esperamos que você possua profunda especialização no projeto e na otimização de pipelines de serviço de modelos e frameworks de inferência, bem como sólida formação em arquiteturas avançadas de modelos. Você adotará uma abordagem prática e orientada por pesquisa para desenvolver, testar e implementar novas estratégias de serviço e algoritmos de inferência. Suas responsabilidades incluem engenharia de pipelines de inferência robustos, definição de métricas abrangentes de desempenho e identificação e resolução de gargalos em ambientes de produção. O objetivo final é possibilitar um desempenho de IA com alta vazão, baixa latência, pequena ocupação de memória e escalabilidade, gerando valor tangível em cenários dinâmicos do mundo real. **Responsabilidades** * Projetar e implantar arquiteturas de serviço de modelos de última geração que ofereçam alta vazão e baixa latência, ao mesmo tempo que otimizam o uso de memória. Garantir que esses pipelines operem com eficiência em diversos ambientes, inclusive em dispositivos com restrições de recursos e plataformas de borda. Estabelecer metas claras de desempenho, como redução da latência, melhoria na resposta de tokens e minimização da ocupação de memória. * Construir, executar e monitorar testes controlados de inferência tanto em ambientes simulados quanto em produção real. Acompanhar indicadores-chave de desempenho, como latência de resposta, vazão, consumo de memória e taxa de erros, com atenção especial às métricas específicas para dispositivos com restrições de recursos. Documentar resultados iterativos e comparar os resultados com benchmarks estabelecidos para validar o desempenho em diferentes plataformas. * Identificar e preparar conjuntos de dados de teste e cenários de simulação de alta qualidade, adaptados aos desafios reais de implantação, especialmente aqueles encontrados em dispositivos com poucos recursos. Definir critérios mensuráveis para garantir que esses recursos avaliem eficazmente o desempenho do modelo, a latência e a utilização de memória sob diversas condições operacionais. * Analisar a eficiência computacional e diagnosticar gargalos no pipeline de serviço, monitorando tanto métricas de processamento quanto de memória. Resolver problemas como processamento de lote subótimo, atrasos de rede e alto consumo de memória, a fim de otimizar a infraestrutura de serviço para escalabilidade e confiabilidade em sistemas com restrições de recursos. * Trabalhar em estreita colaboração com equipes multifuncionais para integrar frameworks de serviço e inferência otimizados em pipelines de produção destinados a aplicações de borda e embarcadas. Definir métricas claras de sucesso, tais como melhoria do desempenho no mundo real, baixa taxa de erros, escalabilidade robusta, uso ótimo de memória, e garantir monitoramento contínuo e refinamentos iterativos para melhorias sustentadas. * Graduação em Ciência da Computação ou área correlata. Desejável doutorado em PLN, Aprendizado de Máquina ou área relacionada, complementado por um histórico sólido em P&D em IA (com publicações relevantes em conferências A*). * É obrigatório ter conhecimento da Metal Shading Language (MSL). Você deve estar confortável escrevendo shaders de computação personalizados do zero. * Experiência comprovada em otimizações de kernel de baixo nível e otimizações de inferência em dispositivos móveis é essencial. Suas contribuições devem ter gerado melhorias mensuráveis na latência, vazão e ocupação de memória de inferência para aplicações específicas de domínio, particularmente em dispositivos com restrições de recursos e plataformas de borda. * É necessário um profundo entendimento das modernas arquiteturas de serviço de modelos e técnicas de otimização de inferência. Isso inclui métodos de ponta para alcançar desempenho de baixa latência e alta vazão, bem como gerenciamento eficiente de memória em diversos cenários de implantação com restrições de recursos. * É obrigatório ter forte experiência na escrita de kernels para GPU em dispositivos móveis (isto é, smartphones), bem como profundo conhecimento de frameworks e motores de serviço de modelos. É exigida experiência prática no desenvolvimento e implantação de pipelines de inferência ponta a ponta, desde a otimização de modelos para serviço eficiente até a integração dessas soluções em dispositivos com restrições de recursos. * Capacidade comprovada de aplicar pesquisa empírica para superar desafios no serviço de modelos, como otimização de latência, gargalos computacionais e restrições de memória. Você deve ser proficiente no projeto de frameworks de avaliação robustos e na iteração de estratégias de otimização para continuar expandindo os limites do desempenho de inferência e da eficiência do sistema. * Sistemas Distribuídos de Inferência: Projetar e otimizar mecanismos de inferência de alto desempenho utilizando técnicas como Paralelismo de Tensores, Paralelismo de Pipeline e Paralelismo de Especialistas, para lidar com modelos massivos em clusters de GPU. * Profundo entendimento da matemática e estrutura por trás dos Modelos de Difusão e Transformadores Visuais * Conhecimento de poda (pruning), quantização, Flash Attention, cache KV, decodificação especulativa (Eagle), etc. **Informações importantes para candidatos** Fraudes de recrutamento tornaram-se cada vez mais comuns. Para sua proteção, observe atentamente os seguintes pontos ao se candidatar a vagas: * **Candidate-se exclusivamente por nossos canais oficiais.** Não utilizamos plataformas de terceiros nem agências de recrutamento, exceto quando claramente declarado. Todas as vagas abertas estão listadas em nossa página oficial de carreiras: https://tether.recruitee.com/ * **Verifique a identidade do recrutador.** Todos os nossos recrutadores possuem perfis verificados no LinkedIn. Caso tenha dúvidas, você pode confirmar sua identidade consultando seu perfil ou entrando em contato conosco pelo site oficial. * **Tenha cautela com métodos incomuns de comunicação.** Não realizamos entrevistas via WhatsApp, Telegram ou SMS. Toda comunicação ocorre exclusivamente por e-mails e plataformas oficiais da empresa. * **Verifique cuidadosamente os endereços de e-mail.** Todo contato enviado por nós virá de e-mails terminados em **@**tether.to **ou @**tether.io * **Nunca solicitaremos pagamento ou dados financeiros pessoais.** Se alguém solicitar informações financeiras pessoais ou pagamento em qualquer etapa do processo seletivo, trata-se de uma fraude. Por favor, denuncie imediatamente. **Caso fique em dúvida, sinta-se à vontade para entrar em contato através do nosso site oficial.**

Alguns conteúdos foram traduzidos automaticamente pelo sistema

Publicado por

João Silva

Indeed · HR

Localização

João Silva

Indeed · HR

Vagas semelhantes

Engenheiro de Pesquisa em IA (Otimização de Kernel e Inferência) vaga da Indeed em 2026 | ok.com