Chat rápido, melhores ofertas — Baixar

Engenheiro de Pesquisa em IA (Otimização de Kernel e Inferência) - 100% Remoto em Todo o Mundo

Indeed

Empresa

Tipo de empregoTempo Integral
Modalidade de TrabalhoRemoto
Nível de ExperiênciaMais de 10 Anos
Nível de EducaçãoDoutorado

Descrição

***Junte-se à Tether e Ajude a Moldar o Futuro das Finanças Digitais*** Na Tether, não estamos apenas desenvolvendo produtos: estamos liderando uma revolução financeira global. Nossas soluções de ponta capacitam empresas — desde exchanges e carteiras até processadores de pagamentos e caixas eletrônicos — a integrar de forma transparente tokens lastreados em reservas em múltiplas blockchains. Ao aproveitar o poder da tecnologia blockchain, a Tether permite que você armazene, envie e receba tokens digitais instantaneamente, com segurança e em escala global, a uma fração do custo. A transparência é a base de tudo o que fazemos, garantindo confiança em cada transação. ***Inove com a Tether*** **Tether Finance:** Nossa inovadora suíte de produtos inclui a stablecoin mais confiável do mundo, **USDT**, utilizada por centenas de milhões de pessoas em todo o planeta, além de serviços pioneiros de tokenização de ativos digitais. Mas isso é apenas o começo: **Tether Power:** Impulsionando um crescimento sustentável, nossas soluções energéticas otimizam energia excedente para mineração de Bitcoin, utilizando práticas ecologicamente responsáveis em instalações de última geração e geograficamente diversificadas. **Tether Data:** Impulsionando avanços em IA e tecnologia ponto a ponto, reduzimos os custos de infraestrutura e aprimoramos as comunicações globais com soluções de ponta como **KEET**, nosso aplicativo principal que redefine o compartilhamento seguro e privado de dados. **Tether Education:** Democratizando o acesso ao aprendizado digital de alto nível, capacitamos indivíduos a prosperar nas economias digital e de prestação de serviços, impulsionando o crescimento e as oportunidades globais. **Tether Evolution:** Na interseção entre tecnologia e potencial humano, estamos expandindo os limites do possível, construindo um futuro no qual inovação e capacidades humanas se fundem de maneira poderosa e sem precedentes. ***Por Que se Juntar a Nós?*** Nossa equipe é um verdadeiro polo global de talentos, trabalhando remotamente de todos os cantos do mundo. Se você é apaixonado por deixar sua marca no setor de fintech, esta é sua oportunidade de colaborar com algumas das mentes mais brilhantes, desafiando limites e estabelecendo novos padrões. Crescemos rapidamente, mantivemo-nos enxutos e consolidamos nossa posição como líderes do setor. Se você possui excelentes habilidades de comunicação em inglês e está pronto para contribuir com a plataforma mais inovadora do planeta, a Tether é o seu lugar. **Você está pronto para fazer parte do futuro?** **Sobre a vaga** Como membro de nossa equipe de modelos de IA, você impulsionará a inovação nas arquiteturas de atendimento e inferência de modelos para sistemas avançados de IA. Seu trabalho focará na otimização da implantação de modelos e estratégias de inferência para entregar desempenho altamente responsivo, eficiente e escalável em aplicações reais. Você atuará em um amplo espectro de sistemas, desde modelos eficientes em recursos projetados para ambientes com hardware limitado até arquiteturas complexas multimodais que integram dados como texto, imagens e áudio. Esperamos que você possua profunda especialização no projeto e na otimização de pipelines de atendimento de modelos e frameworks de inferência, bem como sólida experiência em arquiteturas avançadas de modelos. Você adotará uma abordagem prática e orientada por pesquisa para desenvolver, testar e implementar novas estratégias de atendimento e algoritmos de inferência. Suas responsabilidades incluem engenharia de pipelines robustos de inferência, definição de métricas abrangentes de desempenho e identificação e resolução de gargalos em ambientes de produção. O objetivo final é habilitar um desempenho de IA com alta vazão, baixa latência, pequena ocupação de memória e escalabilidade, entregando valor tangível em cenários dinâmicos do mundo real. **Responsabilidades** * Projetar e implantar arquiteturas de atendimento de modelos de ponta que ofereçam alta vazão e baixa latência, ao mesmo tempo que otimizam o uso de memória. Garantir que esses pipelines funcionem eficientemente em diversos ambientes, incluindo dispositivos com recursos limitados e plataformas de borda. Estabelecer metas claras de desempenho, como redução de latência, melhoria na resposta por token e minimização da ocupação de memória. * Construir, executar e monitorar testes controlados de inferência em ambientes simulados e de produção reais. Acompanhar indicadores-chave de desempenho, como latência de resposta, vazão, consumo de memória e taxas de erro, com atenção especial às métricas específicas para dispositivos com recursos limitados. Documentar resultados iterativos e comparar os resultados com benchmarks estabelecidos para validar o desempenho em diferentes plataformas. * Identificar e preparar conjuntos de dados de teste e cenários de simulação de alta qualidade adaptados aos desafios reais de implantação, especialmente aqueles encontrados em dispositivos com poucos recursos. Definir critérios mensuráveis para garantir que esses recursos avaliem eficazmente o desempenho do modelo, a latência e a utilização de memória sob diversas condições operacionais. * Analisar a eficiência computacional e diagnosticar gargalos no pipeline de atendimento, monitorando tanto métricas de processamento quanto de memória. Resolver problemas como processamento de lote subótimo, atrasos de rede e alto consumo de memória para otimizar a infraestrutura de atendimento quanto à escalabilidade e confiabilidade em sistemas com recursos limitados. * Trabalhar em estreita colaboração com equipes multifuncionais para integrar frameworks de atendimento e inferência otimizados em pipelines de produção projetados para aplicações de borda e embarcadas. Definir métricas claras de sucesso, como melhoria do desempenho no mundo real, baixas taxas de erro, escalabilidade robusta, uso ideal de memória e garantir monitoramento contínuo e refinamentos iterativos para melhorias sustentadas. * Graduação em Ciência da Computação ou área correlata. Doutorado em PLN, Aprendizado de Máquina ou área relacionada é ideal, complementado por um histórico sólido em P&D em IA (com publicações relevantes em conferências A*). * É obrigatório ter conhecimento da Metal Shading Language (MSL). Você deve estar confortável escrevendo shaders de computação personalizados do zero. * Experiência comprovada em otimizações de kernel de baixo nível e otimização de inferência em dispositivos móveis é essencial. Suas contribuições devem ter gerado melhorias mensuráveis na latência, vazão e ocupação de memória de inferência para aplicações específicas de domínio, particularmente em dispositivos com recursos limitados e plataformas de borda. * É exigida compreensão profunda das arquiteturas modernas de atendimento de modelos e técnicas de otimização de inferência. Isso inclui métodos de ponta para alcançar desempenho de baixa latência e alta vazão, bem como gerenciamento eficiente de memória em diversos cenários de implantação com recursos limitados. * É obrigatório ter forte especialização em escrita de kernels para GPU em dispositivos móveis (ou seja, smartphones), além de profundo entendimento de frameworks e motores de atendimento de modelos. É necessária experiência prática no desenvolvimento e implantação de pipelines completos de inferência, desde a otimização de modelos para atendimento eficiente até a integração dessas soluções em dispositivos com recursos limitados. * Capacidade comprovada de aplicar pesquisa empírica para superar desafios no atendimento de modelos, como otimização de latência, gargalos computacionais e restrições de memória. Você deve ser proficiente no projeto de frameworks robustos de avaliação e na iteração de estratégias de otimização para impulsionar continuamente os limites do desempenho de inferência e da eficiência do sistema. * Sistemas Distribuídos de Inferência: Projetar e otimizar mecanismos de inferência de alto desempenho usando técnicas como Paralelismo de Tensor, Paralelismo de Pipeline e Paralelismo de Especialistas para lidar com modelos massivos em clusters de GPU. * Profundo entendimento da matemática e estrutura por trás dos Modelos de Difusão e Transformadores Visuais * Conhecimento sobre poda (pruning), quantização, Flash Attention, cache KV e decodificação especulativa (Eagle), entre outros. **Informações importantes para candidatos** Fraudes de recrutamento tornaram-se cada vez mais comuns. Para se proteger, tenha em mente o seguinte ao se candidatar a vagas: * **Candidate-se apenas por nossos canais oficiais.** Não utilizamos plataformas ou agências terceirizadas para recrutamento, salvo quando expressamente declarado. Todas as vagas abertas estão listadas em nossa página oficial de carreiras: https://tether.recruitee.com/ * **Verifique a identidade do recrutador.** Todos os nossos recrutadores possuem perfis verificados no LinkedIn. Caso tenha dúvidas, você pode confirmar sua identidade verificando seu perfil ou entrando em contato conosco pelo nosso site. * **Tenha cuidado com métodos incomuns de comunicação.** Não realizamos entrevistas via WhatsApp, Telegram ou SMS. Toda comunicação é feita por e-mails e plataformas oficiais da empresa. * **Verifique cuidadosamente os endereços de e-mail.** Toda comunicação da nossa parte virá de e-mails terminados em **@**tether.to **ou @**tether.io * **Nunca solicitamos pagamento ou dados financeiros pessoais.** Se alguém solicitar informações financeiras pessoais ou pagamento em qualquer etapa do processo seletivo, trata-se de uma fraude. Por favor, denuncie imediatamente. **Em caso de dúvida, sinta-se à vontade para entrar em contato através do nosso site oficial.**

Alguns conteúdos foram traduzidos automaticamente pelo sistema

Publicado por

João Silva

Indeed · HR

Localização

João Silva

Indeed · HR

Vagas semelhantes

Engenheiro de Pesquisa em IA (Otimização de Kernel e Inferência) - 100% Remoto em Todo o Mundo vaga da Indeed em 2026 | ok.com