Chat rápido, melhores ofertas — Baixar

Engenheiro de Pesquisa em IA (Compactação e Quantização de Modelos) - 100% Remoto em Todo o Mundo

Indeed

Empresa

Tipo de empregoTempo Integral
Modalidade de TrabalhoRemoto
Nível de ExperiênciaMais de 10 Anos
Nível de EducaçãoDoutorado

Descrição

***Junte-se à Tether e Ajude a Moldar o Futuro das Finanças Digitais*** Na Tether, não estamos apenas desenvolvendo produtos: estamos liderando uma revolução financeira global. Nossas soluções de ponta capacitam empresas — desde exchanges e carteiras até processadores de pagamentos e caixas eletrônicos — a integrar de forma transparente tokens lastreados em reservas em diversas blockchains. Ao aproveitar o poder da tecnologia blockchain, a Tether permite que você armazene, envie e receba tokens digitais instantaneamente, com segurança e em escala global, tudo isso a uma fração do custo. A transparência é a base de tudo o que fazemos, garantindo confiança em cada transação. ***Inove com a Tether*** **Tether Finance:** Nossa inovadora suíte de produtos inclui a stablecoin mais confiável do mundo, **USDT**, utilizada por centenas de milhões de pessoas em todo o planeta, além de serviços pioneiros de tokenização de ativos digitais. Mas isso é apenas o começo: **Tether Power:** Impulsionando um crescimento sustentável, nossas soluções energéticas otimizam o uso de energia excedente para mineração de Bitcoin, empregando práticas ecologicamente corretas em instalações de última geração e geograficamente diversificadas. **Tether Data:** Impulsionando avanços em IA e tecnologia ponto a ponto, reduzimos os custos de infraestrutura e aprimoramos as comunicações globais com soluções de ponta como **KEET**, nosso aplicativo principal que redefine o compartilhamento seguro e privado de dados. **Tether Education**: Democratizando o acesso ao ensino digital de elite, capacitamos indivíduos a prosperarem nas economias digital e de trabalho sob demanda, impulsionando o crescimento e as oportunidades globais. **Tether Evolution**: Na interseção entre tecnologia e potencial humano, estamos expandindo os limites do que é possível, criando um futuro no qual inovação e capacidades humanas se fundem de maneira poderosa e sem precedentes. ***Por Que Se Juntar a Nós?*** Nossa equipe é uma força global de talentos, trabalhando remotamente de todos os cantos do mundo. Se você é apaixonado por deixar sua marca no setor de fintech, esta é sua oportunidade de colaborar com algumas das mentes mais brilhantes, desafiando limites e estabelecendo novos padrões. Crescemos rapidamente, mantivemo-nos enxutos e consolidamos nossa posição como líder na indústria. Se você possui excelentes habilidades de comunicação em inglês e está pronto para contribuir com a plataforma mais inovadora do planeta, a Tether é o seu lugar. **Você está pronto para fazer parte do futuro?** **Sobre a vaga** Como membro de nossa equipe de modelos de IA, você impulsionará a inovação em arquiteturas de serviço e inferência de modelos para sistemas avançados de IA. Seu trabalho focará na otimização de estratégias de implantação e inferência de modelos, visando entregar desempenho altamente responsivo, eficiente e escalável em aplicações reais. Você trabalhará em uma ampla gama de sistemas, desde modelos eficientes em recursos projetados para ambientes com hardware limitado até arquiteturas complexas multimodais que integram dados como texto, imagens e áudio. Esperamos que você possua profunda especialização no projeto e otimização de pipelines de serviço de modelos e estruturas de inferência, bem como sólida experiência em arquiteturas avançadas de modelos. Você adotará uma abordagem prática e orientada por pesquisa para desenvolver, testar e implementar novas estratégias de serviço e algoritmos de inferência. Suas responsabilidades incluem engenharia de pipelines robustos de inferência, definição de métricas abrangentes de desempenho e identificação e resolução de gargalos em ambientes de produção. O objetivo final é habilitar um desempenho de IA com alta taxa de transferência, baixa latência, pequena ocupação de memória e escalabilidade, entregando valor tangível em cenários dinâmicos do mundo real. **Responsabilidades** * Projetar e implantar arquiteturas de serviço de modelos de última geração que ofereçam alta taxa de transferência e baixa latência, ao mesmo tempo que otimizam o uso de memória. Garantir que esses pipelines funcionem eficientemente em diversos ambientes, incluindo dispositivos com recursos limitados e plataformas de borda. Estabelecer metas claras de desempenho, como redução de latência, melhoria na resposta de tokens e minimização da ocupação de memória. * Construir, executar e monitorar testes controlados de inferência em ambientes simulados e de produção reais. Acompanhar indicadores-chave de desempenho, tais como latência de resposta, taxa de transferência, consumo de memória e taxas de erro, com atenção especial às métricas específicas para dispositivos com recursos limitados. Documentar resultados iterativos e comparar os resultados com benchmarks estabelecidos para validar o desempenho em diferentes plataformas. * Identificar e preparar conjuntos de dados de teste e cenários de simulação de alta qualidade, adaptados aos desafios reais de implantação, especialmente aqueles encontrados em dispositivos com poucos recursos. Definir critérios mensuráveis para garantir que esses recursos avaliem efetivamente o desempenho do modelo, a latência e a utilização de memória sob diversas condições operacionais. * Analisar a eficiência computacional e diagnosticar gargalos no pipeline de serviço, monitorando tanto métricas de processamento quanto de memória. Resolver questões como processamento de lote subótimo, atrasos de rede e alto consumo de memória, a fim de otimizar a infraestrutura de serviço para escalabilidade e confiabilidade em sistemas com recursos limitados. * Trabalhar em estreita colaboração com equipes multifuncionais para integrar estruturas de serviço e inferência otimizadas em pipelines de produção projetados para aplicações de borda e embarcadas. Definir métricas claras de sucesso, como melhoria no desempenho no mundo real, baixas taxas de erro, escalabilidade robusta, uso ótimo de memória e garantir monitoramento contínuo e refinamentos iterativos para melhorias sustentadas. * Graduação em Ciência da Computação ou área correlata. Desejável doutorado em PLN, Aprendizado de Máquina ou área relacionada, complementado por um histórico sólido em P&D em IA (com publicações relevantes em conferências A*). * Conhecimento obrigatório da Metal Shading Language (MSL). Você deve estar confortável escrevendo shaders de computação personalizados do zero. * Experiência comprovada em otimizações de kernel de baixo nível e otimização de inferência em dispositivos móveis é essencial. Suas contribuições devem ter gerado melhorias mensuráveis na latência, taxa de transferência e ocupação de memória durante inferência em aplicações específicas de domínio, particularmente em dispositivos com recursos limitados e plataformas de borda. * É necessário um profundo entendimento das modernas arquiteturas de serviço de modelos e técnicas de otimização de inferência. Isso inclui métodos de ponta para alcançar desempenho de baixa latência e alta taxa de transferência, além de gerenciamento eficiente de memória em diversos cenários de implantação com restrições de recursos. * É obrigatória forte especialização na escrita de kernels GPU para dispositivos móveis (isto é, smartphones), bem como profundo conhecimento de frameworks e motores de serviço de modelos. É exigida experiência prática no desenvolvimento e implantação de pipelines de inferência ponta a ponta, desde a otimização de modelos para serviço eficiente até a integração dessas soluções em dispositivos com recursos limitados. * Capacidade comprovada de aplicar pesquisa empírica para superar desafios no serviço de modelos, como otimização de latência, gargalos computacionais e restrições de memória. Você deve ser proficiente no projeto de frameworks robustos de avaliação e na iteração de estratégias de otimização para continuar expandindo os limites do desempenho de inferência e da eficiência do sistema. * Sistemas Distribuídos de Inferência: Projetar e otimizar mecanismos de inferência de alto desempenho utilizando técnicas como paralelismo de tensores, paralelismo de pipeline e paralelismo de especialistas para lidar com modelos massivos em clusters de GPUs. * Profundo entendimento da matemática e da estrutura por trás dos Modelos de Difusão e dos Transformadores Visuais * Conhecimento de poda (pruning), quantização, atenção Flash (Flash attention), cache KV, decodificação especulativa (Eagle), etc. **Informações importantes para candidatos** Fraudes de recrutamento tornaram-se cada vez mais comuns. Para se proteger, considere atentamente o seguinte ao se candidatar a vagas: * **Candidate-se apenas por nossos canais oficiais.** Não utilizamos plataformas ou agências terceirizadas para recrutamento, exceto quando claramente declarado. Todas as vagas abertas estão listadas em nossa página oficial de carreiras: https://tether.recruitee.com/ * **Verifique a identidade do recrutador.** Todos os nossos recrutadores possuem perfis verificados no LinkedIn. Caso tenha dúvidas, você pode confirmar sua identidade verificando o perfil ou entrando em contato conosco pelo nosso site. * **Tenha cautela com métodos incomuns de comunicação.** Não realizamos entrevistas via WhatsApp, Telegram ou SMS. Toda comunicação ocorre por meio de e-mails e plataformas oficiais da empresa. * **Verifique cuidadosamente os endereços de e-mail.** Toda comunicação da nossa parte virá de e-mails terminados em **@**tether.to **ou @**tether.io * **Nunca solicitamos pagamento ou dados financeiros pessoais.** Se alguém solicitar informações financeiras pessoais ou pagamento em qualquer etapa do processo seletivo, trata-se de uma fraude. Por favor, denuncie imediatamente. **Em caso de dúvida, sinta-se à vontade para entrar em contato por meio do nosso site oficial.**

Alguns conteúdos foram traduzidos automaticamente pelo sistema

Publicado por

João Silva

Indeed · HR

Localização

João Silva

Indeed · HR

Vagas semelhantes

Engenheiro de Pesquisa em IA (Compactação e Quantização de Modelos) - 100% Remoto em Todo o Mundo vaga da Indeed em 2026 | ok.com