Chat rápido, melhores ofertas — Baixar

Engenheiro de Extração de Dados

R$1-10/Ano
Indeed

Empresa

Tipo de empregoTempo Integral
Modalidade de TrabalhoRemoto
Nível de Experiência1 a 2 Anos
Nível de EducaçãoDiploma de Graduação

Descrição

**Engenharia de Extração Orientada por Especificações:** * Projetar e manter especificações declarativas de extração — usando modelos Pydantic, esquemas JSON ou linguagens específicas de domínio — que descrevam exatamente quais campos devem ser capturados, seus tipos e regras de validação. * Implementar pipelines que traduzam essas especificações em planos de extração executáveis, aproveitando tanto back-ends clássicos (Scrapy, Playwright) quanto back-ends aprimorados por IA (análise semântica baseada em LLMs). * Construir bibliotecas de especificações reutilizáveis para tipos de dados recorrentes (preços de produtos, códigos tarifários, textos regulatórios) para acelerar a incorporação de novas fontes. * Projetar e implementar **agentes** autônomos de extração de dados capazes de tomar decisões sobre seleção de fontes, lógica de repetição e estratégias de análise. **Sistemas Autônomos e Autoconsertáveis:** * Implantar spiders autoconsertáveis que detectem automaticamente alterações no layout de sites e se reconfigurem utilizando servidores Model Context Protocol (MCP) (por exemplo, Scrapy MCP Server, Playwright MCP). * Integrar extração semântica (Scrapy-LLM, pipelines personalizados com LLMs) para eliminar a fragilidade dos seletores — os spiders confiam em descrições de campos, não em XPaths frágeis. * Experiência prática na construção de agentes de IA e sistemas de orquestração. * Orquestrar fluxos de navegação complexos e multi-etapas com frameworks agênicos (BMAD/TEA, agentes semelhantes ao AutoGPT) que raciocinem sobre o estado da página, adaptem-se a medidas anti-bot e corrijam seu próprio comportamento em tempo real. **Pensamento Plataforma e Reusabilidade:** * Ir além de scrapers pontuais: construir uma plataforma de extração baseada em componentes, onde seletores, manipuladores de login e lógica de paginação sejam compartilhados, versionados e testados. * Implementar monitoramento, alertas e reversão automática para execuções de extração com falha. * Defender a prática ética de crawling por design — limitação de taxa, respeito ao robots.txt e conformidade com GDPR/CCPA são incorporadas à camada de especificações, não adicionadas posteriormente. **Colaboração e Inovação Contínua:** * Parceria com cientistas de dados e especialistas de domínio para refinar especificações de extração em domínios complexos e não estruturados (por exemplo, textos jurídicos, classificações tarifárias). * Avaliar e testar ferramentas emergentes para elevar a cobertura de automação além de 90%. * Documentar e difundir boas práticas orientadas por especificações em toda a organização de engenharia. **Qualificação:** * Graduação em Ciência da Computação * 3 anos ou mais de experiência em web scraping ou extração de dados **Habilidades Necessárias:** * Domínio da linguagem Python * Experiência com extração orientada por especificações * Uso prático de **Scrapy-LLM**, **Scrapy MCP Server**, ou sistemas similares que desacoplem definições de campos da estrutura da página * Experiência com LangChain, LangGraph, LlamaIndex, AutoGen * Familiaridade com frameworks que concedem controle do navegador a LLMs (Playwright + MCP, BMAD/TEA) para lidar com tarefas de crawling complexas e não determinísticas. * Fundamentos clássicos de scraping * Validação e armazenamento de dados — capacidade de definir regras de validação dentro das especificações e inserir dados limpos em bancos de dados SQL/NoSQL ou em data lakes * Integração básica com APIs e fluxos de autenticação * HTTP, DOM, XPath, CSS. **Desejável:** * Contribuições em projetos de código aberto relacionados a scraping ou automação com IA. * Contribuições em projetos de código aberto relacionados a scraping ou automação com IA. * Familiaridade com engenharia de privacidade de dados (GDPR, CCPA) incorporada ao projeto de especificações. * DevOps básico — Docker, CI/CD para testar especificações de extração. **Mentalidade e Abordagem (Não Negociável):** * Firme convicção de que o futuro do scraping é declarativo, não imperativo. Você prefere escrever um esquema que diga “extraia o preço” a depurar um XPath sempre que um site for redesenhado. * Busca evoluir de “código que faz scraping” para “sistemas que compreendem a extração” Tipos de Vaga: Integral, Permanente Remuneração: R$1\.00 \- R$10\.00 por ano Experiência: * Extração de Dados: 3 anos (preferencial) * Modelos Pydantic: 3 anos (preferencial) * Esquemas JSON: 3 anos (preferencial) * Servidor Model Context Protocol (MCP): 3 anos (preferencial) * Scrapy-LLM: 2 anos (preferencial) * IA Agêncial: 1 ano (preferencial) * Controle de Navegador por LLMs: 3 anos (preferencial) * Modelo de Linguagem de Grande Porte (LLM): 2 anos (preferencial) * Frameworks Agênicos: 1 ano (preferencial) Local de Trabalho: Remoto

Alguns conteúdos foram traduzidos automaticamente pelo sistema

Publicado por

João Silva

Indeed · HR

Localização

João Silva

Indeed · HR

Vagas semelhantes

Engenheiro de Extração de Dados vaga da Indeed em 2026 | ok.com