Descrição
**Engenharia de Extração Orientada por Especificações:**
* Projetar e manter especificações declarativas de extração — usando modelos Pydantic, esquemas JSON ou linguagens específicas de domínio — que descrevam exatamente quais campos devem ser capturados, seus tipos e regras de validação.
* Implementar pipelines que traduzam essas especificações em planos de extração executáveis, aproveitando tanto back-ends clássicos (Scrapy, Playwright) quanto back-ends aprimorados por IA (análise semântica baseada em LLMs).
* Construir bibliotecas de especificações reutilizáveis para tipos de dados recorrentes (preços de produtos, códigos tarifários, textos regulatórios) para acelerar a incorporação de novas fontes.
* Projetar e implementar **agentes** autônomos de extração de dados capazes de tomar decisões sobre seleção de fontes, lógica de repetição e estratégias de análise.
**Sistemas Autônomos e Autoconsertáveis:**
* Implantar spiders autoconsertáveis que detectem automaticamente alterações no layout de sites e se reconfigurem utilizando servidores Model Context Protocol (MCP) (por exemplo, Scrapy MCP Server, Playwright MCP).
* Integrar extração semântica (Scrapy-LLM, pipelines personalizados com LLMs) para eliminar a fragilidade dos seletores — os spiders confiam em descrições de campos, não em XPaths frágeis.
* Experiência prática na construção de agentes de IA e sistemas de orquestração.
* Orquestrar fluxos de navegação complexos e multi-etapas com frameworks agênicos (BMAD/TEA, agentes semelhantes ao AutoGPT) que raciocinem sobre o estado da página, adaptem-se a medidas anti-bot e corrijam seu próprio comportamento em tempo real.
**Pensamento Plataforma e Reusabilidade:**
* Ir além de scrapers pontuais: construir uma plataforma de extração baseada em componentes, onde seletores, manipuladores de login e lógica de paginação sejam compartilhados, versionados e testados.
* Implementar monitoramento, alertas e reversão automática para execuções de extração com falha.
* Defender a prática ética de crawling por design — limitação de taxa, respeito ao robots.txt e conformidade com GDPR/CCPA são incorporadas à camada de especificações, não adicionadas posteriormente.
**Colaboração e Inovação Contínua:**
* Parceria com cientistas de dados e especialistas de domínio para refinar especificações de extração em domínios complexos e não estruturados (por exemplo, textos jurídicos, classificações tarifárias).
* Avaliar e testar ferramentas emergentes para elevar a cobertura de automação além de 90%.
* Documentar e difundir boas práticas orientadas por especificações em toda a organização de engenharia.
**Qualificação:**
* Graduação em Ciência da Computação
* 3 anos ou mais de experiência em web scraping ou extração de dados
**Habilidades Necessárias:**
* Domínio da linguagem Python
* Experiência com extração orientada por especificações
* Uso prático de **Scrapy-LLM**, **Scrapy MCP Server**, ou sistemas similares que desacoplem definições de campos da estrutura da página
* Experiência com LangChain, LangGraph, LlamaIndex, AutoGen
* Familiaridade com frameworks que concedem controle do navegador a LLMs (Playwright + MCP, BMAD/TEA) para lidar com tarefas de crawling complexas e não determinísticas.
* Fundamentos clássicos de scraping
* Validação e armazenamento de dados — capacidade de definir regras de validação dentro das especificações e inserir dados limpos em bancos de dados SQL/NoSQL ou em data lakes
* Integração básica com APIs e fluxos de autenticação
* HTTP, DOM, XPath, CSS.
**Desejável:**
* Contribuições em projetos de código aberto relacionados a scraping ou automação com IA.
* Contribuições em projetos de código aberto relacionados a scraping ou automação com IA.
* Familiaridade com engenharia de privacidade de dados (GDPR, CCPA) incorporada ao projeto de especificações.
* DevOps básico — Docker, CI/CD para testar especificações de extração.
**Mentalidade e Abordagem (Não Negociável):**
* Firme convicção de que o futuro do scraping é declarativo, não imperativo. Você prefere escrever um esquema que diga “extraia o preço” a depurar um XPath sempre que um site for redesenhado.
* Busca evoluir de “código que faz scraping” para “sistemas que compreendem a extração”
Tipos de Vaga: Integral, Permanente
Remuneração: R$1\.00 \- R$10\.00 por ano
Experiência:
* Extração de Dados: 3 anos (preferencial)
* Modelos Pydantic: 3 anos (preferencial)
* Esquemas JSON: 3 anos (preferencial)
* Servidor Model Context Protocol (MCP): 3 anos (preferencial)
* Scrapy-LLM: 2 anos (preferencial)
* IA Agêncial: 1 ano (preferencial)
* Controle de Navegador por LLMs: 3 anos (preferencial)
* Modelo de Linguagem de Grande Porte (LLM): 2 anos (preferencial)
* Frameworks Agênicos: 1 ano (preferencial)
Local de Trabalho: Remoto