Drogaraia em 14 estados
Catálogo completo com preço regional real por CEP, EAN, marca, princípio ativo e dosagem — via interceptação de tráfego de rede e GraphQL reverso.
Projetei e construí a Discovery Stack — a plataforma que acompanha, sozinha e a cada quinze dias, por quanto o varejo farmacêutico vende cada produto no Brasil. Ela reúne os preços de redes concorrentes e de bases públicas do governo, organiza tudo num só lugar e entrega pronto para a Masterfarma comparar preço por produto, por região e por concorrente.
A Masterfarma precisava saber por quanto os concorrentes vendem cada remédio, em cada região — mas esse preço estava espalhado por vários sites e bases do governo, cada um num formato, impossível de acompanhar na mão.
Construímos uma plataforma que coleta esses preços sozinha, a cada quinze dias, junta tudo num só lugar e entrega pronto para comparar por produto, região e concorrente.
A rede passou a enxergar o preço real praticado em 14 estados num painel único e a decidir preço e compra com base em número atualizado — sem planilha manual e sem depender de ninguém digitar.
A plataforma coleta de múltiplas fontes com técnicas distintas, normaliza e conforma tudo num data warehouse colunar orientado a OLAP e entrega o resultado como comparação de preços entre concorrentes, fontes governamentais e regiões.
Duas redes concorrentes e duas bases governamentais de menor preço — cada uma exigindo uma técnica de coleta própria, todas convergindo para o mesmo modelo de dados.
Catálogo completo com preço regional real por CEP, EAN, marca, princípio ativo e dosagem — via interceptação de tráfego de rede e GraphQL reverso.
Engenharia reversa da API de busca da VTEX, com fallback de ordenação e descoberta dinâmica de categorias, gravado no mesmo modelo da Drogaraia.
API pública do Menor Preço / Nota Paraná consultada por GTIN e região, semeada pelo próprio catálogo já coletado — o pipeline se retroalimenta.
API SVRS / gov.br com Bearer token, busca por latitude/longitude e raio, e alerta automatizado quando a credencial se aproxima da expiração.
As decisões técnicas que tornam a coleta precisa e resistente — não uma prova de conceito, mas uma plataforma que roda sozinha em produção.
Em vez de raspar HTML frágil, a coleta escuta as respostas de rede e extrai os dados direto do JSON da própria aplicação (__NEXT_DATA__, GraphQL) — robusto a mudanças de layout.
A automação abre e confirma o CEP de cada UF e persiste a sessão do navegador, capturando o preço regional correto sem repetir o handshake a cada categoria.
Dynamic Task Mapping e chunking por hash dividem ~80 mil EANs em fatias estáveis, processadas em paralelo, com rate limiting por Pool para não sobrecarregar a fonte.
Scraping em produção falha o tempo todo — sites mudam, APIs limitam, sessões caem. A plataforma trata a falha como caso esperado: isola o que quebrou, se recupera sozinha e deixa rastro do que aconteceu.
Retry da task, retry por página com estratégias progressivas e um gate de sessão que pula uma região inteira com elegância quando ela falha — sem derrubar o run.
Airflow Pools limitam a concorrência contra cada site-alvo independentemente do paralelismo do cluster, mantendo a coleta dentro do que a fonte tolera.
Uma Airflow Variable liga um modo de teste (1 categoria / 1 região / 1 página) para validar mudanças direto em produção, com segurança e sem disparar o downstream.
Toda falha é gravada numa tabela de erros estruturada — empresa, local, caminho, erro — em vez de apenas quebrar a task, com diagnóstico de throttling por tipo.
Preços de concorrentes e de bases governamentais, antes dispersos e invisíveis, agora vivem numa única fonte analítica — comparáveis por EAN.
Preço regional real: a plataforma enxerga o valor praticado em cada um dos 14 estados, e não um preço nacional genérico.
Modelo de dados unificado — redes concorrentes e bases gov. na mesma tabela — habilita comparação direta com queries rápidas sobre milhões de linhas.
Coleta autônoma e auditável: pipelines encadeados rodam sozinhos duas vezes por mês, com trilha de erros e alertas de credencial, exigindo mínima intervenção.
De engenharia reversa de APIs a scraping resiliente em produção, com data warehouse e BI no fim — conte o que você precisa acompanhar e retornamos com escopo, prazo e entregáveis.