LNData LNData
Voltar ao portfólio Cliente · Masterfarma

O preço de cada concorrente, região a região, atualizado sozinho.

Projetei e construí a Discovery Stack — a plataforma que acompanha, sozinha e a cada quinze dias, por quanto o varejo farmacêutico vende cada produto no Brasil. Ela reúne os preços de redes concorrentes e de bases públicas do governo, organiza tudo num só lugar e entrega pronto para a Masterfarma comparar preço por produto, por região e por concorrente.

Papel · Arquitetura de infraestrutura, engenharia de dados, orquestração, engenharia reversa de APIs e scraping resiliente
Escopo · Projeto ponta a ponta · em produção
Em resumo, para quem decide
O problema

A Masterfarma precisava saber por quanto os concorrentes vendem cada remédio, em cada região — mas esse preço estava espalhado por vários sites e bases do governo, cada um num formato, impossível de acompanhar na mão.

O que a LNData fez

Construímos uma plataforma que coleta esses preços sozinha, a cada quinze dias, junta tudo num só lugar e entrega pronto para comparar por produto, região e concorrente.

O resultado

A rede passou a enxergar o preço real praticado em 14 estados num painel único e a decidir preço e compra com base em número atualizado — sem planilha manual e sem depender de ninguém digitar.

Rede Masterfarma
4
fontes de dados monitoradas
14
UFs com preço regional real
~80 mil
EANs por janela de 30 dias
quinzenal
cadência automatizada
5
pipelines orquestrados em cascata
~869
categorias mapeadas entre as fontes
64
tasks de scraping em paralelo por run
milhões
de observações de preço no data warehouse
A engenharia por trás — para quem quer o detalhe técnico

Arquitetura

A plataforma coleta de múltiplas fontes com técnicas distintas, normaliza e conforma tudo num data warehouse colunar orientado a OLAP e entrega o resultado como comparação de preços entre concorrentes, fontes governamentais e regiões.

Fontes de dados
  • Drogaraia · 14 UFs · GraphQL reverso
  • Preço Popular · VTEX Intelligent Search
  • Nota Paraná · API gov.
  • Menor Preço Brasil · SVRS-SC autenticada
Plataforma de dados
Orquestração Airflow · CeleryExecutor
Data warehouse ClickHouse (OLAP)
Scraping resiliente · conteinerizada · nginx TLS
Consumo
  • Dashboards de BI · Superset
  • Comparação por EAN, região e concorrente
  • Modelo unificado · redes + bases gov.

Fontes monitoradas

Duas redes concorrentes e duas bases governamentais de menor preço — cada uma exigindo uma técnica de coleta própria, todas convergindo para o mesmo modelo de dados.

Concorrente · rede nacional

Drogaraia em 14 estados

Catálogo completo com preço regional real por CEP, EAN, marca, princípio ativo e dosagem — via interceptação de tráfego de rede e GraphQL reverso.

Concorrente · plataforma VTEX

Preço Popular via Intelligent Search

Engenharia reversa da API de busca da VTEX, com fallback de ordenação e descoberta dinâmica de categorias, gravado no mesmo modelo da Drogaraia.

Base governamental · PR

Menor preço via NFe (Paraná)

API pública do Menor Preço / Nota Paraná consultada por GTIN e região, semeada pelo próprio catálogo já coletado — o pipeline se retroalimenta.

Base governamental · SC

Menor preço autenticado (Santa Catarina)

API SVRS / gov.br com Bearer token, busca por latitude/longitude e raio, e alerta automatizado quando a credencial se aproxima da expiração.

Engenharia aplicada

As decisões técnicas que tornam a coleta precisa e resistente — não uma prova de conceito, mas uma plataforma que roda sozinha em produção.

Interceptação de rede, não scraping de DOM

Em vez de raspar HTML frágil, a coleta escuta as respostas de rede e extrai os dados direto do JSON da própria aplicação (__NEXT_DATA__, GraphQL) — robusto a mudanças de layout.

Sessões geolocalizadas por CEP

A automação abre e confirma o CEP de cada UF e persiste a sessão do navegador, capturando o preço regional correto sem repetir o handshake a cada categoria.

Paralelismo determinístico

Dynamic Task Mapping e chunking por hash dividem ~80 mil EANs em fatias estáveis, processadas em paralelo, com rate limiting por Pool para não sobrecarregar a fonte.

Produção · Resiliência & operação

Feita para rodar sem babá

Scraping em produção falha o tempo todo — sites mudam, APIs limitam, sessões caem. A plataforma trata a falha como caso esperado: isola o que quebrou, se recupera sozinha e deixa rastro do que aconteceu.

Retry em três camadas

Retry da task, retry por página com estratégias progressivas e um gate de sessão que pula uma região inteira com elegância quando ela falha — sem derrubar o run.

Rate limiting real

Airflow Pools limitam a concorrência contra cada site-alvo independentemente do paralelismo do cluster, mantendo a coleta dentro do que a fonte tolera.

Modo dry-run acionável

Uma Airflow Variable liga um modo de teste (1 categoria / 1 região / 1 página) para validar mudanças direto em produção, com segurança e sem disparar o downstream.

Observabilidade de falhas

Toda falha é gravada numa tabela de erros estruturada — empresa, local, caminho, erro — em vez de apenas quebrar a task, com diagnóstico de throttling por tipo.

Airflow PoolsTaskGroupsDynamic Task MappingVariablescron

Impacto

Preços de concorrentes e de bases governamentais, antes dispersos e invisíveis, agora vivem numa única fonte analítica — comparáveis por EAN.

Preço regional real: a plataforma enxerga o valor praticado em cada um dos 14 estados, e não um preço nacional genérico.

Modelo de dados unificado — redes concorrentes e bases gov. na mesma tabela — habilita comparação direta com queries rápidas sobre milhões de linhas.

Coleta autônoma e auditável: pipelines encadeados rodam sozinhos duas vezes por mês, com trilha de erros e alertas de credencial, exigindo mínima intervenção.

Stack da plataforma

PythonAirflow (Celery)ClickHousePostgreSQLRedisPlaywrightDockernginx

Precisa monitorar preços ou coletar dados na web?

De engenharia reversa de APIs a scraping resiliente em produção, com data warehouse e BI no fim — conte o que você precisa acompanhar e retornamos com escopo, prazo e entregáveis.

Falar com a LNData