Vou criar um crawler de web em python e um scraper agendado com um banco de dados
Engenheiro de Dados Python: Web Scraping, pipelines ETL e enriquecimento de dados
Nível 1
Atendeu a determinados critérios de desempenho e demonstra forte potencial no marketplace.
Sobre este Serviço
Um scraper que roda uma vez é um arquivo. Um scraper que roda toda semana é um sistema, e a diferença é o que acontece no dia em que o site muda seu layout. A maioria quebra silenciosamente, e o painel fica errado por duas semanas antes de alguém perceber.
O que eu faço
- Scrapers e crawlers personalizados em Python, para um site ou vários
- Execuções agendadas no seu servidor ou na nuvem, escrevendo em PostgreSQL, BigQuery ou Sheets
- Tentativas, limitação de taxa, rotação de proxy e tratamento para logins e JavaScript
- Alertas quando um campo começa a ficar vazio, que é como a quebra silenciosa é detectada
O que você recebe
- O scraper funcionando e o código fonte, seu para manter e modificar
- Documentação de configuração escrita para quem for rodar depois, não só para você
- Uma passagem rápida para que possa ser redeployado sem minha ajuda
Eu criei o crawler que coletou e estruturou as declarações de proxy de todas as principais companhias aéreas dos EUA e da Europa.
Prefiro te dizer que uma fonte é uma má ideia do que construir algo frágil em cima dela. Envie o site e com que frequência você precisa dos dados, e eu farei o escopo e o orçamento antes de você fazer o pedido.
Meu portfólio
Perguntas frequentes
Tradução automática
Eu recebo o código-fonte?
Sim, tudo isso, e é seu para modificar, redistribuir ou passar para outro desenvolvedor. Sem licença, sem dependência de runtime comigo, sem ofuscação. O repositório vem com um readme cobrindo instalação, configuração e como alterar os campos que ele coleta.
Ele pode rodar sem que eu precise mexer nele?
Para isso servem as versões Standard e Premium. Agendado no seu próprio servidor, uma pequena VM na nuvem ou AWS Lambda, com logs que você pode ler e alertas quando uma execução falha ou não retorna nada. Onde ele roda é sua escolha, e eu posso configurar onde você preferir.
O que acontece quando o site muda e quebra?
Duas coisas reduzem os problemas. Seletores escritos contra uma estrutura estável, ao invés de nomes de classes gerados, assim redesigns pequenos não quebram. E uma checagem de validação que avisa quando um campo começa a retornar vazio, para você descobrir no mesmo dia, ao invés de duas semanas depois.
Para quais bancos de dados ele pode escrever?
PostgreSQL, MySQL, SQLite, BigQuery, MongoDB ou arquivos CSV e Parquet simples, se um banco de dados for mais do que você precisa. Google Sheets funciona para volumes menores. Me diga qual é o destino dos dados depois, e eu escrevo para o que for necessário.
Ele consegue acompanhar preços ou estoque ao longo do tempo?
Sim, e essa é uma das melhores razões para construir ao invés de comprar uma extração pontual. Execuções agendadas com histórico mantido significam que você consegue ver movimentações ao invés de uma foto. A versão Premium inclui a detecção de mudanças e os alertas associados.
E quanto a proteção anti-bot pesada?
Sessões reais no Playwright, rotação de proxy residencial, timing humanizado e persistência de sessão. A maioria dos sites é gerenciável. Alguns não valem o custo, e eu vou dizer isso ao invés de te passar um orçamento para uma luta. Envie o URL primeiro e eu verifico.
Você pode manter o SaaS após a entrega?
Manutenção mensal está disponível como um serviço separado: eu monitoro os alertas, conserto quebras e ajusto quando a fonte muda. Muitos clientes pegam o código e rodam por conta própria, por isso as docs são escritas para um estranho.
Como isso é diferente do seu serviço de web scraping?
Esse serviço entrega um arquivo. Este entrega uma máquina que gera o arquivo. Se você precisa dos dados uma única vez, peça esse, é mais barato e rápido. Se precisar novamente no próximo mês, esse é o ideal, e a segunda execução paga por si mesma.
Quanto tempo leva para construir?
Três dias para um scraper de site único com código fonte. Cinco dias quando agendado e escrevendo em um banco de dados. Sete dias para um crawler de múltiplos sites com monitoramento e documentação de entrega. Eu cito a data após ver o site, e a complexidade pode adiantar antes de você pedir.
Você consegue consertar ou assumir um scraper feito por outra pessoa?
Sim. Me envie o repositório e diga o que está errado. Eu retorno com o que está quebrado, se consertar é mais barato do que refazer, e uma resposta honesta quando não for. Às vezes, o código está bom e a fonte mudou.
