Vou criar um scraper de web agendado e um pipeline de dados com saída limpa e deduplicada

Algumas informações foram traduzidas automaticamente.

Tunísia

Eu falo Árabe, Inglês, Francês

Desenvolvedor de automação e dados com Python

Sou desenvolvedor Python focado em transformar dados bagunçados em saídas confiáveis e estruturadas. Crio web scrapers, pipelines de dados agendados e extratores de texto para JSON, além de consertar ...
Sobre este Serviço

Precisa de dados web atualizados todos os dias ou semana sem precisar rodar um script manualmente? Eu crio um scraper que funciona sozinho em um timer, limpa o que coleta, elimina itens repetidos e te entrega um arquivo ou banco de dados prontos para usar.


O que você recebe: um scraper em Python (Playwright ou Scrapy, dependendo do site), execuções automáticas na sua máquina ou servidor, validação de cada registro, uma chave única por item para evitar repetições, tentativas quando o site está lento e um log que explica de forma clara se uma execução falhou e o motivo. Saída: CSV, XLSX, JSON ou SQLite.


Por que me escolher: para um cliente, criei uma pipeline semelhante: ingestão diária de registros públicos, remoção de duplicatas, pontuação baseada em regras, execuções automáticas e recuperação de falhas. Uma execução de um mês real processou 318.962 registros em cerca de 34 minutos, sem erros. O cliente é confidencial.


Não inclui: sites protegidos por login que você não possui, bypass de CAPTCHA, dados cuja coleta é proibida pelos termos do site, custos de hospedagem ou proxy. Te aviso de antemão se um site não for compatível.

Tecnologia:

Python

•

Excel

•

scrapy

•

dramaturgo

•

Pandas

Tipo de informação:

Pesquisa de concorrentes

•

Listagens

Técnica:

Automatizado

Meu portfólio