Eu vou extrair qualquer site público em um conjunto de dados limpo em csv ou json
Limpeza de Dados, Web Scraping e Automação de Planilhas
Sobre este Serviço
Você recebe um conjunto de dados limpo em CSV e JSON de qualquer site público, geralmente em até 48 horas.
Me envie a URL e os campos que você precisa, como nome do produto, preço, avaliação e link, e eu retorno um conjunto de dados estruturado mais um relatório de cobertura que mostra exatamente quais páginas foram visitadas e quão completo está cada campo.
Como funciona: um navegador headless carrega cada página como um visitante real, assim listagens renderizadas por JavaScript funcionam. o robots.txt é verificado antes de cada solicitação e obedecido. A paginação é seguida automaticamente até o limite que você definir, com uma pausa deliberada entre as páginas.
Você recebe dataset.csv, dataset.json e coverage.md, que listam cada página visitada com seu status e contagem de registros, além de uma porcentagem de completude por campo para que você possa ver o que a fonte realmente não tinha.
Somente páginas públicas. Não faço scraping atrás de logins ou paywalls, não bypass CAPTCHAs ou limites de taxa, e não coleto dados pessoais de contato como listas de e-mails ou telefones. Por favor, não peça esses.
Este é um fluxo de trabalho assistido por IA com revisão humana antes da entrega. Envie a URL primeiro e eu direi honestamente se é possível fazer.
Tecnologia:
Python
•
Beautiful Soup
•
dramaturgo
•
Pandas
Técnica:
Automatizado
Meu portfólio
Perguntas frequentes
Tradução automática
Você consegue fazer scraping de um site que precisa de login?
Não. Este serviço cobre apenas páginas acessíveis publicamente. Qualquer coisa atrás de login, paywall ou CAPTCHA está fora do escopo e eu recusarei, ao invés de tentar.
Você pode montar uma lista de e-mails ou números de telefone?
Não. Eu não coleto dados pessoais de contato. Isso viola os termos do Fiverr e a lei de privacidade na maioria dos países. Dados públicos de listagens comerciais, como nomes de empresas, categorias, preços e URLs públicos, tudo bem.
E se o site bloquear o scraping no robots.txt?
Eu verifico o robots.txt antes de cada solicitação e o respeito. Se o caminho estiver proibido, te aviso antes de começar e cancelo o pedido, ao invés de tentar contornar.
Os dados que preciso estão na página de cada item, não na lista. Você consegue pegar?
Sim, essa é a camada Premium. A listagem é coletada primeiro e depois cada página de detalhes é visitada e mesclada na mesma linha. Me diga quais campos ficam na página de detalhes.
Você usa IA para isso?
Sim, esse é um fluxo de trabalho assistido por IA e um humano revisa cada entrega antes de enviá-la. O conjunto de dados é produzido somente para o seu pedido.

