Parece que este serviço está em espera
Vou raspar sites e documentos em dados limpos em markdown para llm e rag
Holanda
Desenvolvedor de Web Scraping em Python e Extração de Dados
Sobre este Serviço
Precisa transformar um site ou documentação em dados limpos e estruturados? É isso que eu faço.
Construo scrapers personalizados em Python que percorrem um site e transformam cada página em Markdown, CSV ou JSON limpo, com metadados, um manifesto e um relatório de cobertura, para você saber exatamente o que foi capturado. Ideal para datasets de LLM e RAG, bases de conhecimento, pesquisas e migrações.
O que você recebe:
- Dados limpos e estruturados no formato de sua preferência
- Deduplicação + relatório de cobertura (sem lixo, sem páginas faltantes)
- Sites renderizados com JavaScript tratados com Playwright, não apenas HTML estático
- Dados que eu mesmo executo e verifico antes de entregar
Como eu trabalho, de forma honesta:
- Respeito robots.txt, limites de taxa e termos do site
- Sem burlar anti-bot ou CAPTCHA. Se um site estiver protegido, te aviso antes de você fazer o pedido
- Scrapers dependem da estrutura atual do site; mudanças futuras são uma tarefa separada
Quer o código fonte ou atualizações recorrentes de dados? Ambos estão disponíveis como extras.
Me envie uma mensagem com o site e os dados que precisa, e te direi honestamente se é uma combinação adequada e como eu abordaria.
Tecnologia:
Python
•
Beautiful Soup
•
dramaturgo
•
Pandas
Técnica:
Automatizado
Perguntas frequentes
Tradução automática
Você pode raspar qualquer site?
Na maioria dos sites estáticos e renderizados com JavaScript, sim. Não burolo proteções anti-bot ou CAPTCHA, então uma pequena parcela de sites altamente protegidos está fora do escopo. Sempre te aviso antes de você fazer o pedido.
Em que formato receberei os dados?
Markdown, CSV ou JSON, o que você preferir, além de um manifesto e um relatório de cobertura. Posso combinar formatos se necessário.
O scraper vai continuar funcionando depois?
Ele funciona contra o site como está na entrega. Se o site mudar sua estrutura depois, atualizar é uma tarefa separada, e ofereço atualizações de dados como extra.
Eu recebo o código-fonte?
Por padrão, você recebe os dados. O código fonte completo em Python com um README está disponível como extra, caso queira rodar você mesmo.

