Vou fazer a raspagem de dados de ecommerce em massa e construir um crawler confiável
Aplicativos web de negócios e coleta de dados de ecommerce
Sobre este Serviço
Obtenha dados estruturados de ecommerce em grande escala, nada de tarefas manuais com planilhas.
Eu crio crawlers para dados de marketplaces públicos ou autorizados, incluindo descoberta de categorias, paginação, mapeamento de produto para vendedor, deduplicação, pontos de verificação e exportações em CSV/JSON.
O trabalho documentado inclui um conjunto de dados finalizado do Gmarket com 32.820 produtos distintos e 4.203 vendedores, além de uma execução no Coupang abrangendo 13 categorias com 11.101 entradas de produtos e 819 vendedores deduplicados. Esses são resultados de projetos anteriores, não volume ou velocidade prometidos para seu site.
Minha experiência inclui ambientes protegidos pelo Akamai no Coupang: identificação de desafios de acesso, registro de falhas e recuperação de execuções interrompidas. As condições de acesso precisam ser testadas; não prometo bypass universal.
BÁSICO: piloto de uma fonte, até 500 registros e código de extração.
PADRÃO: até 2 fontes acordadas, até 10.000 registros, deduplicação, suporte a retomada e notas de execução.
PRIME: até 3 estruturas de fontes acordadas, 50.000 registros, coleta em lotes retomável, validação e entrega.
O código fonte está incluso. Taxas de proxy, serviço de dados e hospedagem são separadas. Envie URLs de destino, campos e volume pretendido antes de pedir para que eu possa confirmar a viabilidade.
Tecnologia:
Python
•
dramaturgo
Técnica:
Automatizado
Meu portfólio
Perguntas frequentes
Tradução automática
Você já trabalhou com sites de ecommerce protegidos pelo Akamai?
Sim. Os registros do projeto documentam a coleta do Coupang em ambiente protegido pelo Akamai, com classificação de desafios, diagnósticos e recuperação. Os resultados dependem do ambiente testado e das condições de acesso; isso não garante acesso a todos os sites protegidos.
O que significam os números de coleta do portfólio?
Gmarket: 32.820 produtos distintos e 4.203 vendedores em um conjunto de dados recuperado/finalizado, não todas as categorias planejadas. Coupang: 11.101 entradas de produtos por categoria em 13 categorias e 819 vendedores deduplicados. Estes são execuções passadas separadas, não promessas de velocidade.
Custos de proxy e serviços de terceiros estão incluídos?
Não. Quaisquer custos necessários de proxy, provedores de dados ou hospedagem são acordados separadamente antes do pedido. A viabilidade depende do site alvo, acesso permitido e campos disponíveis.
Você consegue coletar qualquer número de registros solicitado?
Limites de escopo: Básico 1 fonte/100 páginas/500 registros; Padrão 2 fontes/2000 páginas/10000 registros; Prime 3 fontes/10000 páginas/50000 registros. A coleta para ao atingir o limite acordado. Os registros disponíveis e a viabilidade da fonte são confirmados antes do pedido.
Que dados e arquivos vou receber?
Os campos acessíveis acordados, um esquema consistente em CSV/JSON, resultados deduplicados, código fonte e notas de execução. Identificadores públicos de produtos, links de categorias e registros de vendedores comerciais são exemplos; a disponibilidade é verificada por fonte.
O que acontece se a coleta for interrompida?
Os planos Padrão e Prime incluem suporte a retomada/pontos de verificação para o fluxo de trabalho acordado e registros para trabalhos incompletos. Uma reformulação do site ou uma nova restrição de acesso pode exigir uma atualização com escopo separado; manutenção contínua não está incluída.

