Vou criar conjunto de dados massivo para treinamento de IA
Desenvolvedor Python, Especialista em Extração de Dados
Verificado pelo Fiverr Pro
Kawsar foi selecionado pela equipe do Fiverr Pro considerando sua experiência.
Verificado para
Data Scraping
Processamento de Dados
Sobre este Serviço
Você precisa de um conjunto de dados grande e limpo para treinar ou ajustar um modelo de IA, não um dump de raspagem bagunçado ou um arquivo de amostra pequeno.
Esse é o trabalho que faço. Sou Kawsar, um desenvolvedor Python que constrói raspagem de dados para conjuntos de dados massivos para treinamento de IA a partir de fontes públicas, geração sintética e exportações estruturadas em CSV ou JSON.
O que entrego:
- Conjuntos de dados personalizados para treinamento de IA, dimensionados de acordo com seu pacote e esquema
- Coleta pública na web e/ou linhas sintéticas quando dados seguros para privacidade são necessários
- CSV, JSON ou Excel limpos, prontos para preparação de ML e LLM
- Mapeamento de campos, deduplicação básica e um breve dicionário de dados
- Script de coleta em Python opcional no pacote Premium
- Amostras gratuitas de linhas antes da construção completa para você aprovar o esquema primeiro
- Exportação em JSONL pronta para ajuste fino de LLM (formatos OpenAI, Hugging Face e Llama)
Construo conjuntos de dados personalizados para equipes de ML e IA. O volume depende do pacote e da dificuldade da fonte. Apenas dados públicos.
Envie sua esquema, volume alvo e caso de uso antes de fazer o pedido.
NOTA:
- Apenas dados públicos. O comprador fornece esquema e URLs alvo ao fazer a raspagem
- Construção personalizada por pedido
- Sem coleta de dados pessoais
- Sem tarefas escolares ou universitárias
Plataforma:
mySQL
•
PL/SQL
•
PostgreSQL
•
SQLite
•
SQL Server
Especialidade:
Design
•
Normalização
•
SQL
•
NoSQL
•
Desempenho
Clientes com quem já trabalhei
MyHeritage
Internet Software & Services
I've been hired to carry out certain web extraction-related jobs in order to build a database for user reviews, which will be used to develop the product and make changes in certain instances.
mai. de 2022-mai. de 2023
Fiverr
Internet Software & Services
The project was to gather a detailed list of 5000 keywords from various profession types and list their Google Rank, Link, and even Local Search Results, etc. Information and make a Report with these!
jul. de 2024
Meu portfólio
Perguntas frequentes
Tradução automática
Que tipo de conjuntos de dados você cria?
Conjuntos de dados estruturados para treinamento de IA para preparação de ML e LLM: CSV/JSON tabular, corpora de texto e coleções de fontes públicas. Rotulagem de CV com muitas imagens pode ser incluída quando for adequada.
Você faz raspagem na web ou gera dados sintéticos?
Ambos. Escolhemos coleta pública, geração sintética ou uma combinação, com base no seu esquema, necessidades de privacidade e volume alvo.
Você também vai treinar meu modelo?
Este serviço é para criar o conjunto de dados. Treinamento de modelo e ajuste fino de LLM são serviços separados, se precisar disso depois.
Quais arquivos eu recebo?
CSV, JSON, JSONL ou Excel, além de um breve dicionário de dados. O pacote Premium pode incluir um script em Python usado para construir ou atualizar o conjunto.
Preciso fornecer um esquema?
Sim. Envie nomes de colunas, rótulos, formatos e linhas de exemplo, se tiver. Assim, o conjunto fica pronto para o modelo.
O trabalho com LoRA ou conjuntos de dados de influenciadores de IA está incluso?
Não. Este serviço é para dados de treinamento de ML/IA, não para pacotes de influenciadores LoRA.
Isso é para tarefas escolares ou universitárias?
Não. Não faço tarefas escolares ou universitárias.

