Vou automatizar a extração de dados de PDF para Excel CSV ou json com python
Engenheiro de Machine Learning para Agentes LLM RAG e Automação em Python
Sobre este Serviço
Pare de copiar dados de documentos manualmente. Eu vou criar um script em Python reutilizável que extrai campos ou tabelas acordados de PDFs baseados em texto para Excel, CSV ou JSON.
Sou engenheiro de IA/ML com mais de 4 anos de experiência em Python, NLP e automação de processamento de documentos. Meu trabalho inclui extração de chave-valor, ingestão em lote e fluxos de validação de dados.
Básico: um layout consistente, até 20 páginas e 10 campos.
Standard: até 2 layouts, 100 páginas e 20 campos, com processamento em lote e limpeza de saída.
Premium: até 3 layouts, 300 páginas e 30 campos, com verificações de validação e relatórios de erro.
Cada pacote inclui código fonte em Python, um formato de saída acordado, resultados de exemplo e instruções de configuração. Revisões se aplicam aos layouts e campos acordados. PDFs escaneados, escrita manual, mudanças de layout, integrações externas e implantação requerem um escopo personalizado. Taxas de OCR de terceiros ou API são separadas.
Por favor, envie uma amostra sanitizada e suas colunas de saída desejadas antes de fazer o pedido. Eu verificarei a viabilidade e confirmarei as regras de extração.
Tecnologia:
Python
Meu portfólio
Perguntas frequentes
Tradução automática
Você suporta PDFs escaneados ou escrita manual?
Os pacotes listados cobrem PDFs baseados em texto. OCR e escrita manual requerem revisão de amostra e cotação separada; a qualidade da extração depende da fonte.
Vou receber um script reutilizável?
Sim. Todos os pacotes incluem código fonte em Python e instruções de configuração para os layouts acordados, além de uma saída de exemplo em um formato: Excel, CSV ou JSON.
O que conta como um layout de documento?
Um layout é uma estrutura consistente de campos e tabelas. Modelos diferentes de fatura ou estruturas de página substancialmente alteradas contam como layouts separados.
