Vou auditar seus números de benchmark de IA ou avaliação de LLM para validade estatística

Algumas informações foram traduzidas automaticamente.

Finlândia

Eu falo Finlandês, Inglês

Especialista em bots de negociação

Sou um Engenheiro Quantitativo que constrói bots de trading personalizados e pipelines de API. Não vendo scripts "fica rico rápido". Construo uma arquitetura de trading sólida e confiável. Meu código...
Sobre este Serviço

 Você receberá um veredicto claro sobre se seu número de benchmark ou avaliação passa pelos testes que ignorou antes de publicá-lo. Eu pego um resultado principal (uma classificação em leaderboard, uma taxa de vitória do LLM como juiz, um "supera a baseline em X%", um expoente de lei de escala) e o testo de forma adversarial: correção de múltiplas comparações, poder estatístico, viés do juiz e reprodução a partir dos seus dados brutos.


 Você recebe uma de duas respostas honestas: ele passa, aqui está a estatística corrigida que você pode citar, ou está dentro do ruído, aqui está o porquê e a correção de uma linha.


 O que diferencia isso é prova, não promessas. Eu escrevi o livro sobre esse modo de falha (Measured, Not Believed), criei a ferramenta de código aberto que realiza as verificações (evalgate) e reproduzi publicamente três reivindicações exageradas reais MT-Bench, RewardBench e uma lei de escala publicada. Cada veredicto que dou é reproduzível a partir dos seus dados; eu mostro o trabalho. E se seu número for real, eu o certifico, um auditor que só encontra falhas é um cínico, não um auditor.