Vou auditar seus números de benchmark de IA ou avaliação de LLM para validade estatística
Especialista em bots de negociação
Sobre este Serviço
Você receberá um veredicto claro sobre se seu número de benchmark ou avaliação passa pelos testes que ignorou antes de publicá-lo. Eu pego um resultado principal (uma classificação em leaderboard, uma taxa de vitória do LLM como juiz, um "supera a baseline em X%", um expoente de lei de escala) e o testo de forma adversarial: correção de múltiplas comparações, poder estatístico, viés do juiz e reprodução a partir dos seus dados brutos.
Você recebe uma de duas respostas honestas: ele passa, aqui está a estatística corrigida que você pode citar, ou está dentro do ruído, aqui está o porquê e a correção de uma linha.
O que diferencia isso é prova, não promessas. Eu escrevi o livro sobre esse modo de falha (Measured, Not Believed), criei a ferramenta de código aberto que realiza as verificações (evalgate) e reproduzi publicamente três reivindicações exageradas reais MT-Bench, RewardBench e uma lei de escala publicada. Cada veredicto que dou é reproduzível a partir dos seus dados; eu mostro o trabalho. E se seu número for real, eu o certifico, um auditor que só encontra falhas é um cínico, não um auditor.
Perguntas frequentes
Tradução automática
E se meu número acabar sendo bom?
Então eu certifico e você recebe um atestado limpo e citável de saúde. Essa é uma consequência válida e comum — não uma falha na avaliação. Um auditor que só encontra falhas é um cínico; se seu resultado for válido, eu mostro que ele é.
Meus dados são confidenciais?
Sim. Os relatórios são privados e nada é publicado. Uma fatia redigida ou anonimizada dos seus dados geralmente é suficiente para reproduzir o número, então você raramente precisa compartilhar algo sensível.
Você apenas executa uma ferramenta nele?
Não. As verificações individuais são padrão; o valor está em executar todas elas de forma adversarial e ter o julgamento para distinguir um verdadeiro confound de um artefato de como os dados foram construídos. Você recebe raciocínio, não apenas o resultado.
Qual pacote eu preciso?
Se você tem um número que vai publicar, comece com Basic ou Standard. Se estiver auditando um post de lançamento, modelo ou várias reivindicações ao mesmo tempo, escolha Premium. Não tem certeza? Me envie o número que você tem menos certeza.
Você pode integrar essas verificações ao nosso CI?
Sim — isso é uma assinatura mensal contínua, não um projeto único do catálogo. Me envie detalhes do seu stack e frequência de avaliação que eu farei o escopo separado.

