Algumas informações são exibidas no idioma inglês.
Sobre mim
I audit LLM evaluations, AI-agent benchmarks, and coding tasks for verifier loopholes, unreliable scoring, false positives, weak adversarial coverage, reproducibility issues, and packaging defects. Clients receive a prioritized findings report, concrete exploit cases, and practical repair recommendations. When requested, I also deliver tested fixes and a clean package. My technical background includes cybersecurity, digital forensics, Python, networking, and software testing.... Saiba mais