J’aimerai auditer vos chiffres de benchmark AI ou d’évaluation LLM pour leur validité statistique

Certaines informations ont été traduites automatiquement.

Finlande

Je parle Finnois, Anglais

Expert en robots de trading

Je suis un ingénieur quantitatif spécialisé dans la création de bots de trading sur mesure et de pipelines API. Je ne vends pas de scripts « pour devenir riche rapidement ». Je conçois une architectur...
À propos de ce service

 Vous obtiendrez un verdict clair sur la validité de votre chiffre de benchmark ou d’évaluation, s’il passe les vérifications qu’il a ignorées avant de

 le publier. Je prends un résultat principal (un rang dans un classement, un taux de victoire d’un LLM en tant que juge, un "bat un baseline de X %", un

 exposant de loi d’échelle) et le teste de manière adversarielle : correction pour comparaisons multiples, puissance statistique, biais du juge, et

 reproduction à partir de vos données brutes.


 Vous recevez une de deux réponses honnêtes : il passe, voici la statistique corrigée que vous pouvez citer ou il est dans le bruit,

 voici pourquoi et la correction en une ligne.


 Ce qui distingue cela, c’est la preuve, pas la promesse. J’ai écrit le livre sur ce mode de défaillance (Measured, Not Believed), créé l’outil open-source qui effectue les vérifications (evalgate), et reproduit publiquement trois surclaims réels MT-Bench,

 RewardBench, et une loi d’échelle publiée. Chaque verdict que je donne est reproductible à partir de vos données ; je montre le travail. Et si

 votre chiffre est réel, je le certifie, un auditeur qui ne trouve jamais de défaut n’est qu’un cynique, pas un auditeur.