À quoi il sert
Sur Quelle IA, WeirdML v3 sert à noter la tâche Code : c'est l'un de ses 13 benchmarks.
CodeFiche benchmark · Håvard Tveit Ihle · htihle.github.io
11 problèmes d'apprentissage automatique et d'analyse de données inhabituels : l'agent explore des données inconnues et construit un programme qui les traite.
Sur Quelle IA, WeirdML v3 sert à noter la tâche Code : c'est l'un de ses 13 benchmarks.
Score de 0 à 1 qui récompense à la fois le résultat final et la rapidité à l'atteindre, mesurée en jetons consommés.
Onze modèles seulement à ce stade. Les scores ne se comparent pas à ceux de WeirdML v2, et le harnais (Claude Code, Codex CLI) varie selon le modèle.
Håvard Tveit Ihle.
htihle.github.io/weirdml.html · tâche Code · 11 modèles mesurés
En tête : GPT-6 Astra, 42,2 %
Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 37 %. Le meilleur, GPT-6 Astra, atteint 42,2 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,15 %du score général. WeirdML v3 porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
En couleur, la tâche Code dans le score général. En noir, la part de WeirdML v3.