À quoi il sert
Sur Quelle IA, WeirdML (v2) sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 75.
CodeFiche benchmark · Håvard Tveit Ihle · htihle.github.io
Écrire du code PyTorch pour des problèmes d'apprentissage automatique inhabituels : reconnaître des formes, classer des chiffres, prédire l'issue de parties d'échecs.
Sur Quelle IA, WeirdML (v2) sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 75.
Précision moyenne obtenue par le code du modèle, exécuté dans un environnement isolé, avec cinq tentatives par tâche.
Version remplacée en septembre 2026 par un nouveau jeu de tâches. Ses scores ne se comparent pas à ceux de WeirdML v3.
Håvard Tveit Ihle.
htihle.github.io/weirdml.html · tâche Code · 129 modèles mesurés
En tête : GPT-6 Astra, 93,6 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 75. Le meilleur, GPT-6 Astra, atteint 93,6 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,15 %du score général. WeirdML (v2) porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
En couleur, la tâche Code dans le score général. En noir, la part de WeirdML (v2).