Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

CodeFiche benchmark · Håvard Tveit Ihle · htihle.github.io

WeirdML v3

11 problèmes d'apprentissage automatique et d'analyse de données inhabituels : l'agent explore des données inconnues et construit un programme qui les traite.

À quoi il sert

Sur Quelle IA, WeirdML v3 sert à noter la tâche Code : c'est l'un de ses 13 benchmarks.

Comment c'est noté

Score de 0 à 1 qui récompense à la fois le résultat final et la rapidité à l'atteindre, mesurée en jetons consommés.

Ce qu'il ne dit pas

Onze modèles seulement à ce stade. Les scores ne se comparent pas à ceux de WeirdML v2, et le harnais (Claude Code, Codex CLI) varie selon le modèle.

Comment lire le score

11 modèles mesurés

En tête : GPT-6 Astra, 42,2 %

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 37 %. Le meilleur, GPT-6 Astra, atteint 42,2 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
moins de 1 %
Score IA 100niveau de Claude Opus 5.5
37 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,15 %du score général. WeirdML v3 porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

En couleur, la tâche Code dans le score général. En noir, la part de WeirdML v3.

Le classement du benchmark

Scores relevés sur htihle.github.io · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAIMaximale · Codex CLI42,2 %101,0
2Claude Opus 5.5AnthropicMaximale · Claude Code31,2 %98,6
3Claude Fable 5.1AnthropicMaximale · Claude Code26 %97,3
4Claude Opus 5AnthropicMaximale · Claude Code19 %95,2
5Claude Fable 5AnthropicMaximale · Claude Code15,5 %94,0
6GPT-5.6 SolOpenAIMaximale · Codex CLI15 %93,7
7Gemini 3.8 FlashGoogle DeepMindÉlevée · Gemini CLI7,4 %89,7
8Kimi K3Moonshot · poids ouvertsÉlevée · kimi_code7,3 %89,6
9Claude Opus 4.5AnthropicÉlevée · Claude Code6,5 %89,0
10DeepSeek V4.1 FlashDeepSeek · poids ouvertsÉlevée · opencode5,9 %88,5
11 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 11 →Replier le classement ↑
11GPT-5.6 LunaOpenAIMaximale · Codex CLI5,2 %87,7

En bref

Que mesure WeirdML v3 ?
11 problèmes d'apprentissage automatique et d'analyse de données inhabituels : l'agent explore des données inconnues et construit un programme qui les traite. Sur Quelle IA, il est rangé dans la tâche Code.
Comment WeirdML v3 est-il noté ?
Score de 0 à 1 qui récompense à la fois le résultat final et la rapidité à l'atteindre, mesurée en jetons consommés. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 37 %.
Qui est en tête sur WeirdML v3 ?
GPT-6 Astra (OpenAI) est en tête de WeirdML v3 avec 42,2 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (31,2 %) et Claude Fable 5.1 (26 %). 11 modèles y sont mesurés.
Quelles sont les limites de WeirdML v3 ?
Onze modèles seulement à ce stade. Les scores ne se comparent pas à ceux de WeirdML v2, et le harnais (Claude Code, Codex CLI) varie selon le modèle. Au 28 septembre 2026, le benchmark est actif.
Combien pèse WeirdML v3 dans le score IA ?
WeirdML v3 compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
Qui maintient WeirdML v3 ?
Håvard Tveit Ihle. Sa page de référence : htihle.github.io/weirdml.html.

Les autres benchmarks de la tâche Code

Tous les benchmarks →Comment le score IA est calculé →