Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

CodeFiche benchmark · Håvard Tveit Ihle · htihle.github.io

WeirdML (v2)

Écrire du code PyTorch pour des problèmes d'apprentissage automatique inhabituels : reconnaître des formes, classer des chiffres, prédire l'issue de parties d'échecs.

À quoi il sert

Sur Quelle IA, WeirdML (v2) sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 75.

Comment c'est noté

Précision moyenne obtenue par le code du modèle, exécuté dans un environnement isolé, avec cinq tentatives par tâche.

Ce qu'il ne dit pas

Version remplacée en septembre 2026 par un nouveau jeu de tâches. Ses scores ne se comparent pas à ceux de WeirdML v3.

Comment lire le score

129 modèles mesurés · 172 mesures

En tête : GPT-6 Astra, 93,6 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 75. Le meilleur, GPT-6 Astra, atteint 93,6 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
20 %
Score IA 76niveau de Claude Sonnet 4.5
53 %
Score IA 100niveau de Claude Opus 5.5
82 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,15 %du score général. WeirdML (v2) porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

En couleur, la tâche Code dans le score général. En noir, la part de WeirdML (v2).

Le classement du benchmark

Scores relevés auprès de 2 sources · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAI · 3 configurationsMaximale93,6 %119,9
2Claude Fable 5.1Anthropic · 2 configurationsMaximale92,9 %118,1
3Claude Fable 5Anthropic · 2 configurationsMaximale91,9 %115,8
4Claude Opus 5Anthropic · 3 configurationsMaximale91,8 %115,4
5GPT-5.6 SolOpenAI · 3 configurationsMaximale89,4 %110,7
6GPT-5.5OpenAI · 3 configurationsMaximale84,9 %103,8
7Claude Opus 4.8Anthropic · 3 configurationsMaximale82,9 %101,3
8Kimi K3Moonshot · poids ouvertsMaximale82,6 %100,9
9GPT-5.3 CodexOpenAI · 2 configurationsNon précisée79,3 %97,3
10GPT-5.6 TerraOpenAIÉlevée78,3 %96,3
129 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 129 →Replier le classement ↑
11Claude Opus 4.6Anthropic · 3 configurationsÉlevée78 %95,9
12GPT-5.4OpenAI · 2 configurationsMaximale77,7 %95,7
13Claude Opus 4.7Anthropic · 4 configurationsÉlevée76,4 %94,5
14GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale75,4 %93,5
15GPT-5.2OpenAI · 4 configurationsMaximale72,2 %90,7
16Gemini 3.1 ProGoogle DeepMindNon précisée72,1 %90,6
17GLM-5.2Z.ai (Zhipu AI) · poids ouverts · 2 configurationsMaximale70,1 %89,0
18Gemini 3 ProGoogle DeepMindNon précisée69,9 %88,9
19Claude Sonnet 5AnthropicÉlevée68,8 %87,9
20Grok 4.6xAIÉlevée67,3 %86,8
21DeepSeek V4 Pro 0813DeepSeek · poids ouvertsMaximale66,2 %86,0
22Claude Sonnet 4.6AnthropicMoyenne66,1 %85,8
23Claude Opus 4.5AnthropicBudget63,7 %84,1
24DeepSeek V4 Flash 0731DeepSeek · poids ouverts · 2 configurationsMaximale63 %83,6
25Gemini 3.5 FlashGoogle DeepMindÉlevée62,6 %83,3
26Gemini 3 FlashGoogle DeepMindNon précisée61,6 %82,6
27GPT-5.6 LunaOpenAIÉlevée60,9 %82,0
28GPT-5.1OpenAIÉlevée60,8 %82,0
29GPT-5OpenAI · 2 configurationsÉlevée60,7 %81,9
30GPT-5 ProOpenAIÉlevée60,4 %81,7
31Muse Spark 1.2Meta AIMaximale60,3 %81,6
31GPT-5.4 MiniOpenAI · 2 configurationsÉlevée60,3 %81,6
33o3-proOpenAIÉlevée58,2 %80,2
34GPT-5.4 ProOpenAISans57,4 %79,6
35GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée57,1 %79,4
36Gemini 3.6 FlashGoogle DeepMindÉlevée56,1 %78,7
37Kimi K2.6Moonshot · poids ouvertsNon précisée55,9 %78,6
38GPT-5-CodexOpenAI · 2 configurationsNon précisée54,5 %77,7
39Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée54,1 %77,4
40Gemini 2.5 Pro (Jun 2025)Google DeepMindBudget54 %77,3
41GPT-5 miniOpenAIÉlevée52,7 %76,4
42o4-miniOpenAIÉlevée52,6 %76,3
43o3OpenAIÉlevée52,4 %76,2
44Grok 4.20xAINon précisée52,3 %76,1
44Gemma 4 31B ITGoogle DeepMind · poids ouvertsNon précisée52,3 %76,1
46Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée52,2 %76,1
47Grok 4.3 BetaxAINon précisée49,9 %74,5
48GPT-5.4 NanoOpenAI · 2 configurationsÉlevée49,2 %74,1
49DeepSeek-V4-ProDeepSeek · poids ouverts · 2 configurationsMaximale48,9 %73,8
50GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée48,2 %73,3
50gpt-oss-120bOpenAI · poids ouverts · 3 configurationsÉlevée48,2 %73,3
52Claude Sonnet 4.5Anthropic · 2 configurationsBudget47,7 %73,0
53o1-previewOpenAINon précisée47,6 %72,9
54DeepSeek-V3.2-SpecialeDeepSeek · poids ouvertsNon précisée46,7 %72,4
55Grok 4.5xAINon précisée46,4 %72,2
56Claude Sonnet 4Anthropic · 2 configurationsBudget46,1 %71,9
57o1OpenAIÉlevée46,1 %71,9
58Claude Opus 4.1AnthropicBudget45,9 %71,8
59Grok 4xAINon précisée45,7 %71,7
60DeepSeek-V4-FlashDeepSeek · poids ouverts · 2 configurationsMaximale45,6 %71,6
61Kimi K2.5Moonshot · poids ouvertsNon précisée45,6 %71,6
62Claude Haiku 4.5Anthropic · 2 configurationsNon précisée45,4 %71,5
63Claude Opus 4AnthropicBudget43,7 %70,3
64Mistral Medium 3.5Mistral AI · poids ouvertsNon précisée43,7 %70,3
65o3-miniOpenAIÉlevée43,7 %70,3
66Nemotron 3 UltraNVIDIA · poids ouvertsNon précisée43,5 %70,1
67Mercury 2Inception LabsNon précisée43,2 %69,9
68Grok 4 FastxAINon précisée42,9 %69,7
69Kimi K2 ThinkingMoonshot · poids ouvertsNon précisée42,8 %69,7
70Grok-3 minixAI · 2 configurationsÉlevée42,6 %69,5
71Gemini 2.5 Flash (Sep 2025)Google DeepMindBudget41,9 %69,1
72DeepSeek-R1 (May 2025)DeepSeek · poids ouvertsNon précisée41,6 %68,9
73Qwen3-Coder-480B-A35BAlibaba · poids ouvertsNon précisée41,2 %68,5
74Qwen3-235B-A22B-Thinking (Jul 2025)Alibaba · 3 configurationsNon précisée41 %68,4
75Gemini 2.5 Flash (Apr 2025)Google DeepMindNon précisée40,9 %68,4
75Gemini 2.5 Flash (May 2025)Google DeepMindBudget40,9 %68,4
77gpt-oss-20bOpenAI · poids ouverts · 2 configurationsÉlevée40,9 %68,4
78GLM-4.5Z.ai (Zhipu AI) · poids ouvertsÉlevée40,6 %68,1
79Claude 3.5 Sonnet (October 2024)AnthropicNon précisée40 %67,7
80Qwen3.5-27BAlibaba · poids ouvertsNon précisée39,5 %67,4
81DeepSeek-V3.2-ExpDeepSeekÉlevée39,5 %67,4
82GPT-4.5OpenAINon précisée39,4 %67,3
83Kimi K2 (Jul 2025)Moonshot · 2 configurationsNon précisée39,4 %67,3
84GPT-4.1OpenAINon précisée39 %67,0
85Gemini 3.5 Flash-LiteGoogle DeepMindÉlevée39 %67,0
86Qwen3-235B-A22B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée38,7 %66,8
87DeepSeek-V3.1DeepSeek · poids ouverts · 2 configurationsÉlevée38,4 %66,6
88GPT-5 nanoOpenAI · 2 configurationsÉlevée38,1 %66,3
89Nemotron 3 SuperNVIDIA · poids ouvertsNon précisée38 %66,3
90GPT-4.1 miniOpenAINon précisée37,6 %66,0
91Qwen3-235B-A22BAlibaba · poids ouvertsNon précisée37,3 %65,8
92Grok 3xAINon précisée37,2 %65,7
93MiniMax-M2.7MiniMax · poids ouvertsNon précisée37 %65,5
94Kimi K2 (Sep 2025)MoonshotNon précisée36,7 %65,3
95DeepSeek-R1DeepSeek · poids ouvertsNon précisée36,5 %65,2
96o1-miniOpenAIMoyenne36,3 %65,1
97DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée36,1 %64,9
98Gemini 2.5 Flash-Lite (Jun 2025)Google DeepMind · 2 configurationsBudget35,2 %64,3
99Gemma 4 26B A4BGoogle DeepMind · poids ouvertsNon précisée35,2 %64,2
100grok-code-fast-1xAINon précisée35,1 %64,2
101Qwen 3.6 35B-A3BAlibaba · poids ouvertsNon précisée34,5 %63,7
102qwen3-coder-nextAlibaba · poids ouvertsNon précisée34,4 %63,7
103Mistral Medium 3.1Mistral AINon précisée33,1 %62,7
104InklingThinking Machines · poids ouvertsÉlevée32,3 %62,1
105Claude 3.5 SonnetAnthropicNon précisée31 %61,0
106Claude 3.5 HaikuAnthropicNon précisée30,7 %60,8
107Qwen3-30B-A3BAlibaba · poids ouvertsNon précisée29,8 %60,0
108Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée25,8 %56,7
109GPT-4o (Nov 2024)OpenAINon précisée25,1 %56,1
110Gemini 1.5 Flash (Sep 2024)Google DeepMindNon précisée24,9 %55,9
111Llama 4 MaverickMeta AI · poids ouvertsNon précisée24,5 %55,5
112Grok-2 (Dec 2024)xAINon précisée22,2 %53,4
113Gemini 1.5 Pro (Sept 2024)Google DeepMindNon précisée22,2 %53,4
114Llama 3.1-405BMeta AI · poids ouvertsNon précisée21,4 %52,6
115Claude 3 OpusAnthropicNon précisée19,2 %50,3
116GPT-4.1 nanoOpenAINon précisée19 %50,0
117GPT-4 Turbo (Apr 2024)OpenAINon précisée18 %48,9
118Qwen2.5-72BAlibaba · poids ouvertsNon précisée16 %46,5
119Llama 3.3 70BMeta AI · poids ouvertsNon précisée14,4 %44,5
120GPT-4 (Jun 2023)OpenAINon précisée12,4 %41,4
121GPT-4o miniOpenAINon précisée11,8 %40,5
122Qwen2-72BAlibaba · poids ouvertsNon précisée11,3 %39,7
123Claude 3 SonnetAnthropicNon précisée10,2 %37,7
124Claude 3 HaikuAnthropicNon précisée9,8 %37,1
125Llama 3.1-70BMeta AI · poids ouvertsNon précisée9 %35,4
126Claude 2.1AnthropicNon précisée7,1 %31,0
127GPT-3.5 Turbo (Jan 2024)OpenAINon précisée3,5 %18,4
128Mixtral 8x22BMistral AI · poids ouvertsNon précisée3,2 %16,7
129Llama 3.1-8BMeta AI · poids ouvertsNon précisée1,7 %6,2

En bref

Que mesure WeirdML (v2) ?
Écrire du code PyTorch pour des problèmes d'apprentissage automatique inhabituels : reconnaître des formes, classer des chiffres, prédire l'issue de parties d'échecs. Sur Quelle IA, il est rangé dans la tâche Code.
Comment WeirdML (v2) est-il noté ?
Précision moyenne obtenue par le code du modèle, exécuté dans un environnement isolé, avec cinq tentatives par tâche. Un modèle qui obtient 50 % a un score IA d'environ 75.
Qui est en tête sur WeirdML (v2) ?
GPT-6 Astra (OpenAI) est en tête de WeirdML (v2) avec 93,6 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5.1 (92,9 %) et Claude Fable 5 (91,9 %). 129 modèles y sont mesurés.
Quelles sont les limites de WeirdML (v2) ?
Version remplacée en septembre 2026 par un nouveau jeu de tâches. Ses scores ne se comparent pas à ceux de WeirdML v3. Au 28 septembre 2026, le benchmark est actif.
Combien pèse WeirdML (v2) dans le score IA ?
WeirdML (v2) compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
Qui maintient WeirdML (v2) ?
Håvard Tveit Ihle. Sa page de référence : htihle.github.io/weirdml.html.

Les autres benchmarks de la tâche Code

Tous les benchmarks →Comment le score IA est calculé →