# WeirdML v3

> Fiche du benchmark WeirdML v3 sur Quelle IA, édition du 28 septembre 2026. 11 problèmes d'apprentissage automatique et d'analyse de données inhabituels : l'agent explore des données inconnues et construit un programme qui les traite. En tête au 28 septembre 2026 : GPT-6 Astra (42,2 %). Notation, limites et classement des 11 modèles mesurés.

Page : https://quelleia.com/benchmarks/weirdml_v3/
Source du benchmark : https://htihle.github.io/weirdml.html
Mainteneur : Håvard Tveit Ihle
Tâche : Code
État : actif

## À quoi il sert

Sur Quelle IA, WeirdML v3 sert à noter la tâche Code : c'est l'un de ses 13 benchmarks.

## Comment c'est noté

Score de 0 à 1 qui récompense à la fois le résultat final et la rapidité à l'atteindre, mesurée en jetons consommés.

## Ce qu'il ne dit pas

Onze modèles seulement à ce stade. Les scores ne se comparent pas à ceux de WeirdML v2, et le harnais (Claude Code, Codex CLI) varie selon le modèle.

## Qui le tient

Håvard Tveit Ihle.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 37 %. Le meilleur, GPT-6 Astra, atteint 42,2 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : moins de 1 %
- Score IA 100 (niveau de Claude Opus 5.5) : 37 %

## Son poids dans le score IA

1,15 % du score général. WeirdML v3 porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

## Classement (11 modèles mesurés, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 42,2 % | 101,0 | https://htihle.github.io/weirdml.html |
| 2 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 31,2 % | 98,6 | https://htihle.github.io/weirdml.html |
| 3 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 26 % | 97,3 | https://htihle.github.io/weirdml.html |
| 4 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 19 % | 95,2 | https://htihle.github.io/weirdml.html |
| 5 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 15,5 % | 94,0 | https://htihle.github.io/weirdml.html |
| 6 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 15 % | 93,7 | https://htihle.github.io/weirdml.html |
| 7 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | Élevée | 7,4 % | 89,7 | https://htihle.github.io/weirdml.html |
| 8 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Élevée | 7,3 % | 89,6 | https://htihle.github.io/weirdml.html |
| 9 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | Élevée | 6,5 % | 89,0 | https://htihle.github.io/weirdml.html |
| 10 | [DeepSeek V4.1 Flash](https://quelleia.com/modeles/deepseek-v4-1-flash.md) | DeepSeek | Élevée | 5,9 % | 88,5 | https://htihle.github.io/weirdml.html |
| 11 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 5,2 % | 87,7 | https://htihle.github.io/weirdml.html |

## En bref

**Que mesure WeirdML v3 ?** 11 problèmes d'apprentissage automatique et d'analyse de données inhabituels : l'agent explore des données inconnues et construit un programme qui les traite. Sur Quelle IA, il est rangé dans la tâche Code.

**Comment WeirdML v3 est-il noté ?** Score de 0 à 1 qui récompense à la fois le résultat final et la rapidité à l'atteindre, mesurée en jetons consommés. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 37 %.

**Qui est en tête sur WeirdML v3 ?** GPT-6 Astra (OpenAI) est en tête de WeirdML v3 avec 42,2 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (31,2 %) et Claude Fable 5.1 (26 %). 11 modèles y sont mesurés.

**Quelles sont les limites de WeirdML v3 ?** Onze modèles seulement à ce stade. Les scores ne se comparent pas à ceux de WeirdML v2, et le harnais (Claude Code, Codex CLI) varie selon le modèle. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse WeirdML v3 dans le score IA ?** WeirdML v3 compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

**Qui maintient WeirdML v3 ?** Håvard Tveit Ihle. Sa page de référence : htihle.github.io/weirdml.html.

## Les autres benchmarks de la tâche Code

- [Arena, questions de code](https://quelleia.com/benchmarks/arena_code.md) : 275 modèles · 1,15 % du score
- [WeirdML (v2)](https://quelleia.com/benchmarks/weirdml.md) : 129 modèles · 1,15 % du score
- [SciCode](https://quelleia.com/benchmarks/scicode.md) : 120 modèles · 1,15 % du score
- [Terminal-Bench 2.0](https://quelleia.com/benchmarks/terminal_bench.md) : 45 modèles · 1,15 % du score
- [FrontierCode](https://quelleia.com/benchmarks/frontiercode.md) : 37 modèles · 1,15 % du score
- [SWE-bench Verified](https://quelleia.com/benchmarks/swe_bench_verified.md) : 32 modèles · 1,15 % du score
- [DeepSWE](https://quelleia.com/benchmarks/deepswe.md) : 26 modèles · 1,15 % du score
- [GSO](https://quelleia.com/benchmarks/gso_bench.md) : 26 modèles · 1,15 % du score
- [GBAEval](https://quelleia.com/benchmarks/gbaeval.md) : 23 modèles · 1,15 % du score
- [FrontierSWE](https://quelleia.com/benchmarks/frontierswe.md) : 16 modèles · 1,15 % du score
- [CursorBench](https://quelleia.com/benchmarks/cursorbench.md) : 13 modèles · 1,15 % du score
- [MirrorCode](https://quelleia.com/benchmarks/mirrorcode.md) : 9 modèles · 1,15 % du score
- [Aider Polyglot](https://quelleia.com/benchmarks/aider_polyglot.md) : 54 modèles · hors score, archivé
- [LiveBench, code](https://quelleia.com/benchmarks/livebench_code.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
