# CL-bench

> Fiche du benchmark CL-bench sur Quelle IA, édition du 28 septembre 2026. Apprendre un savoir nouveau fourni dans la consigne (un droit fictif, les règles d'un jeu inventé) et l'appliquer aussitôt. En tête au 28 septembre 2026 : GPT-5.4 (27,9 %). Notation, limites et classement des 20 modèles mesurés.

Page : https://quelleia.com/benchmarks/cl_bench/
Source du benchmark : https://www.clbench.com/
Mainteneur : Tencent Hunyuan et université Fudan
Tâche : Données
État : actif

## À quoi il sert

CL-bench alimente le dossier Données, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général.

## Comment c'est noté

Part des 1 899 tâches où la réponse satisfait tous les critères de la grille.

## Ce qu'il ne dit pas

Notation en tout ou rien : une réponse presque juste vaut zéro, d'où des scores bas, 28 % au mieux.

## Qui le tient

Tencent Hunyuan et université Fudan.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 31 %. Le meilleur, GPT-5.4, atteint 27,9 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 8 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 17 %
- Score IA 100 (niveau de Claude Opus 5.5) : 31 %

## Son poids dans le score IA

0 % du score général. Données est un dossier sans score : ses benchmarks sont suivis pour information.

## Classement (20 modèles mesurés · 23 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 27,9 % | 95,8 | https://epoch.ai/benchmarks |
| 2 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 23,7 % | 89,1 | https://epoch.ai/benchmarks |
| 3 | [Grok 4.20](https://quelleia.com/modeles/grok-4-20.md) | xAI | non précisée | 22,2 % | 86,5 | https://epoch.ai/benchmarks |
| 4 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 21,1 % | 84,6 | https://epoch.ai/benchmarks |
| 5 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 20,8 % | 84,0 | https://epoch.ai/benchmarks |
| 6 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | non précisée | 20,7 % | 83,8 | https://epoch.ai/benchmarks |
| 7 | [Qwen 3.6 Plus](https://quelleia.com/modeles/qwen-3-6-plus.md) | Alibaba | non précisée | 20,3 % | 83,1 | https://epoch.ai/benchmarks |
| 8 | [Qwen 3.5 Plus (hosted 397B-A17B)](https://quelleia.com/modeles/qwen-3-5-plus-hosted-397b-a17b.md) | Alibaba | non précisée | 19,8 % | 82,2 | https://epoch.ai/benchmarks |
| 9 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 19,3 % | 81,2 | https://epoch.ai/benchmarks |
| 10 | [GLM-5](https://quelleia.com/modeles/glm-5.md) | Z.ai (Zhipu AI) | non précisée | 18,7 % | 80,0 | https://epoch.ai/benchmarks |
| 11 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | non précisée | 18,2 % | 79,0 | https://epoch.ai/benchmarks |
| 12 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 17,8 % | 78,2 | https://epoch.ai/benchmarks |
| 13 | [Kimi K2 Thinking](https://quelleia.com/modeles/kimi-k2-thinking.md) | Moonshot | non précisée | 17,6 % | 77,8 | https://epoch.ai/benchmarks |
| 14 | [GLM-4.7](https://quelleia.com/modeles/glm-4-7.md) | Z.ai (Zhipu AI) | non précisée | 15,9 % | 74,1 | https://epoch.ai/benchmarks |
| 15 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 15,8 % | 73,8 | https://epoch.ai/benchmarks |
| 16 | [MiMo-V2-Pro](https://quelleia.com/modeles/mimo-v2-pro.md) | Xiaomi | non précisée | 15,7 % | 73,6 | https://epoch.ai/benchmarks |
| 17 | [Qwen3-Max](https://quelleia.com/modeles/qwen3-max.md) | Alibaba | non précisée | 14,5 % | 70,8 | https://epoch.ai/benchmarks |
| 18 | [DeepSeek-V3.2-Exp](https://quelleia.com/modeles/deepseek-v3-2-exp.md) | DeepSeek | Élevée | 13,2 % | 67,5 | https://epoch.ai/benchmarks |
| 19 | [DeepSeek-V3.2](https://quelleia.com/modeles/deepseek-v3-2.md) | DeepSeek | non précisée | 12,4 % | 65,3 | https://epoch.ai/benchmarks |
| 20 | [MiniMax-M2.5](https://quelleia.com/modeles/minimax-m2-5.md) | MiniMax | non précisée | 11,4 % | 62,4 | https://epoch.ai/benchmarks |

## En bref

**Que mesure CL-bench ?** Apprendre un savoir nouveau fourni dans la consigne (un droit fictif, les règles d'un jeu inventé) et l'appliquer aussitôt. Sur Quelle IA, il est rangé dans le dossier Données.

**Comment CL-bench est-il noté ?** Part des 1 899 tâches où la réponse satisfait tous les critères de la grille. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 31 %.

**Qui est en tête sur CL-bench ?** GPT-5.4 (OpenAI) est en tête de CL-bench avec 27,9 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.1 (23,7 %) et Grok 4.20 (22,2 %). 20 modèles y sont mesurés.

**Quelles sont les limites de CL-bench ?** Notation en tout ou rien : une réponse presque juste vaut zéro, d'où des scores bas, 28 % au mieux. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse CL-bench dans le score IA ?** CL-bench compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Données est un dossier sans score : ses benchmarks sont suivis pour information.

**Qui maintient CL-bench ?** Tencent Hunyuan et université Fudan. Sa page de référence : clbench.com.

## Les autres benchmarks du dossier Données

- [SimpleQA Verified](https://quelleia.com/benchmarks/simpleqa_verified.md) : 73 modèles · hors score
- [GDP.pdf](https://quelleia.com/benchmarks/gdp_pdf.md) : 30 modèles · hors score
- [CL-bench Life](https://quelleia.com/benchmarks/cl_bench_life.md) : 14 modèles · hors score
- [Fiction.LiveBench](https://quelleia.com/benchmarks/fiction_livebench.md) : 57 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
