Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

DonnéesFiche benchmark · Tencent Hunyuan et université Fudan · clbench.com

CL-bench

Apprendre un savoir nouveau fourni dans la consigne (un droit fictif, les règles d'un jeu inventé) et l'appliquer aussitôt.

À quoi il sert

CL-bench alimente le dossier Données, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général.

Comment c'est noté

Part des 1 899 tâches où la réponse satisfait tous les critères de la grille.

Ce qu'il ne dit pas

Notation en tout ou rien : une réponse presque juste vaut zéro, d'où des scores bas, 28 % au mieux.

Qui le tient

Tencent Hunyuan et université Fudan.

clbench.com · dossier Données · 20 modèles mesurés

Comment lire le score

20 modèles mesurés · 23 mesures

En tête : GPT-5.4, 27,9 %

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 31 %. Le meilleur, GPT-5.4, atteint 27,9 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
8 %
Score IA 76niveau de Claude Sonnet 4.5
17 %
Score IA 100niveau de Claude Opus 5.5
31 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. Données est un dossier sans score : ses benchmarks sont suivis pour information.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-5.4OpenAIMaximale27,9 %95,8
2GPT-5.1OpenAI · 2 configurationsÉlevée23,7 %89,1
3Grok 4.20xAINon précisée22,2 %86,5
4Claude Opus 4.5AnthropicNon précisée21,1 %84,6
5Gemini 3.1 ProGoogle DeepMindNon précisée20,8 %84,0
6Claude Opus 4.6AnthropicNon précisée20,7 %83,8
7Qwen 3.6 PlusAlibabaNon précisée20,3 %83,1
8Qwen 3.5 Plus (hosted 397B-A17B)AlibabaNon précisée19,8 %82,2
9Kimi K2.5Moonshot · poids ouvertsNon précisée19,3 %81,2
10GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée18,7 %80,0
20 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 20 →Replier le classement ↑
11GPT-5.2OpenAI · 2 configurationsNon précisée18,2 %79,0
12o3OpenAIÉlevée17,8 %78,2
13Kimi K2 ThinkingMoonshot · poids ouverts · 2 configurationsNon précisée17,6 %77,8
14GLM-4.7Z.ai (Zhipu AI) · poids ouvertsNon précisée15,9 %74,1
15Gemini 3 ProGoogle DeepMindNon précisée15,8 %73,8
16MiMo-V2-ProXiaomiNon précisée15,7 %73,6
17Qwen3-MaxAlibabaNon précisée14,5 %70,8
18DeepSeek-V3.2-ExpDeepSeekÉlevée13,2 %67,5
19DeepSeek-V3.2DeepSeek · poids ouvertsNon précisée12,4 %65,3
20MiniMax-M2.5MiniMax · poids ouvertsNon précisée11,4 %62,4

En bref

Que mesure CL-bench ?
Apprendre un savoir nouveau fourni dans la consigne (un droit fictif, les règles d'un jeu inventé) et l'appliquer aussitôt. Sur Quelle IA, il est rangé dans le dossier Données.
Comment CL-bench est-il noté ?
Part des 1 899 tâches où la réponse satisfait tous les critères de la grille. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 31 %.
Qui est en tête sur CL-bench ?
GPT-5.4 (OpenAI) est en tête de CL-bench avec 27,9 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.1 (23,7 %) et Grok 4.20 (22,2 %). 20 modèles y sont mesurés.
Quelles sont les limites de CL-bench ?
Notation en tout ou rien : une réponse presque juste vaut zéro, d'où des scores bas, 28 % au mieux. Au 28 septembre 2026, le benchmark est actif.
Combien pèse CL-bench dans le score IA ?
CL-bench compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Données est un dossier sans score : ses benchmarks sont suivis pour information.
Qui maintient CL-bench ?
Tencent Hunyuan et université Fudan. Sa page de référence : clbench.com.

Les autres benchmarks du dossier Données

Tous les benchmarks →Comment le score IA est calculé →