Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

DonnéesFiche benchmark · Tencent Hunyuan et université Fudan · clbench.com

CL-bench Life

Raisonner à partir de traces désordonnées de la vie courante : conversations, notes éparses, historiques d'activité.

À quoi il sert

CL-bench Life alimente le dossier Données, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général.

Comment c'est noté

Part des 405 tâches où la réponse satisfait tous les critères de la grille.

Ce qu'il ne dit pas

Notation en tout ou rien, scores très bas (22 % au mieux) et peu de modèles testés.

Qui le tient

Tencent Hunyuan et université Fudan.

clbench.com · dossier Données · 14 modèles mesurés

Comment lire le score

14 modèles mesurés · 17 mesures

En tête : GPT-5.5, 22,2 %

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 32 %. Le meilleur, GPT-5.5, atteint 22,2 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
3 %
Score IA 76niveau de Claude Sonnet 4.5
10 %
Score IA 100niveau de Claude Opus 5.5
32 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. Données est un dossier sans score : ses benchmarks sont suivis pour information.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-5.5OpenAIÉlevée22,2 %91,7
2GPT-5.4OpenAI · 3 configurationsMaximale21,7 %91,2
3GPT-5.1OpenAIÉlevée17,3 %86,4
4Claude Opus 4.6Anthropic · 2 configurationsÉlevée17 %86,1
5Gemini 3.1 ProGoogle DeepMindNon précisée16,9 %86,0
6DeepSeek-V4-ProDeepSeek · poids ouvertsÉlevée13,5 %81,5
7Kimi K2.5Moonshot · poids ouvertsNon précisée13,2 %81,1
8Qwen 3.5 Plus (hosted 397B-A17B)AlibabaNon précisée12,4 %79,8
9Grok 4.20xAINon précisée11,9 %79,1
10GLM-4.7Z.ai (Zhipu AI) · poids ouvertsNon précisée10,9 %77,4
14 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 14 →Replier le classement ↑
11DeepSeek-V3.2-ExpDeepSeekÉlevée9,5 %74,8
12DeepSeek-V3.2DeepSeek · poids ouvertsNon précisée7,4 %70,2
13MiMo-V2-ProXiaomiNon précisée6,9 %68,9
14MiniMax-M2.5MiniMax · poids ouvertsNon précisée6,3 %67,3

En bref

Que mesure CL-bench Life ?
Raisonner à partir de traces désordonnées de la vie courante : conversations, notes éparses, historiques d'activité. Sur Quelle IA, il est rangé dans le dossier Données.
Comment CL-bench Life est-il noté ?
Part des 405 tâches où la réponse satisfait tous les critères de la grille. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 32 %.
Qui est en tête sur CL-bench Life ?
GPT-5.5 (OpenAI) est en tête de CL-bench Life avec 22,2 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.4 (21,7 %) et GPT-5.1 (17,3 %). 14 modèles y sont mesurés.
Quelles sont les limites de CL-bench Life ?
Notation en tout ou rien, scores très bas (22 % au mieux) et peu de modèles testés. Au 28 septembre 2026, le benchmark est actif.
Combien pèse CL-bench Life dans le score IA ?
CL-bench Life compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Données est un dossier sans score : ses benchmarks sont suivis pour information.
Qui maintient CL-bench Life ?
Tencent Hunyuan et université Fudan. Sa page de référence : clbench.com.

Les autres benchmarks du dossier Données

Tous les benchmarks →Comment le score IA est calculé →