# CL-bench Life

> Fiche du benchmark CL-bench Life sur Quelle IA, édition du 28 septembre 2026. Raisonner à partir de traces désordonnées de la vie courante : conversations, notes éparses, historiques d'activité. En tête au 28 septembre 2026 : GPT-5.5 (22,2 %). Notation, limites et classement des 14 modèles mesurés.

Page : https://quelleia.com/benchmarks/cl_bench_life/
Source du benchmark : https://www.clbench.com/
Mainteneur : Tencent Hunyuan et université Fudan
Tâche : Données
État : actif

## À quoi il sert

CL-bench Life alimente le dossier Données, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général.

## Comment c'est noté

Part des 405 tâches où la réponse satisfait tous les critères de la grille.

## Ce qu'il ne dit pas

Notation en tout ou rien, scores très bas (22 % au mieux) et peu de modèles testés.

## Qui le tient

Tencent Hunyuan et université Fudan.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 32 %. Le meilleur, GPT-5.5, atteint 22,2 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 3 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 10 %
- Score IA 100 (niveau de Claude Opus 5.5) : 32 %

## Son poids dans le score IA

0 % du score général. Données est un dossier sans score : ses benchmarks sont suivis pour information.

## Classement (14 modèles mesurés · 17 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Élevée | 22,2 % | 91,7 | https://epoch.ai/benchmarks |
| 2 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 21,7 % | 91,2 | https://epoch.ai/benchmarks |
| 3 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 17,3 % | 86,4 | https://epoch.ai/benchmarks |
| 4 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Élevée | 17 % | 86,1 | https://epoch.ai/benchmarks |
| 5 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 16,9 % | 86,0 | https://epoch.ai/benchmarks |
| 6 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | Élevée | 13,5 % | 81,5 | https://epoch.ai/benchmarks |
| 7 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 13,2 % | 81,1 | https://epoch.ai/benchmarks |
| 8 | [Qwen 3.5 Plus (hosted 397B-A17B)](https://quelleia.com/modeles/qwen-3-5-plus-hosted-397b-a17b.md) | Alibaba | non précisée | 12,4 % | 79,8 | https://epoch.ai/benchmarks |
| 9 | [Grok 4.20](https://quelleia.com/modeles/grok-4-20.md) | xAI | non précisée | 11,9 % | 79,1 | https://epoch.ai/benchmarks |
| 10 | [GLM-4.7](https://quelleia.com/modeles/glm-4-7.md) | Z.ai (Zhipu AI) | non précisée | 10,9 % | 77,4 | https://epoch.ai/benchmarks |
| 11 | [DeepSeek-V3.2-Exp](https://quelleia.com/modeles/deepseek-v3-2-exp.md) | DeepSeek | Élevée | 9,5 % | 74,8 | https://epoch.ai/benchmarks |
| 12 | [DeepSeek-V3.2](https://quelleia.com/modeles/deepseek-v3-2.md) | DeepSeek | non précisée | 7,4 % | 70,2 | https://epoch.ai/benchmarks |
| 13 | [MiMo-V2-Pro](https://quelleia.com/modeles/mimo-v2-pro.md) | Xiaomi | non précisée | 6,9 % | 68,9 | https://epoch.ai/benchmarks |
| 14 | [MiniMax-M2.5](https://quelleia.com/modeles/minimax-m2-5.md) | MiniMax | non précisée | 6,3 % | 67,3 | https://epoch.ai/benchmarks |

## En bref

**Que mesure CL-bench Life ?** Raisonner à partir de traces désordonnées de la vie courante : conversations, notes éparses, historiques d'activité. Sur Quelle IA, il est rangé dans le dossier Données.

**Comment CL-bench Life est-il noté ?** Part des 405 tâches où la réponse satisfait tous les critères de la grille. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 32 %.

**Qui est en tête sur CL-bench Life ?** GPT-5.5 (OpenAI) est en tête de CL-bench Life avec 22,2 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.4 (21,7 %) et GPT-5.1 (17,3 %). 14 modèles y sont mesurés.

**Quelles sont les limites de CL-bench Life ?** Notation en tout ou rien, scores très bas (22 % au mieux) et peu de modèles testés. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse CL-bench Life dans le score IA ?** CL-bench Life compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Données est un dossier sans score : ses benchmarks sont suivis pour information.

**Qui maintient CL-bench Life ?** Tencent Hunyuan et université Fudan. Sa page de référence : clbench.com.

## Les autres benchmarks du dossier Données

- [SimpleQA Verified](https://quelleia.com/benchmarks/simpleqa_verified.md) : 73 modèles · hors score
- [GDP.pdf](https://quelleia.com/benchmarks/gdp_pdf.md) : 30 modèles · hors score
- [CL-bench](https://quelleia.com/benchmarks/cl_bench.md) : 20 modèles · hors score
- [Fiction.LiveBench](https://quelleia.com/benchmarks/fiction_livebench.md) : 57 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
