# Fiction.LiveBench

> Fiche du benchmark Fiction.LiveBench sur Quelle IA, édition du 28 septembre 2026. Répondre à des questions sur de longues histoires : qui sait quoi, dans quel ordre, ce qui est sous-entendu. En tête au 28 septembre 2026 : 2 modèles ex æquo (97,2 %). Notation, limites et classement des 57 modèles mesurés.

Page : https://quelleia.com/benchmarks/fiction_livebench/
Source du benchmark : https://fiction.live/stories/Fiction-liveBench-Mar-14-2025/oQdzQvKHw8JyXbN87/home
Mainteneur : Fiction.live
Tâche : Données
État : archivé

## À quoi il sert

Fiction.LiveBench alimente le dossier Données, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général. Il est archivé, faute de modèle récent mesuré.

## Comment c'est noté

Part de bonnes réponses quand l'histoire fait environ 16 000 jetons ; le classement d'origine teste aussi des longueurs jusqu'à 192 000 jetons.

## Ce qu'il ne dit pas

Seulement 36 questions sur 30 histoires. La longueur retenue ici, 16 000 jetons, est courte face aux contextes des modèles actuels.

## Qui le tient

Fiction.live.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 59. 2 modèles partagent la première place avec 97,2 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 34 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 81 %
- Score IA 100 (niveau de Claude Opus 5.5) : 97 %

## Son poids dans le score IA

0 % du score général. Données est un dossier sans score : ses benchmarks sont suivis pour information.

## Classement (57 modèles mesurés · 61 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Moyenne | 97,2 % | 100,9 | https://epoch.ai/benchmarks |
| 1 | [o3-pro](https://quelleia.com/modeles/o3-pro.md) | OpenAI | Moyenne | 97,2 % | 100,9 | https://epoch.ai/benchmarks |
| 3 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | non précisée | 94,4 % | 92,4 | https://epoch.ai/benchmarks |
| 3 | [Grok 4 Fast](https://quelleia.com/modeles/grok-4-fast.md) | xAI | non précisée | 94,4 % | 92,4 | https://epoch.ai/benchmarks |
| 5 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 91,7 % | 87,4 | https://epoch.ai/benchmarks |
| 6 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Moyenne | 88,9 % | 83,6 | https://epoch.ai/benchmarks |
| 7 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 86,1 % | 80,5 | https://epoch.ai/benchmarks |
| 8 | [DeepSeek-V3.2-Exp](https://quelleia.com/modeles/deepseek-v3-2-exp.md) | DeepSeek | Élevée | 83,3 % | 78,0 | https://epoch.ai/benchmarks |
| 8 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Moyenne | 83,3 % | 78,0 | https://epoch.ai/benchmarks |
| 8 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | Budget | 83,3 % | 78,0 | https://epoch.ai/benchmarks |
| 8 | [QwQ-32B](https://quelleia.com/modeles/qwq-32b.md) | Alibaba | non précisée | 83,3 % | 78,0 | https://epoch.ai/benchmarks |
| 12 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Moyenne | 77,8 % | 73,8 | https://epoch.ai/benchmarks |
| 12 | [Gemini 2.5 Flash (May 2025)](https://quelleia.com/modeles/gemini-2-5-flash-may-2025.md) | Google DeepMind | non précisée | 77,8 % | 73,8 | https://epoch.ai/benchmarks |
| 14 | [Qwen3-235B-A22B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-thinking-jul-2025.md) | Alibaba | non précisée | 75 % | 72,0 | https://epoch.ai/benchmarks |
| 14 | [DeepSeek-R1 (May 2025)](https://quelleia.com/modeles/deepseek-r1-may-2025.md) | DeepSeek | non précisée | 75 % | 72,0 | https://epoch.ai/benchmarks |
| 16 | [Qwen3-32B](https://quelleia.com/modeles/qwen3-32b.md) | Alibaba | non précisée | 74,2 % | 71,5 | https://epoch.ai/benchmarks |
| 17 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Moyenne | 69,4 % | 68,7 | https://epoch.ai/benchmarks |
| 17 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 69,4 % | 68,7 | https://epoch.ai/benchmarks |
| 17 | [MiniMax-M1-80k](https://quelleia.com/modeles/minimax-m1-80k.md) | MiniMax | non précisée | 69,4 % | 68,7 | https://epoch.ai/benchmarks |
| 20 | [Qwen3-235B-A22B](https://quelleia.com/modeles/qwen3-235b-a22b.md) | Alibaba | non précisée | 67,7 % | 67,7 | https://epoch.ai/benchmarks |
| 21 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 66,7 % | 67,2 | https://epoch.ai/benchmarks |
| 21 | [Qwen3-Max](https://quelleia.com/modeles/qwen3-max.md) | Alibaba | non précisée | 66,7 % | 67,2 | https://epoch.ai/benchmarks |
| 21 | [Kimi K2 (Sep 2025)](https://quelleia.com/modeles/kimi-k2-sep-2025.md) | Moonshot | non précisée | 66,7 % | 67,2 | https://epoch.ai/benchmarks |
| 21 | [Grok-3 mini](https://quelleia.com/modeles/grok-3-mini.md) | xAI | Moyenne | 66,7 % | 67,2 | https://epoch.ai/benchmarks |
| 21 | [Gemini 2.5 Pro (May 2025)](https://quelleia.com/modeles/gemini-2-5-pro-may-2025.md) | Google DeepMind | non précisée | 66,7 % | 67,2 | https://epoch.ai/benchmarks |
| 21 | [GPT-4o (Jan 2025)](https://quelleia.com/modeles/gpt-4o-jan-2025.md) | OpenAI | non précisée | 66,7 % | 67,2 | https://epoch.ai/benchmarks |
| 21 | [Qwen2.5-Max](https://quelleia.com/modeles/qwen2-5-max.md) | Alibaba | non précisée | 66,7 % | 67,2 | https://epoch.ai/benchmarks |
| 28 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 63,9 % | 65,7 | https://epoch.ai/benchmarks |
| 28 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 63,9 % | 65,7 | https://epoch.ai/benchmarks |
| 30 | [Qwen3-14B](https://quelleia.com/modeles/qwen3-14b.md) | Alibaba | non précisée | 62,5 % | 65,0 | https://epoch.ai/benchmarks |
| 31 | [Qwen3-8B](https://quelleia.com/modeles/qwen3-8b.md) | Alibaba | non précisée | 62,1 % | 64,8 | https://epoch.ai/benchmarks |
| 32 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | non précisée | 61,1 % | 64,3 | https://epoch.ai/benchmarks |
| 32 | [Kimi K2 (Jul 2025)](https://quelleia.com/modeles/kimi-k2-jul-2025.md) | Moonshot | non précisée | 61,1 % | 64,3 | https://epoch.ai/benchmarks |
| 32 | [Gemini 2.0 Flash (Feb 2025)](https://quelleia.com/modeles/gemini-2-0-flash-feb-2025.md) | Google DeepMind | non précisée | 61,1 % | 64,3 | https://epoch.ai/benchmarks |
| 35 | [Grok 3](https://quelleia.com/modeles/grok-3.md) | xAI | non précisée | 58,3 % | 63,0 | https://epoch.ai/benchmarks |
| 35 | [chutes/GLM-4.5-FP8](https://quelleia.com/modeles/chutes-glm-4-5-fp8.md) | Z.ai (Zhipu AI) | non précisée | 58,3 % | 63,0 | https://epoch.ai/benchmarks |
| 37 | [deepinfra/Qwen3-Next-80B-A3B-Instruct](https://quelleia.com/modeles/deepinfra-qwen3-next-80b-a3b-instruct.md) | Alibaba | non précisée | 55,6 % | 61,7 | https://epoch.ai/benchmarks |
| 38 | [Qwen3-235B-A22B-Instruct (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-instruct-jul-2025.md) | Alibaba | non précisée | 52,9 % | 60,4 | https://epoch.ai/benchmarks |
| 39 | [DeepSeek-V3.1](https://quelleia.com/modeles/deepseek-v3-1.md) | DeepSeek | non précisée | 52,8 % | 60,3 | https://epoch.ai/benchmarks |
| 39 | [Gemini 2.0 Flash Thinking (Jan 2025)](https://quelleia.com/modeles/gemini-2-0-flash-thinking-jan-2025.md) | Google DeepMind | non précisée | 52,8 % | 60,3 | https://epoch.ai/benchmarks |
| 41 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Moyenne | 50 % | 59,0 | https://epoch.ai/benchmarks |
| 41 | [DeepSeek-V3 (Mar 2025)](https://quelleia.com/modeles/deepseek-v3-mar-2025.md) | DeepSeek | non précisée | 50 % | 59,0 | https://epoch.ai/benchmarks |
| 43 | [Gemini 2.5 Flash (Apr 2025)](https://quelleia.com/modeles/gemini-2-5-flash-apr-2025.md) | Google DeepMind | non précisée | 47,2 % | 57,7 | https://epoch.ai/benchmarks |
| 43 | [Gemini 2.5 Flash-Lite (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-flash-lite-jun-2025.md) | Google DeepMind | non précisée | 47,2 % | 57,7 | https://epoch.ai/benchmarks |
| 45 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 46,9 % | 57,5 | https://epoch.ai/benchmarks |
| 46 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 46,2 % | 57,2 | https://epoch.ai/benchmarks |
| 47 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | Élevée | 44,4 % | 56,3 | https://epoch.ai/benchmarks |
| 47 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | Moyenne | 44,4 % | 56,3 | https://epoch.ai/benchmarks |
| 47 | [GPT-4.1 mini](https://quelleia.com/modeles/gpt-4-1-mini.md) | OpenAI | non précisée | 44,4 % | 56,3 | https://epoch.ai/benchmarks |
| 50 | [chutes/Qwen3-Next-80B-A3B-Instruct](https://quelleia.com/modeles/chutes-qwen3-next-80b-a3b-instruct.md) | Alibaba | non précisée | 41,7 % | 55,0 | https://epoch.ai/benchmarks |
| 50 | [Gemini 2.0 Pro](https://quelleia.com/modeles/gemini-2-0-pro.md) | Google DeepMind | non précisée | 41,7 % | 55,0 | https://epoch.ai/benchmarks |
| 52 | [Qwen3-30B-A3B](https://quelleia.com/modeles/qwen3-30b-a3b.md) | Alibaba | non précisée | 40,6 % | 54,5 | https://epoch.ai/benchmarks |
| 53 | [Llama 4 Scout](https://quelleia.com/modeles/llama-4-scout.md) | Meta AI | non précisée | 36 % | 52,2 | https://epoch.ai/benchmarks |
| 54 | [Gemma 3 27B](https://quelleia.com/modeles/gemma-3-27b.md) | Google DeepMind | non précisée | 33,3 % | 50,8 | https://epoch.ai/benchmarks |
| 54 | [Llama 3.3 70B](https://quelleia.com/modeles/llama-3-3-70b.md) | Meta AI | non précisée | 33,3 % | 50,8 | https://epoch.ai/benchmarks |
| 56 | [GPT-4.1 nano](https://quelleia.com/modeles/gpt-4-1-nano.md) | OpenAI | non précisée | 25 % | 46,0 | https://epoch.ai/benchmarks |
| 56 | [nvidia-nemotron-nano-9b-v2](https://quelleia.com/modeles/nvidia-nemotron-nano-9b-v2.md) | NVIDIA | non précisée | 25 % | 46,0 | https://epoch.ai/benchmarks |

## En bref

**Que mesure Fiction.LiveBench ?** Répondre à des questions sur de longues histoires : qui sait quoi, dans quel ordre, ce qui est sous-entendu. Sur Quelle IA, il est rangé dans le dossier Données.

**Comment Fiction.LiveBench est-il noté ?** Part de bonnes réponses quand l'histoire fait environ 16 000 jetons ; le classement d'origine teste aussi des longueurs jusqu'à 192 000 jetons. Un modèle qui obtient 50 % a un score IA d'environ 59.

**Qui est en tête sur Fiction.LiveBench ?** GPT-5 et o3-pro sont en tête de Fiction.LiveBench avec 97,2 %, dans l'édition du 28 septembre 2026. Suivent Grok 4 (94,4 %) et Grok 4 Fast (94,4 %). 57 modèles y sont mesurés.

**Quelles sont les limites de Fiction.LiveBench ?** Seulement 36 questions sur 30 histoires. La longueur retenue ici, 16 000 jetons, est courte face aux contextes des modèles actuels. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse Fiction.LiveBench dans le score IA ?** Fiction.LiveBench compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Données est un dossier sans score : ses benchmarks sont suivis pour information.

**Qui maintient Fiction.LiveBench ?** Fiction.live. Sa page de référence : fiction.live/stories/Fiction-liveBench-Mar-14-2025/oQdzQvKHw8JyXbN87/home.

## Les autres benchmarks du dossier Données

- [SimpleQA Verified](https://quelleia.com/benchmarks/simpleqa_verified.md) : 73 modèles · hors score
- [GDP.pdf](https://quelleia.com/benchmarks/gdp_pdf.md) : 30 modèles · hors score
- [CL-bench](https://quelleia.com/benchmarks/cl_bench.md) : 20 modèles · hors score
- [CL-bench Life](https://quelleia.com/benchmarks/cl_bench_life.md) : 14 modèles · hors score

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
