Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

DonnéesFiche benchmark · Fiction.live · fiction.live

Fiction.LiveBench

Répondre à des questions sur de longues histoires : qui sait quoi, dans quel ordre, ce qui est sous-entendu.

ARCHIVÉ

À quoi il sert

Fiction.LiveBench alimente le dossier Données, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général. Il est archivé, faute de modèle récent mesuré.

Comment c'est noté

Part de bonnes réponses quand l'histoire fait environ 16 000 jetons ; le classement d'origine teste aussi des longueurs jusqu'à 192 000 jetons.

Ce qu'il ne dit pas

Seulement 36 questions sur 30 histoires. La longueur retenue ici, 16 000 jetons, est courte face aux contextes des modèles actuels.

Comment lire le score

57 modèles mesurés · 61 mesures

En tête : 2 modèles, 97,2 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 59. 2 modèles partagent la première place avec 97,2 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
34 %
Score IA 76niveau de Claude Sonnet 4.5
81 %
Score IA 100niveau de Claude Opus 5.5
97 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. Données est un dossier sans score : ses benchmarks sont suivis pour information.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-5OpenAIMoyenne97,2 %100,9
1o3-proOpenAIMoyenne97,2 %100,9
3Grok 4xAINon précisée94,4 %92,4
3Grok 4 FastxAINon précisée94,4 %92,4
5Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée91,7 %87,4
6o3OpenAIMoyenne88,9 %83,6
7Kimi K2.5Moonshot · poids ouvertsNon précisée86,1 %80,5
8DeepSeek-V3.2-ExpDeepSeek · 2 configurationsÉlevée83,3 %78,0
8o1OpenAIMoyenne83,3 %78,0
8Claude 3.7 SonnetAnthropic · 2 configurationsBudget83,3 %78,0
57 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 57 →Replier le classement ↑
8QwQ-32BAlibaba · poids ouvertsNon précisée83,3 %78,0
12o4-miniOpenAIMoyenne77,8 %73,8
12Gemini 2.5 Flash (May 2025)Google DeepMindNon précisée77,8 %73,8
14Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée75 %72,0
14DeepSeek-R1 (May 2025)DeepSeek · poids ouvertsNon précisée75 %72,0
16Qwen3-32BAlibaba · poids ouvertsNon précisée74,2 %71,5
17GPT-5 miniOpenAIMoyenne69,4 %68,7
17DeepSeek-R1DeepSeek · poids ouvertsNon précisée69,4 %68,7
17MiniMax-M1-80kMiniMaxNon précisée69,4 %68,7
20Qwen3-235B-A22BAlibaba · poids ouvertsNon précisée67,7 %67,7
21Gemini 2.5 Pro (Mar 2025)Google DeepMind · 2 configurationsNon précisée66,7 %67,2
21Qwen3-MaxAlibabaNon précisée66,7 %67,2
21Kimi K2 (Sep 2025)MoonshotNon précisée66,7 %67,2
21Grok-3 minixAIMoyenne66,7 %67,2
21Gemini 2.5 Pro (May 2025)Google DeepMindNon précisée66,7 %67,2
21GPT-4o (Jan 2025)OpenAINon précisée66,7 %67,2
21Qwen2.5-MaxAlibabaNon précisée66,7 %67,2
28GPT-4.5OpenAINon précisée63,9 %65,7
28GPT-4.1OpenAINon précisée63,9 %65,7
30Qwen3-14BAlibaba · poids ouvertsNon précisée62,5 %65,0
31Qwen3-8BAlibaba · poids ouvertsNon précisée62,1 %64,8
32Claude Opus 4AnthropicNon précisée61,1 %64,3
32Kimi K2 (Jul 2025)MoonshotNon précisée61,1 %64,3
32Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée61,1 %64,3
35Grok 3xAINon précisée58,3 %63,0
35chutes/GLM-4.5-FP8Z.ai (Zhipu AI) · poids ouvertsNon précisée58,3 %63,0
37deepinfra/Qwen3-Next-80B-A3B-InstructAlibabaNon précisée55,6 %61,7
38Qwen3-235B-A22B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée52,9 %60,4
39DeepSeek-V3.1DeepSeek · poids ouvertsNon précisée52,8 %60,3
39Gemini 2.0 Flash Thinking (Jan 2025)Google DeepMindNon précisée52,8 %60,3
41o3-miniOpenAIMoyenne50 %59,0
41DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée50 %59,0
43Gemini 2.5 Flash (Apr 2025)Google DeepMindNon précisée47,2 %57,7
43Gemini 2.5 Flash-Lite (Jun 2025)Google DeepMindNon précisée47,2 %57,7
45Claude Sonnet 4AnthropicNon précisée46,9 %57,5
46Llama 4 MaverickMeta AI · poids ouvertsNon précisée46,2 %57,2
47gpt-oss-120bOpenAI · poids ouverts · 2 configurationsÉlevée44,4 %56,3
47GPT-5 nanoOpenAIMoyenne44,4 %56,3
47GPT-4.1 miniOpenAINon précisée44,4 %56,3
50chutes/Qwen3-Next-80B-A3B-InstructAlibaba · poids ouvertsNon précisée41,7 %55,0
50Gemini 2.0 ProGoogle DeepMindNon précisée41,7 %55,0
52Qwen3-30B-A3BAlibaba · poids ouvertsNon précisée40,6 %54,5
53Llama 4 ScoutMeta AI · poids ouvertsNon précisée36 %52,2
54Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée33,3 %50,8
54Llama 3.3 70BMeta AI · poids ouvertsNon précisée33,3 %50,8
56GPT-4.1 nanoOpenAINon précisée25 %46,0
56nvidia-nemotron-nano-9b-v2NVIDIA · poids ouvertsNon précisée25 %46,0

En bref

Que mesure Fiction.LiveBench ?
Répondre à des questions sur de longues histoires : qui sait quoi, dans quel ordre, ce qui est sous-entendu. Sur Quelle IA, il est rangé dans le dossier Données.
Comment Fiction.LiveBench est-il noté ?
Part de bonnes réponses quand l'histoire fait environ 16 000 jetons ; le classement d'origine teste aussi des longueurs jusqu'à 192 000 jetons. Un modèle qui obtient 50 % a un score IA d'environ 59.
Qui est en tête sur Fiction.LiveBench ?
GPT-5 et o3-pro sont en tête de Fiction.LiveBench avec 97,2 %, dans l'édition du 28 septembre 2026. Suivent Grok 4 (94,4 %) et Grok 4 Fast (94,4 %). 57 modèles y sont mesurés.
Quelles sont les limites de Fiction.LiveBench ?
Seulement 36 questions sur 30 histoires. La longueur retenue ici, 16 000 jetons, est courte face aux contextes des modèles actuels. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse Fiction.LiveBench dans le score IA ?
Fiction.LiveBench compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Données est un dossier sans score : ses benchmarks sont suivis pour information.
Qui maintient Fiction.LiveBench ?
Fiction.live. Sa page de référence : fiction.live/stories/Fiction-liveBench-Mar-14-2025/oQdzQvKHw8JyXbN87/home.

Les autres benchmarks du dossier Données

Tous les benchmarks →Comment le score IA est calculé →