À quoi il sert
Fiction.LiveBench alimente le dossier Données, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général. Il est archivé, faute de modèle récent mesuré.
DonnéesFiche benchmark · Fiction.live · fiction.live
Répondre à des questions sur de longues histoires : qui sait quoi, dans quel ordre, ce qui est sous-entendu.
Fiction.LiveBench alimente le dossier Données, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général. Il est archivé, faute de modèle récent mesuré.
Part de bonnes réponses quand l'histoire fait environ 16 000 jetons ; le classement d'origine teste aussi des longueurs jusqu'à 192 000 jetons.
Seulement 36 questions sur 30 histoires. La longueur retenue ici, 16 000 jetons, est courte face aux contextes des modèles actuels.
Fiction.live.
fiction.live/stories/Fiction-liveBench-Mar-14-2025/oQdzQvKHw8JyXbN87/home · dossier Données · 57 modèles mesurés
En tête : 2 modèles, 97,2 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 59. 2 modèles partagent la première place avec 97,2 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. Données est un dossier sans score : ses benchmarks sont suivis pour information.