À quoi il sert
LiveBench, raisonnement servait à noter la tâche Raisonnement. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
RaisonnementFiche benchmark · LiveBench (Abacus.AI, NYU et coauteurs) · livebench.ai
Des énigmes logiques et des déductions dont les questions sont renouvelées régulièrement.
LiveBench, raisonnement servait à noter la tâche Raisonnement. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
La part de bonnes réponses, vérifiée automatiquement, sans juge humain ni modèle juge.
Les questions récentes ne sont pas publiées. Dernière édition en juin 2026.
LiveBench (Abacus.AI, NYU et coauteurs).
livebench.ai · tâche Raisonnement · 48 modèles mesurés
En tête : GPT-5.1, 95,8 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 52. Le meilleur, GPT-5.1, atteint 95,8 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. LiveBench, raisonnement est archivé et ne compte plus : la tâche Raisonnement (15 % du score général) repose sur 9 autres benchmarks.
En couleur, la tâche Raisonnement dans le score général. LiveBench, raisonnement n'y a plus de part.