À quoi il sert
LiveBench, mathématiques servait à noter la tâche Mathématiques. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
MathsFiche benchmark · LiveBench (Abacus.AI, NYU et coauteurs) · livebench.ai
Des problèmes de mathématiques récents, de niveau concours et olympiades.
LiveBench, mathématiques servait à noter la tâche Mathématiques. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
La part de bonnes réponses, vérifiée automatiquement.
Juge la réponse finale, sans regarder la démonstration. Dernière édition en juin 2026.
LiveBench (Abacus.AI, NYU et coauteurs).
livebench.ai · tâche Maths · 48 modèles mesurés
En tête : GPT-5.1, 94,5 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 51. Le meilleur, GPT-5.1, atteint 94,5 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. LiveBench, mathématiques est archivé et ne compte plus : la tâche Mathématiques (10 % du score général) repose sur 8 autres benchmarks.
En couleur, la tâche Mathématiques dans le score général. LiveBench, mathématiques n'y a plus de part.