À quoi il sert
LiveBench est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Test historiqueFiche benchmark · Équipe LiveBench (White et al., Abacus.AI) · livebench.ai
Un test généraliste aux questions renouvelées régulièrement : raisonnement, code, maths, analyse de données, langue et respect des consignes.
LiveBench est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Moyenne sur 100 des catégories ; chaque question a une réponse objective, corrigée automatiquement sans IA correctrice.
Les données d'Epoch sont figées sur le jeu de questions de novembre 2024 et ne contiennent aucun modèle sorti après novembre 2025.
Équipe LiveBench (White et al., Abacus.AI).
livebench.ai · test historique · 48 modèles mesurés
En tête : Gemini 2.5 Pro (Mar 2025), 82,4 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 51. Le meilleur, Gemini 2.5 Pro (Mar 2025), atteint 82,4 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. LiveBench est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.