À quoi il sert
BIG-Bench Hard (BBH) est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Test historiqueFiche benchmark · Suzgun et al. (Google Research et Stanford), à partir de BIG-bench · github.com
23 exercices de logique et de raisonnement en plusieurs étapes, retenus en 2022 parce que les modèles y échouaient.
BIG-Bench Hard (BBH) est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Moyenne des bonnes réponses sur l'ensemble des exercices.
Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Jeu public de 2022, largement vu à l'entraînement et saturé. Les scores viennent d'articles aux réglages variés.
Suzgun et al. (Google Research et Stanford), à partir de BIG-bench.
github.com/suzgunmirac/BIG-Bench-Hard · test historique · 45 modèles mesurés
En tête : Gemini 1.5 Pro (May 2024), 89,2 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 62 % a un score IA d'environ 19. Le meilleur, Gemini 1.5 Pro (May 2024), atteint 89,2 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. BIG-Bench Hard (BBH) est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.