À quoi il sert
TriviaQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Test historiqueFiche benchmark · Joshi et al. (université de Washington, 2017) · nlp.cs.washington.edu
Des questions de culture générale écrites par des amateurs de quiz, à réponse courte.
TriviaQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Part de réponses exactement identiques à la réponse attendue.
Test de 2017, largement mémorisé par les modèles. Les résultats viennent d'articles aux réglages variés.
Joshi et al. (université de Washington, 2017).
nlp.cs.washington.edu/triviaqa · test historique · 38 modèles mesurés
En tête : Llama 2-70B, 87,6 %
Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 82 %. Le meilleur, Llama 2-70B, atteint 87,6 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. TriviaQA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.