Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Joshi et al. (université de Washington, 2017) · nlp.cs.washington.edu

TriviaQA

Des questions de culture générale écrites par des amateurs de quiz, à réponse courte.

ARCHIVÉ

À quoi il sert

TriviaQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Part de réponses exactement identiques à la réponse attendue.

Ce qu'il ne dit pas

Test de 2017, largement mémorisé par les modèles. Les résultats viennent d'articles aux réglages variés.

Comment lire le score

38 modèles mesurés · 115 mesures

En tête : Llama 2-70B, 87,6 %

Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 82 %. Le meilleur, Llama 2-70B, atteint 87,6 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
82 %
Score IA 76niveau de Claude Sonnet 4.5
86 %
Score IA 100niveau de Claude Opus 5.5
89 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. TriviaQA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Llama 2-70BMeta AI · poids ouverts · 5 configurationsNon précisée87,6 %90,8
2Claude 2AnthropicNon précisée87,5 %89,9
3Claude 1.3AnthropicNon précisée86,7 %83,4
4PaLM 2-LGoogle DeepMindNon précisée86,1 %78,7
5LLaMA-65BMeta AI · poids ouverts · 8 configurationsNon précisée86 %78,0
6GPT-3.5 Turbo (Nov 2023)OpenAINon précisée85,8 %76,5
7GPT-4 (Jun 2023)OpenAINon précisée84,8 %69,1
8Llama 2-34BMeta AI · 4 configurationsNon précisée84,6 %67,7
9LLaMA-33BMeta AI · poids ouverts · 8 configurationsNon précisée83,8 %62,2
10DeepSeek-V3DeepSeek · poids ouvertsNon précisée82,9 %56,3
38 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 38 →Replier le classement ↑
11Llama 3.1-405BMeta AI · poids ouvertsNon précisée82,7 %55,0
12Mixtral 8x7BMistral AI · poids ouvertsNon précisée82,2 %51,8
13PaLM 2-MGoogle DeepMindNon précisée81,7 %48,7
14PaLM (540B)Google Research · 3 configurationsNon précisée81,4 %46,9
15DeepSeek-V2 (MoE-236B, May 2024)DeepSeek · poids ouvertsNon précisée80 %38,6
16Falcon-40BTechnology Innovation Institute · poids ouverts · 4 configurationsNon précisée79,9 %38,0
17Llama 2-13BMeta AI · poids ouverts · 5 configurationsNon précisée79,6 %36,3
18Claude InstantAnthropic · 3 configurationsNon précisée78,9 %32,4
19LLaMA-13BMeta AI · poids ouverts · 8 configurationsNon précisée77,9 %27,0
20GLaMGoogle DeepMind · 3 configurationsNon précisée75,8 %16,2
21Mistral 7B v0.1Mistral AI · poids ouverts · 2 configurationsNon précisée75,2 %13,2
21PaLM 2-SGoogle DeepMindNon précisée75,2 %13,2
23phi-3-medium 14BMicrosoft · poids ouvertsNon précisée73,9 %6,9
24Llama 2-7BMeta AI · poids ouverts · 5 configurationsNon précisée73,7 %6,0
25MPT-30BMosaicML · poids ouverts · 4 configurationsNon précisée73,6 %5,5
26Gemma 7BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée72,3 %-0,5
27Qwen2.5-72BAlibaba · poids ouvertsNon précisée71,9 %-2,4
28InstructGPT 175BOpenAI · 9 configurationsNon précisée71,2 %-5,5
29LLaMA-7BMeta AI · poids ouverts · 8 configurationsNon précisée71 %-6,4
30Llama 3-8BMeta AI · poids ouvertsNon précisée67,7 %-20,7
31ChinchillaDeepMind · 3 configurationsNon précisée64,6 %-33,4
31Falcon-7BTechnology Innovation Institute · poids ouverts · 4 configurationsNon précisée64,6 %-33,4
33phi-3-mini 3.8BMicrosoft · poids ouvertsNon précisée64 %-35,8
34MPT-7BMosaicML · poids ouverts · 4 configurationsNon précisée61,6 %-45,2
35phi-3-small 7.4BMicrosoft · poids ouvertsNon précisée58,1 %-58,6
36Gopher (280B)DeepMind · 5 configurationsNon précisée57,2 %-61,9
37Gemma 2BGoogle DeepMind · poids ouvertsNon précisée53,2 %-76,8
38Phi-2Microsoft · poids ouvertsNon précisée45,2 %-106,2

En bref

Que mesure TriviaQA ?
Des questions de culture générale écrites par des amateurs de quiz, à réponse courte. C'est un test historique, hors des scores d'aujourd'hui.
Comment TriviaQA est-il noté ?
Part de réponses exactement identiques à la réponse attendue. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 82 %.
Qui est en tête sur TriviaQA ?
Llama 2-70B (Meta AI) est en tête de TriviaQA avec 87,6 %, dans l'édition du 28 septembre 2026. Suivent Claude 2 (87,5 %) et Claude 1.3 (86,7 %). 38 modèles y sont mesurés.
Quelles sont les limites de TriviaQA ?
Test de 2017, largement mémorisé par les modèles. Les résultats viennent d'articles aux réglages variés. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse TriviaQA dans le score IA ?
TriviaQA compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient TriviaQA ?
Joshi et al. (université de Washington, 2017). Sa page de référence : nlp.cs.washington.edu/triviaqa.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →