# TriviaQA

> Fiche du benchmark TriviaQA sur Quelle IA, édition du 28 septembre 2026. Des questions de culture générale écrites par des amateurs de quiz, à réponse courte. En tête au 28 septembre 2026 : Llama 2-70B (87,6 %). Notation, limites et classement des 38 modèles mesurés.

Page : https://quelleia.com/benchmarks/triviaqa/
Source du benchmark : https://nlp.cs.washington.edu/triviaqa/
Mainteneur : Joshi et al. (université de Washington, 2017)
Tâche : Tests historiques
État : archivé

## À quoi il sert

TriviaQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Part de réponses exactement identiques à la réponse attendue.

## Ce qu'il ne dit pas

Test de 2017, largement mémorisé par les modèles. Les résultats viennent d'articles aux réglages variés.

## Qui le tient

Joshi et al. (université de Washington, 2017).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 82 %. Le meilleur, Llama 2-70B, atteint 87,6 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 82 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 86 %
- Score IA 100 (niveau de Claude Opus 5.5) : 89 %

## Son poids dans le score IA

0 % du score général. TriviaQA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (38 modèles mesurés · 115 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 87,6 % | 90,8 | https://epoch.ai/benchmarks |
| 2 | [Claude 2](https://quelleia.com/modeles/claude-2.md) | Anthropic | non précisée | 87,5 % | 89,9 | https://epoch.ai/benchmarks |
| 3 | [Claude 1.3](https://quelleia.com/modeles/claude-1-3.md) | Anthropic | non précisée | 86,7 % | 83,4 | https://epoch.ai/benchmarks |
| 4 | [PaLM 2-L](https://quelleia.com/modeles/palm-2-l.md) | Google DeepMind | non précisée | 86,1 % | 78,7 | https://epoch.ai/benchmarks |
| 5 | [LLaMA-65B](https://quelleia.com/modeles/llama-65b.md) | Meta AI | non précisée | 86 % | 78,0 | https://epoch.ai/benchmarks |
| 6 | [GPT-3.5 Turbo (Nov 2023)](https://quelleia.com/modeles/gpt-3-5-turbo-nov-2023.md) | OpenAI | non précisée | 85,8 % | 76,5 | https://epoch.ai/benchmarks |
| 7 | [GPT-4 (Jun 2023)](https://quelleia.com/modeles/gpt-4-jun-2023.md) | OpenAI | non précisée | 84,8 % | 69,1 | https://epoch.ai/benchmarks |
| 8 | [Llama 2-34B](https://quelleia.com/modeles/llama-2-34b.md) | Meta AI | non précisée | 84,6 % | 67,7 | https://epoch.ai/benchmarks |
| 9 | [LLaMA-33B](https://quelleia.com/modeles/llama-33b.md) | Meta AI | non précisée | 83,8 % | 62,2 | https://epoch.ai/benchmarks |
| 10 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 82,9 % | 56,3 | https://epoch.ai/benchmarks |
| 11 | [Llama 3.1-405B](https://quelleia.com/modeles/llama-3-1-405b.md) | Meta AI | non précisée | 82,7 % | 55,0 | https://epoch.ai/benchmarks |
| 12 | [Mixtral 8x7B](https://quelleia.com/modeles/mixtral-8x7b.md) | Mistral AI | non précisée | 82,2 % | 51,8 | https://epoch.ai/benchmarks |
| 13 | [PaLM 2-M](https://quelleia.com/modeles/palm-2-m.md) | Google DeepMind | non précisée | 81,7 % | 48,7 | https://epoch.ai/benchmarks |
| 14 | [PaLM (540B)](https://quelleia.com/modeles/palm-540b.md) | Google Research | non précisée | 81,4 % | 46,9 | https://epoch.ai/benchmarks |
| 15 | [DeepSeek-V2 (MoE-236B, May 2024)](https://quelleia.com/modeles/deepseek-v2-moe-236b-may-2024.md) | DeepSeek | non précisée | 80 % | 38,6 | https://epoch.ai/benchmarks |
| 16 | [Falcon-40B](https://quelleia.com/modeles/falcon-40b.md) | Technology Innovation Institute | non précisée | 79,9 % | 38,0 | https://epoch.ai/benchmarks |
| 17 | [Llama 2-13B](https://quelleia.com/modeles/llama-2-13b.md) | Meta AI | non précisée | 79,6 % | 36,3 | https://epoch.ai/benchmarks |
| 18 | [Claude Instant](https://quelleia.com/modeles/claude-instant.md) | Anthropic | non précisée | 78,9 % | 32,4 | https://epoch.ai/benchmarks |
| 19 | [LLaMA-13B](https://quelleia.com/modeles/llama-13b.md) | Meta AI | non précisée | 77,9 % | 27,0 | https://epoch.ai/benchmarks |
| 20 | [GLaM](https://quelleia.com/modeles/glam.md) | Google DeepMind | non précisée | 75,8 % | 16,2 | https://epoch.ai/benchmarks |
| 21 | [Mistral 7B v0.1](https://quelleia.com/modeles/mistral-7b-v0-1.md) | Mistral AI | non précisée | 75,2 % | 13,2 | https://epoch.ai/benchmarks |
| 21 | [PaLM 2-S](https://quelleia.com/modeles/palm-2-s.md) | Google DeepMind | non précisée | 75,2 % | 13,2 | https://epoch.ai/benchmarks |
| 23 | [phi-3-medium 14B](https://quelleia.com/modeles/phi-3-medium-14b.md) | Microsoft | non précisée | 73,9 % | 6,9 | https://epoch.ai/benchmarks |
| 24 | [Llama 2-7B](https://quelleia.com/modeles/llama-2-7b.md) | Meta AI | non précisée | 73,7 % | 6,0 | https://epoch.ai/benchmarks |
| 25 | [MPT-30B](https://quelleia.com/modeles/mpt-30b.md) | MosaicML | non précisée | 73,6 % | 5,5 | https://epoch.ai/benchmarks |
| 26 | [Gemma 7B](https://quelleia.com/modeles/gemma-7b.md) | Google DeepMind | non précisée | 72,3 % | -0,5 | https://epoch.ai/benchmarks |
| 27 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 71,9 % | -2,4 | https://epoch.ai/benchmarks |
| 28 | [InstructGPT 175B](https://quelleia.com/modeles/instructgpt-175b.md) | OpenAI | non précisée | 71,2 % | -5,5 | https://epoch.ai/benchmarks |
| 29 | [LLaMA-7B](https://quelleia.com/modeles/llama-7b.md) | Meta AI | non précisée | 71 % | -6,4 | https://epoch.ai/benchmarks |
| 30 | [Llama 3-8B](https://quelleia.com/modeles/llama-3-8b.md) | Meta AI | non précisée | 67,7 % | -20,7 | https://epoch.ai/benchmarks |
| 31 | [Chinchilla](https://quelleia.com/modeles/chinchilla.md) | DeepMind | non précisée | 64,6 % | -33,4 | https://epoch.ai/benchmarks |
| 31 | [Falcon-7B](https://quelleia.com/modeles/falcon-7b.md) | Technology Innovation Institute | non précisée | 64,6 % | -33,4 | https://epoch.ai/benchmarks |
| 33 | [phi-3-mini 3.8B](https://quelleia.com/modeles/phi-3-mini-3-8b.md) | Microsoft | non précisée | 64 % | -35,8 | https://epoch.ai/benchmarks |
| 34 | [MPT-7B](https://quelleia.com/modeles/mpt-7b.md) | MosaicML | non précisée | 61,6 % | -45,2 | https://epoch.ai/benchmarks |
| 35 | [phi-3-small 7.4B](https://quelleia.com/modeles/phi-3-small-7-4b.md) | Microsoft | non précisée | 58,1 % | -58,6 | https://epoch.ai/benchmarks |
| 36 | [Gopher (280B)](https://quelleia.com/modeles/gopher-280b.md) | DeepMind | non précisée | 57,2 % | -61,9 | https://epoch.ai/benchmarks |
| 37 | [Gemma 2B](https://quelleia.com/modeles/gemma-2b.md) | Google DeepMind | non précisée | 53,2 % | -76,8 | https://epoch.ai/benchmarks |
| 38 | [Phi-2](https://quelleia.com/modeles/phi-2.md) | Microsoft | non précisée | 45,2 % | -106,2 | https://epoch.ai/benchmarks |

## En bref

**Que mesure TriviaQA ?** Des questions de culture générale écrites par des amateurs de quiz, à réponse courte. C'est un test historique, hors des scores d'aujourd'hui.

**Comment TriviaQA est-il noté ?** Part de réponses exactement identiques à la réponse attendue. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 82 %.

**Qui est en tête sur TriviaQA ?** Llama 2-70B (Meta AI) est en tête de TriviaQA avec 87,6 %, dans l'édition du 28 septembre 2026. Suivent Claude 2 (87,5 %) et Claude 1.3 (86,7 %). 38 modèles y sont mesurés.

**Quelles sont les limites de TriviaQA ?** Test de 2017, largement mémorisé par les modèles. Les résultats viennent d'articles aux réglages variés. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse TriviaQA dans le score IA ?** TriviaQA compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient TriviaQA ?** Joshi et al. (université de Washington, 2017). Sa page de référence : nlp.cs.washington.edu/triviaqa.

## Les autres tests historiques

- [MMLU](https://quelleia.com/benchmarks/mmlu.md) : 127 modèles · hors score, archivé
- [WinoGrande](https://quelleia.com/benchmarks/winogrande.md) : 77 modèles · hors score, archivé
- [ARC (AI2 Reasoning Challenge)](https://quelleia.com/benchmarks/arc_ai2.md) : 76 modèles · hors score, archivé
- [BoolQ](https://quelleia.com/benchmarks/boolq.md) : 76 modèles · hors score, archivé
- [HellaSwag](https://quelleia.com/benchmarks/hellaswag.md) : 75 modèles · hors score, archivé
- [PIQA](https://quelleia.com/benchmarks/piqa.md) : 59 modèles · hors score, archivé
- [LiveBench](https://quelleia.com/benchmarks/livebench.md) : 48 modèles · hors score, archivé
- [BIG-Bench Hard (BBH)](https://quelleia.com/benchmarks/bbh.md) : 45 modèles · hors score, archivé
- [OpenBookQA](https://quelleia.com/benchmarks/openbookqa.md) : 42 modèles · hors score, archivé
- [LAMBADA](https://quelleia.com/benchmarks/lambada.md) : 26 modèles · hors score, archivé
- [ScienceQA](https://quelleia.com/benchmarks/scienceqa.md) : 23 modèles · hors score, archivé
- [ANLI (Adversarial NLI)](https://quelleia.com/benchmarks/anli.md) : 11 modèles · hors score, archivé
- [SuperGLUE](https://quelleia.com/benchmarks/superglue.md) : 8 modèles · hors score, archivé
- [CommonsenseQA 2.0](https://quelleia.com/benchmarks/csqa2.md) : 6 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
