# SimpleQA Verified

> Fiche du benchmark SimpleQA Verified sur Quelle IA, édition du 28 septembre 2026. 1 000 questions factuelles courtes et précises (politique, sciences, arts, sport, géographie) pour voir si le modèle sait ou invente. En tête au 28 septembre 2026 : GPT-6 Astra (75,6 %). Notation, limites et classement des 73 modèles mesurés.

Page : https://quelleia.com/benchmarks/simpleqa_verified/
Source du benchmark : https://epoch.ai/benchmarks/simpleqa-verified
Mainteneur : Google DeepMind pour le jeu de questions ; Epoch AI pour l'évaluation
Tâche : Données
État : actif

## À quoi il sert

SimpleQA Verified alimente le dossier Données, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général.

## Comment c'est noté

Part de réponses jugées correctes par un modèle correcteur, qui distingue aussi les erreurs et les refus de répondre.

## Ce qu'il ne dit pas

Le score global traite un refus prudent comme une erreur, alors que la tendance à s'abstenir varie beaucoup d'un modèle à l'autre.

## Qui le tient

Google DeepMind pour le jeu de questions ; Epoch AI pour l'évaluation.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 87. Le meilleur, GPT-6 Astra, atteint 75,6 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 10 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 34 %
- Score IA 100 (niveau de Claude Opus 5.5) : 68 %

## Son poids dans le score IA

0 % du score général. Données est un dossier sans score : ses benchmarks sont suivis pour information.

## Classement (73 modèles mesurés · 82 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 75,6 % | 105,7 | https://epoch.ai/benchmarks |
| 2 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | Élevée | 73,5 % | 103,9 | https://epoch.ai/benchmarks |
| 3 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 72,2 % | 102,8 | https://epoch.ai/benchmarks |
| 4 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 70,8 % | 101,7 | https://epoch.ai/benchmarks |
| 5 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 70,7 % | 101,6 | https://epoch.ai/benchmarks |
| 6 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 69,7 % | 100,9 | https://epoch.ai/benchmarks |
| 6 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | Élevée | 69,7 % | 100,9 | https://epoch.ai/benchmarks |
| 8 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | Élevée | 69,2 % | 100,5 | https://epoch.ai/benchmarks |
| 9 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | Élevée | 66,8 % | 98,7 | https://epoch.ai/benchmarks |
| 10 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | Élevée | 66,2 % | 98,3 | https://epoch.ai/benchmarks |
| 10 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 66,2 % | 98,3 | https://epoch.ai/benchmarks |
| 12 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 63 % | 96,0 | https://epoch.ai/benchmarks |
| 13 | [Muse Spark 1.2](https://quelleia.com/modeles/muse-spark-1-2.md) | Meta AI | Maximale | 60,3 % | 94,2 | https://epoch.ai/benchmarks |
| 14 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 59,9 % | 93,9 | https://epoch.ai/benchmarks |
| 15 | [Muse Spark 1.1](https://quelleia.com/modeles/muse-spark-1-1.md) | Meta AI | non précisée | 57,8 % | 92,5 | https://epoch.ai/benchmarks |
| 16 | [Qwen3.7-Max](https://quelleia.com/modeles/qwen3-7-max.md) | Alibaba | non précisée | 55,8 % | 91,2 | https://epoch.ai/benchmarks |
| 17 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 53 % | 89,4 | https://epoch.ai/benchmarks |
| 18 | [DeepSeek V4 Pro 0813](https://quelleia.com/modeles/deepseek-v4-pro-0813.md) | DeepSeek | Maximale | 52,9 % | 89,3 | https://epoch.ai/benchmarks |
| 19 | [Qwen 3.6 Max (Preview)](https://quelleia.com/modeles/qwen-3-6-max-preview.md) | Alibaba | non précisée | 52 % | 88,7 | https://epoch.ai/benchmarks |
| 20 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 51,7 % | 88,5 | https://epoch.ai/benchmarks |
| 21 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 50,6 % | 87,8 | https://epoch.ai/benchmarks |
| 22 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 50,1 % | 87,5 | https://epoch.ai/benchmarks |
| 23 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 49,4 % | 87,1 | https://epoch.ai/benchmarks |
| 24 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | Élevée | 49,3 % | 87,0 | https://epoch.ai/benchmarks |
| 25 | [Qwen3-Max](https://quelleia.com/modeles/qwen3-max.md) | Alibaba | non précisée | 48,7 % | 86,6 | https://epoch.ai/benchmarks |
| 26 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | Élevée | 48,3 % | 86,3 | https://epoch.ai/benchmarks |
| 27 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 48 % | 86,1 | https://epoch.ai/benchmarks |
| 28 | [Qwen3.8 Max (0902)](https://quelleia.com/modeles/qwen3-8-max-0902.md) | Alibaba | Maximale | 47,3 % | 85,7 | https://epoch.ai/benchmarks |
| 29 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Maximale | 47 % | 85,5 | https://epoch.ai/benchmarks |
| 30 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | Maximale | 47 % | 85,5 | https://epoch.ai/benchmarks |
| 31 | [Claude Sonnet 5.5](https://quelleia.com/modeles/claude-sonnet-5-5.md) | Anthropic | Maximale | 46,5 % | 85,2 | https://epoch.ai/benchmarks |
| 32 | [GPT-5.4 Pro](https://quelleia.com/modeles/gpt-5-4-pro.md) | OpenAI | Maximale | 46,3 % | 85,0 | https://epoch.ai/benchmarks |
| 33 | [Qwen 3.8 Max](https://quelleia.com/modeles/qwen-3-8-max.md) | Alibaba | Maximale | 45,8 % | 84,7 | https://epoch.ai/benchmarks |
| 34 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | Budget | 45,7 % | 84,7 | https://epoch.ai/benchmarks |
| 35 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 45,1 % | 84,3 | https://epoch.ai/benchmarks |
| 36 | [Qwen 3.6 Plus](https://quelleia.com/modeles/qwen-3-6-plus.md) | Alibaba | non précisée | 44,1 % | 83,6 | https://epoch.ai/benchmarks |
| 37 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 43,2 % | 83,0 | https://epoch.ai/benchmarks |
| 38 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Élevée | 41,1 % | 81,6 | https://epoch.ai/benchmarks |
| 39 | [GLM-5.3](https://quelleia.com/modeles/glm-5-3.md) | Z.ai (Zhipu AI) | Maximale | 41 % | 81,6 | https://epoch.ai/benchmarks |
| 39 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 41 % | 81,6 | https://epoch.ai/benchmarks |
| 41 | [Qwen3-235B-A22B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-thinking-jul-2025.md) | Alibaba | non précisée | 40,4 % | 81,2 | https://epoch.ai/benchmarks |
| 42 | [Inkling](https://quelleia.com/modeles/inkling.md) | Thinking Machines | Maximale | 40,3 % | 81,1 | https://epoch.ai/benchmarks |
| 43 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Maximale | 37,1 % | 78,9 | https://epoch.ai/benchmarks |
| 44 | [Kimi K2.7 Code](https://quelleia.com/modeles/kimi-k2-7-code.md) | Moonshot | non précisée | 36,5 % | 78,5 | https://epoch.ai/benchmarks |
| 45 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Élevée | 35,5 % | 77,8 | https://epoch.ai/benchmarks |
| 46 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 34,9 % | 77,4 | https://epoch.ai/benchmarks |
| 47 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 34,3 % | 77,0 | https://epoch.ai/benchmarks |
| 48 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | Maximale | 34,2 % | 76,9 | https://epoch.ai/benchmarks |
| 49 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 34 % | 76,7 | https://epoch.ai/benchmarks |
| 50 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | Maximale | 33,7 % | 76,5 | https://epoch.ai/benchmarks |
| 51 | [DeepSeek V4 Flash 0731](https://quelleia.com/modeles/deepseek-v4-flash-0731.md) | DeepSeek | Maximale | 33,6 % | 76,5 | https://epoch.ai/benchmarks |
| 52 | [Grok 4.3 Beta](https://quelleia.com/modeles/grok-4-3-beta.md) | xAI | Élevée | 33,2 % | 76,2 | https://epoch.ai/benchmarks |
| 53 | [GLM-4.7](https://quelleia.com/modeles/glm-4-7.md) | Z.ai (Zhipu AI) | non précisée | 32,2 % | 75,4 | https://epoch.ai/benchmarks |
| 54 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 31,1 % | 74,6 | https://epoch.ai/benchmarks |
| 55 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | Budget | 30,7 % | 74,3 | https://epoch.ai/benchmarks |
| 56 | [Grok 4.20](https://quelleia.com/modeles/grok-4-20.md) | xAI | non précisée | 30,2 % | 73,9 | https://epoch.ai/benchmarks |
| 57 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | Élevée | 29,4 % | 73,3 | https://epoch.ai/benchmarks |
| 58 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 26 % | 70,6 | https://epoch.ai/benchmarks |
| 59 | [Qwen 3.5 Plus (hosted 397B-A17B)](https://quelleia.com/modeles/qwen-3-5-plus-hosted-397b-a17b.md) | Alibaba | non précisée | 25,4 % | 70,0 | https://epoch.ai/benchmarks |
| 60 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Élevée | 21,6 % | 66,6 | https://epoch.ai/benchmarks |
| 61 | [Qwen 3.5 Flash (hosted 35B-A3B)](https://quelleia.com/modeles/qwen-3-5-flash-hosted-35b-a3b.md) | Alibaba | non précisée | 20,3 % | 65,4 | https://epoch.ai/benchmarks |
| 62 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Faible | 19,6 % | 64,7 | https://epoch.ai/benchmarks |
| 63 | [Inkling-Small](https://quelleia.com/modeles/inkling-small.md) | Thinking Machines | Maximale | 19,1 % | 64,2 | https://epoch.ai/benchmarks |
| 64 | [Qwen 3.6 Flash](https://quelleia.com/modeles/qwen-3-6-flash.md) | Alibaba | non précisée | 15,9 % | 60,6 | https://epoch.ai/benchmarks |
| 65 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 15,3 % | 59,8 | https://epoch.ai/benchmarks |
| 66 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | non précisée | 13,2 % | 57,1 | https://epoch.ai/benchmarks |
| 67 | [GPT-4.1 mini](https://quelleia.com/modeles/gpt-4-1-mini.md) | OpenAI | non précisée | 12,7 % | 56,3 | https://epoch.ai/benchmarks |
| 68 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 12,6 % | 56,2 | https://epoch.ai/benchmarks |
| 69 | [GPT-5.4 Nano](https://quelleia.com/modeles/gpt-5-4-nano.md) | OpenAI | Élevée | 11,7 % | 54,8 | https://epoch.ai/benchmarks |
| 69 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | Élevée | 11,7 % | 54,8 | https://epoch.ai/benchmarks |
| 71 | [Gemma 4 31B IT](https://quelleia.com/modeles/gemma-4-31b-it.md) | Google DeepMind | non précisée | 10,4 % | 52,7 | https://epoch.ai/benchmarks |
| 72 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 8,3 % | 48,7 | https://epoch.ai/benchmarks |
| 73 | [GPT-4.1 nano](https://quelleia.com/modeles/gpt-4-1-nano.md) | OpenAI | non précisée | 6 % | 43,1 | https://epoch.ai/benchmarks |

## En bref

**Que mesure SimpleQA Verified ?** 1 000 questions factuelles courtes et précises (politique, sciences, arts, sport, géographie) pour voir si le modèle sait ou invente. Sur Quelle IA, il est rangé dans le dossier Données.

**Comment SimpleQA Verified est-il noté ?** Part de réponses jugées correctes par un modèle correcteur, qui distingue aussi les erreurs et les refus de répondre. Un modèle qui obtient 50 % a un score IA d'environ 87.

**Qui est en tête sur SimpleQA Verified ?** GPT-6 Astra (OpenAI) est en tête de SimpleQA Verified avec 75,6 %, dans l'édition du 28 septembre 2026. Suivent Gemini 3.1 Pro (73,5 %) et Claude Opus 5.5 (72,2 %). 73 modèles y sont mesurés.

**Quelles sont les limites de SimpleQA Verified ?** Le score global traite un refus prudent comme une erreur, alors que la tendance à s'abstenir varie beaucoup d'un modèle à l'autre. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse SimpleQA Verified dans le score IA ?** SimpleQA Verified compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Données est un dossier sans score : ses benchmarks sont suivis pour information.

**Qui maintient SimpleQA Verified ?** Google DeepMind pour le jeu de questions ; Epoch AI pour l'évaluation. Sa page de référence : epoch.ai/benchmarks/simpleqa-verified.

## Les autres benchmarks du dossier Données

- [GDP.pdf](https://quelleia.com/benchmarks/gdp_pdf.md) : 30 modèles · hors score
- [CL-bench](https://quelleia.com/benchmarks/cl_bench.md) : 20 modèles · hors score
- [CL-bench Life](https://quelleia.com/benchmarks/cl_bench_life.md) : 14 modèles · hors score
- [Fiction.LiveBench](https://quelleia.com/benchmarks/fiction_livebench.md) : 57 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
