Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

DonnéesFiche benchmark · Google DeepMind pour le jeu de questions ; Epoch AI pour l'évaluation · epoch.ai

SimpleQA Verified

1 000 questions factuelles courtes et précises (politique, sciences, arts, sport, géographie) pour voir si le modèle sait ou invente.

À quoi il sert

SimpleQA Verified alimente le dossier Données, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général.

Comment c'est noté

Part de réponses jugées correctes par un modèle correcteur, qui distingue aussi les erreurs et les refus de répondre.

Ce qu'il ne dit pas

Le score global traite un refus prudent comme une erreur, alors que la tendance à s'abstenir varie beaucoup d'un modèle à l'autre.

Comment lire le score

73 modèles mesurés · 82 mesures

En tête : GPT-6 Astra, 75,6 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 87. Le meilleur, GPT-6 Astra, atteint 75,6 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
10 %
Score IA 76niveau de Claude Sonnet 4.5
34 %
Score IA 100niveau de Claude Opus 5.5
68 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. Données est un dossier sans score : ses benchmarks sont suivis pour information.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAIMaximale75,6 %105,7
2Gemini 3.1 ProGoogle DeepMindÉlevée73,5 %103,9
3Claude Opus 5.5AnthropicMaximale72,2 %102,8
4Claude Fable 5.1AnthropicMaximale70,8 %101,7
5Claude Fable 5AnthropicMaximale70,7 %101,6
6GPT-5.6 SolOpenAIMaximale69,7 %100,9
6Gemini 3.8 FlashGoogle DeepMindÉlevée69,7 %100,9
8Gemini 3.7 FlashGoogle DeepMindÉlevée69,2 %100,5
9Gemini 3 FlashGoogle DeepMindÉlevée66,8 %98,7
10Gemini 3.6 FlashGoogle DeepMindÉlevée66,2 %98,3
73 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 73 →Replier le classement ↑
10Gemini 3.5 FlashGoogle DeepMindÉlevée66,2 %98,3
12GPT-5.5OpenAIMaximale63 %96,0
13Muse Spark 1.2Meta AIMaximale60,3 %94,2
14Claude Opus 5AnthropicMaximale59,9 %93,9
15Muse Spark 1.1Meta AINon précisée57,8 %92,5
16Qwen3.7-MaxAlibabaNon précisée55,8 %91,2
17Claude Opus 4.8AnthropicMaximale53 %89,4
18DeepSeek V4 Pro 0813DeepSeek · poids ouvertsMaximale52,9 %89,3
19Qwen 3.6 Max (Preview)AlibabaNon précisée52 %88,7
20Claude Opus 4.7AnthropicMaximale51,7 %88,5
21Kimi K3Moonshot · poids ouvertsMaximale50,6 %87,8
22GPT-5OpenAIÉlevée50,1 %87,5
23o3OpenAIÉlevée49,4 %87,1
24Grok 4.6xAI · 2 configurationsÉlevée49,3 %87,0
25Qwen3-MaxAlibabaNon précisée48,7 %86,6
26Grok 4.5xAIÉlevée48,3 %86,3
27GPT-5.1OpenAIÉlevée48 %86,1
28Qwen3.8 Max (0902)AlibabaMaximale47,3 %85,7
29Claude Opus 4.6AnthropicMaximale47 %85,5
30DeepSeek-V4-ProDeepSeek · poids ouvertsMaximale47 %85,5
31Claude Sonnet 5.5AnthropicMaximale46,5 %85,2
32GPT-5.4 ProOpenAIMaximale46,3 %85,0
33Qwen 3.8 MaxAlibabaMaximale45,8 %84,7
34Claude Opus 4.5AnthropicBudget45,7 %84,7
35GPT-5.4OpenAIMaximale45,1 %84,3
36Qwen 3.6 PlusAlibabaNon précisée44,1 %83,6
37GPT-5.6 TerraOpenAIMaximale43,2 %83,0
38o1OpenAIÉlevée41,1 %81,6
39GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale41 %81,6
39GPT-5.6 LunaOpenAIMaximale41 %81,6
41Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée40,4 %81,2
42InklingThinking Machines · poids ouvertsMaximale40,3 %81,1
43GPT-5.2OpenAI · 4 configurationsMaximale37,1 %78,9
44Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée36,5 %78,5
45Claude Sonnet 4.6Anthropic · 2 configurationsÉlevée35,5 %77,8
46Kimi K2.6Moonshot · poids ouvertsNon précisée34,9 %77,4
47Kimi K2.5Moonshot · poids ouvertsNon précisée34,3 %77,0
48GLM-5.2Z.ai (Zhipu AI) · poids ouvertsMaximale34,2 %76,9
49GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée34 %76,7
50Claude Sonnet 5Anthropic · 2 configurationsMaximale33,7 %76,5
51DeepSeek V4 Flash 0731DeepSeek · poids ouvertsMaximale33,6 %76,5
52Grok 4.3 BetaxAIÉlevée33,2 %76,2
53GLM-4.7Z.ai (Zhipu AI) · poids ouvertsNon précisée32,2 %75,4
54GPT-4.1OpenAINon précisée31,1 %74,6
55Claude Sonnet 4.5Anthropic · 2 configurationsBudget30,7 %74,3
56Grok 4.20xAINon précisée30,2 %73,9
57GPT-5.4 MiniOpenAIÉlevée29,4 %73,3
58GPT-4o (Aug 2024)OpenAINon précisée26 %70,6
59Qwen 3.5 Plus (hosted 397B-A17B)AlibabaNon précisée25,4 %70,0
60GPT-5 miniOpenAIÉlevée21,6 %66,6
61Qwen 3.5 Flash (hosted 35B-A3B)AlibabaNon précisée20,3 %65,4
62o4-miniOpenAI · 2 configurationsFaible19,6 %64,7
63Inkling-SmallThinking Machines · poids ouvertsMaximale19,1 %64,2
64Qwen 3.6 FlashAlibabaNon précisée15,9 %60,6
65o3-miniOpenAIÉlevée15,3 %59,8
66Claude Haiku 4.5Anthropic · 2 configurationsNon précisée13,2 %57,1
67GPT-4.1 miniOpenAINon précisée12,7 %56,3
68Claude 3 OpusAnthropicNon précisée12,6 %56,2
69GPT-5.4 NanoOpenAIÉlevée11,7 %54,8
69GPT-5 nanoOpenAIÉlevée11,7 %54,8
71Gemma 4 31B ITGoogle DeepMind · poids ouvertsNon précisée10,4 %52,7
72GPT-4o miniOpenAINon précisée8,3 %48,7
73GPT-4.1 nanoOpenAINon précisée6 %43,1

En bref

Que mesure SimpleQA Verified ?
1 000 questions factuelles courtes et précises (politique, sciences, arts, sport, géographie) pour voir si le modèle sait ou invente. Sur Quelle IA, il est rangé dans le dossier Données.
Comment SimpleQA Verified est-il noté ?
Part de réponses jugées correctes par un modèle correcteur, qui distingue aussi les erreurs et les refus de répondre. Un modèle qui obtient 50 % a un score IA d'environ 87.
Qui est en tête sur SimpleQA Verified ?
GPT-6 Astra (OpenAI) est en tête de SimpleQA Verified avec 75,6 %, dans l'édition du 28 septembre 2026. Suivent Gemini 3.1 Pro (73,5 %) et Claude Opus 5.5 (72,2 %). 73 modèles y sont mesurés.
Quelles sont les limites de SimpleQA Verified ?
Le score global traite un refus prudent comme une erreur, alors que la tendance à s'abstenir varie beaucoup d'un modèle à l'autre. Au 28 septembre 2026, le benchmark est actif.
Combien pèse SimpleQA Verified dans le score IA ?
SimpleQA Verified compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Données est un dossier sans score : ses benchmarks sont suivis pour information.
Qui maintient SimpleQA Verified ?
Google DeepMind pour le jeu de questions ; Epoch AI pour l'évaluation. Sa page de référence : epoch.ai/benchmarks/simpleqa-verified.

Les autres benchmarks du dossier Données

Tous les benchmarks →Comment le score IA est calculé →