SimpleQA VerifiedACTIF
1 000 questions factuelles courtes et précises (politique, sciences, arts, sport, géographie) pour voir si le modèle sait ou invente.
- Notation
- Part de réponses jugées correctes par un modèle correcteur, qui distingue aussi les erreurs et les refus de répondre.
- Limites
- Le score global traite un refus prudent comme une erreur, alors que la tendance à s'abstenir varie beaucoup d'un modèle à l'autre.
- Tenu par
- Google DeepMind pour le jeu de questions ; Epoch AI pour l'évaluation
- GPT-6 Astra75,6 %
- Gemini 3.1 Pro73,5 %
- Claude Opus 5.572,2 %
73 modèles mesurésLa fiche du benchmark →epoch.ai ↗