À quoi il sert
Sur Quelle IA, EuroEval, HellaSwag (bon sens) sert à noter la tâche Français : c'est l'un de ses 10 benchmarks. Il départage surtout les modèles dont le score IA approche 38.
FrançaisFiche benchmark · EuroEval · euroeval.com
Le modèle choisit la suite la plus plausible d'une situation décrite en français.
Sur Quelle IA, EuroEval, HellaSwag (bon sens) sert à noter la tâche Français : c'est l'un de ses 10 benchmarks. Il départage surtout les modèles dont le score IA approche 38.
La part de bonnes réponses, corrigée du hasard.
Épreuve traduite de l'anglais, proche de la saturation pour les meilleurs modèles.
EuroEval.
euroeval.com/leaderboards/Monolingual/french · tâche Français · 134 modèles mesurés
Description à confirmer : elle n'a pas encore été vérifiée sur la page de la source.
En tête : GPT-6 Astra, 90,7 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 38. Le meilleur, GPT-6 Astra, atteint 90,7 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0,62 %du score général. EuroEval, HellaSwag (bon sens) porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.
En couleur, la tâche Français dans le score général. En noir, la part d'EuroEval, HellaSwag (bon sens).