À quoi il sert
Sur Quelle IA, EuroEval, FQuAD (compréhension) sert à noter la tâche Français : c'est l'un de ses 10 benchmarks.
FrançaisFiche benchmark · EuroEval · euroeval.com
Le modèle lit un texte en français et répond à une question dont la réponse s'y trouve.
Sur Quelle IA, EuroEval, FQuAD (compréhension) sert à noter la tâche Français : c'est l'un de ses 10 benchmarks.
La part de mots communs entre sa réponse et la réponse attendue.
Une réponse juste mais formulée autrement perd des points.
EuroEval.
euroeval.com/leaderboards/Monolingual/french · tâche Français · 134 modèles mesurés
Description à confirmer : elle n'a pas encore été vérifiée sur la page de la source.
En tête : Llama 3.1-405B, 77,4 %
Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 67 %. Le meilleur, Llama 3.1-405B, atteint 77,4 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0,62 %du score général. EuroEval, FQuAD (compréhension) porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks.
En couleur, la tâche Français dans le score général. En noir, la part d'EuroEval, FQuAD (compréhension).