À quoi il sert
Sur Quelle IA, EuroEval, Allociné (sentiment) sert à noter la tâche Français : c'est l'un de ses 10 benchmarks.
FrançaisFiche benchmark · EuroEval · euroeval.com
Le modèle dit si une critique de film en français est positive ou négative.
Sur Quelle IA, EuroEval, Allociné (sentiment) sert à noter la tâche Français : c'est l'un de ses 10 benchmarks.
Un score d'accord avec la bonne réponse, de 0 à 100.
Épreuve facile : presque tous les modèles récents dépassent 90.
EuroEval.
euroeval.com/leaderboards/Monolingual/french · tâche Français · 134 modèles mesurés
Description à confirmer : elle n'a pas encore été vérifiée sur la page de la source.
En tête : o3, 98,2 %
Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 94 %. Le meilleur, o3, atteint 98,2 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0,62 %du score général. EuroEval, Allociné (sentiment) porte 6 % de la tâche Français (10 % du score général), que se partagent 10 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.
En couleur, la tâche Français dans le score général. En noir, la part d'EuroEval, Allociné (sentiment).