Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Facebook AI Research (Nie et al., 2019) · github.com

ANLI (Adversarial NLI)

Dire si une phrase découle d'une autre, la contredit ou ne permet pas de conclure, sur des exemples écrits pour piéger les modèles.

ARCHIVÉ

À quoi il sert

ANLI (Adversarial NLI) est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Part de bonnes réponses parmi trois choix ; le hasard donne 33 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 33 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Test de 2019. Les résultats viennent d'articles aux réglages variés et ne concernent que d'anciens modèles.

Comment lire le score

11 modèles mesurés · 15 mesures

En tête : 2 modèles, 58,1 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 67 % a un score IA d'environ 46. 2 modèles partagent la première place avec 58,1 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
70 %
Score IA 76niveau de Claude Sonnet 4.5
87 %
Score IA 100niveau de Claude Opus 5.5
95 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. ANLI (Adversarial NLI) est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-3.5 Turbo (Nov 2023)OpenAINon précisée58,1 %34,9
1phi-3-small 7.4BMicrosoft · poids ouvertsNon précisée58,1 %34,9
3Llama 3-8BMeta AI · poids ouvertsNon précisée57,3 %33,8
4phi-3-medium 14BMicrosoft · poids ouvertsNon précisée55,8 %31,6
5Mixtral 8x7BMistral AI · poids ouvertsNon précisée55,2 %30,7
6phi-3-mini 3.8BMicrosoft · poids ouvertsNon précisée52,8 %27,0
7Gemma 7BGoogle DeepMind · poids ouvertsNon précisée48,7 %20,1
8Mistral 7B v0.1Mistral AI · poids ouvertsNon précisée47,1 %17,0
9Phi-2Microsoft · poids ouvertsNon précisée42,5 %6,3
10Megatron-Turing NLG 530BMicrosoft · 3 configurationsNon précisée39,7 %-2,7
11 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 11 →Replier le classement ↑
11InstructGPT 175BOpenAI · 3 configurationsNon précisée35,4 %-28,8

En bref

Que mesure ANLI (Adversarial NLI) ?
Dire si une phrase découle d'une autre, la contredit ou ne permet pas de conclure, sur des exemples écrits pour piéger les modèles. C'est un test historique, hors des scores d'aujourd'hui.
Comment ANLI (Adversarial NLI) est-il noté ?
Part de bonnes réponses parmi trois choix ; le hasard donne 33 %. Un modèle qui obtient 67 % a un score IA d'environ 46.
Qui est en tête sur ANLI (Adversarial NLI) ?
GPT-3.5 Turbo (Nov 2023) et phi-3-small 7.4B sont en tête d'ANLI (Adversarial NLI) avec 58,1 %, dans l'édition du 28 septembre 2026. Suivent Llama 3-8B (57,3 %) et phi-3-medium 14B (55,8 %). 11 modèles y sont mesurés.
Quelles sont les limites d'ANLI (Adversarial NLI) ?
Test de 2019. Les résultats viennent d'articles aux réglages variés et ne concernent que d'anciens modèles. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse ANLI (Adversarial NLI) dans le score IA ?
ANLI (Adversarial NLI) compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient ANLI (Adversarial NLI) ?
Facebook AI Research (Nie et al., 2019). Sa page de référence : github.com/facebookresearch/anli.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →