# ANLI (Adversarial NLI)

> Fiche du benchmark ANLI (Adversarial NLI) sur Quelle IA, édition du 28 septembre 2026. Dire si une phrase découle d'une autre, la contredit ou ne permet pas de conclure, sur des exemples écrits pour piéger les modèles. En tête au 28 septembre 2026 : 2 modèles ex æquo (58,1 %). Notation, limites et classement des 11 modèles mesurés.

Page : https://quelleia.com/benchmarks/anli/
Source du benchmark : https://github.com/facebookresearch/anli
Mainteneur : Facebook AI Research (Nie et al., 2019)
Tâche : Tests historiques
État : archivé

## À quoi il sert

ANLI (Adversarial NLI) est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Part de bonnes réponses parmi trois choix ; le hasard donne 33 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 33 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Test de 2019. Les résultats viennent d'articles aux réglages variés et ne concernent que d'anciens modèles.

## Qui le tient

Facebook AI Research (Nie et al., 2019).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 67 % a un score IA d'environ 46. 2 modèles partagent la première place avec 58,1 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 70 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 87 %
- Score IA 100 (niveau de Claude Opus 5.5) : 95 %

## Son poids dans le score IA

0 % du score général. ANLI (Adversarial NLI) est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (11 modèles mesurés · 15 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-3.5 Turbo (Nov 2023)](https://quelleia.com/modeles/gpt-3-5-turbo-nov-2023.md) | OpenAI | non précisée | 58,1 % | 34,9 | https://epoch.ai/benchmarks |
| 1 | [phi-3-small 7.4B](https://quelleia.com/modeles/phi-3-small-7-4b.md) | Microsoft | non précisée | 58,1 % | 34,9 | https://epoch.ai/benchmarks |
| 3 | [Llama 3-8B](https://quelleia.com/modeles/llama-3-8b.md) | Meta AI | non précisée | 57,3 % | 33,8 | https://epoch.ai/benchmarks |
| 4 | [phi-3-medium 14B](https://quelleia.com/modeles/phi-3-medium-14b.md) | Microsoft | non précisée | 55,8 % | 31,6 | https://epoch.ai/benchmarks |
| 5 | [Mixtral 8x7B](https://quelleia.com/modeles/mixtral-8x7b.md) | Mistral AI | non précisée | 55,2 % | 30,7 | https://epoch.ai/benchmarks |
| 6 | [phi-3-mini 3.8B](https://quelleia.com/modeles/phi-3-mini-3-8b.md) | Microsoft | non précisée | 52,8 % | 27,0 | https://epoch.ai/benchmarks |
| 7 | [Gemma 7B](https://quelleia.com/modeles/gemma-7b.md) | Google DeepMind | non précisée | 48,7 % | 20,1 | https://epoch.ai/benchmarks |
| 8 | [Mistral 7B v0.1](https://quelleia.com/modeles/mistral-7b-v0-1.md) | Mistral AI | non précisée | 47,1 % | 17,0 | https://epoch.ai/benchmarks |
| 9 | [Phi-2](https://quelleia.com/modeles/phi-2.md) | Microsoft | non précisée | 42,5 % | 6,3 | https://epoch.ai/benchmarks |
| 10 | [Megatron-Turing NLG 530B](https://quelleia.com/modeles/megatron-turing-nlg-530b.md) | Microsoft | non précisée | 39,7 % | -2,7 | https://epoch.ai/benchmarks |
| 11 | [InstructGPT 175B](https://quelleia.com/modeles/instructgpt-175b.md) | OpenAI | non précisée | 35,4 % | -28,8 | https://epoch.ai/benchmarks |

## En bref

**Que mesure ANLI (Adversarial NLI) ?** Dire si une phrase découle d'une autre, la contredit ou ne permet pas de conclure, sur des exemples écrits pour piéger les modèles. C'est un test historique, hors des scores d'aujourd'hui.

**Comment ANLI (Adversarial NLI) est-il noté ?** Part de bonnes réponses parmi trois choix ; le hasard donne 33 %. Un modèle qui obtient 67 % a un score IA d'environ 46.

**Qui est en tête sur ANLI (Adversarial NLI) ?** GPT-3.5 Turbo (Nov 2023) et phi-3-small 7.4B sont en tête d'ANLI (Adversarial NLI) avec 58,1 %, dans l'édition du 28 septembre 2026. Suivent Llama 3-8B (57,3 %) et phi-3-medium 14B (55,8 %). 11 modèles y sont mesurés.

**Quelles sont les limites d'ANLI (Adversarial NLI) ?** Test de 2019. Les résultats viennent d'articles aux réglages variés et ne concernent que d'anciens modèles. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse ANLI (Adversarial NLI) dans le score IA ?** ANLI (Adversarial NLI) compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient ANLI (Adversarial NLI) ?** Facebook AI Research (Nie et al., 2019). Sa page de référence : github.com/facebookresearch/anli.

## Les autres tests historiques

- [MMLU](https://quelleia.com/benchmarks/mmlu.md) : 127 modèles · hors score, archivé
- [WinoGrande](https://quelleia.com/benchmarks/winogrande.md) : 77 modèles · hors score, archivé
- [ARC (AI2 Reasoning Challenge)](https://quelleia.com/benchmarks/arc_ai2.md) : 76 modèles · hors score, archivé
- [BoolQ](https://quelleia.com/benchmarks/boolq.md) : 76 modèles · hors score, archivé
- [HellaSwag](https://quelleia.com/benchmarks/hellaswag.md) : 75 modèles · hors score, archivé
- [PIQA](https://quelleia.com/benchmarks/piqa.md) : 59 modèles · hors score, archivé
- [LiveBench](https://quelleia.com/benchmarks/livebench.md) : 48 modèles · hors score, archivé
- [BIG-Bench Hard (BBH)](https://quelleia.com/benchmarks/bbh.md) : 45 modèles · hors score, archivé
- [OpenBookQA](https://quelleia.com/benchmarks/openbookqa.md) : 42 modèles · hors score, archivé
- [TriviaQA](https://quelleia.com/benchmarks/triviaqa.md) : 38 modèles · hors score, archivé
- [LAMBADA](https://quelleia.com/benchmarks/lambada.md) : 26 modèles · hors score, archivé
- [ScienceQA](https://quelleia.com/benchmarks/scienceqa.md) : 23 modèles · hors score, archivé
- [SuperGLUE](https://quelleia.com/benchmarks/superglue.md) : 8 modèles · hors score, archivé
- [CommonsenseQA 2.0](https://quelleia.com/benchmarks/csqa2.md) : 6 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
