# LAMBADA

> Fiche du benchmark LAMBADA sur Quelle IA, édition du 28 septembre 2026. Deviner le dernier mot d'un passage de roman, ce qui exige d'avoir suivi tout le paragraphe. En tête au 28 septembre 2026 : Megatron-Turing NLG 530B (87,2 %). Notation, limites et classement des 26 modèles mesurés.

Page : https://quelleia.com/benchmarks/lambada/
Source du benchmark : https://arxiv.org/abs/1606.06031
Mainteneur : Paperno et al. (université de Trente, 2016)
Tâche : Tests historiques
État : archivé

## À quoi il sert

LAMBADA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Part de mots exactement retrouvés.

## Ce qu'il ne dit pas

Test de 2016, pensé pour les modèles d'avant ChatGPT. Les scores viennent d'articles anciens aux réglages variés.

## Qui le tient

Paperno et al. (université de Trente, 2016).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 83 %. Le meilleur, Megatron-Turing NLG 530B, atteint 87,2 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 83 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 86 %
- Score IA 100 (niveau de Claude Opus 5.5) : 88 %

## Son poids dans le score IA

0 % du score général. LAMBADA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (26 modèles mesurés · 53 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Megatron-Turing NLG 530B](https://quelleia.com/modeles/megatron-turing-nlg-530b.md) | Microsoft | non précisée | 87,2 % | 88,3 | https://epoch.ai/benchmarks |
| 2 | [InstructGPT 175B](https://quelleia.com/modeles/instructgpt-175b.md) | OpenAI | non précisée | 86,4 % | 81,5 | https://epoch.ai/benchmarks |
| 3 | [Falcon-180B](https://quelleia.com/modeles/falcon-180b.md) | Technology Innovation Institute | non précisée | 79,8 % | 31,9 | https://epoch.ai/benchmarks |
| 4 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 78,9 % | 26,2 | https://epoch.ai/benchmarks |
| 5 | [Inflection-1](https://quelleia.com/modeles/inflection-1.md) | Inflection AI | non précisée | 78,5 % | 23,7 | https://epoch.ai/benchmarks |
| 6 | [PaLM (540B)](https://quelleia.com/modeles/palm-540b.md) | Google Research | non précisée | 77,9 % | 20,0 | https://epoch.ai/benchmarks |
| 7 | [LLaMA-65B](https://quelleia.com/modeles/llama-65b.md) | Meta AI | non précisée | 77,7 % | 18,8 | https://epoch.ai/benchmarks |
| 8 | [Chinchilla](https://quelleia.com/modeles/chinchilla.md) | DeepMind | non précisée | 77,4 % | 17,0 | https://epoch.ai/benchmarks |
| 9 | [Falcon-40B](https://quelleia.com/modeles/falcon-40b.md) | Technology Innovation Institute | non précisée | 77,3 % | 16,4 | https://epoch.ai/benchmarks |
| 10 | [LLaMA-33B](https://quelleia.com/modeles/llama-33b.md) | Meta AI | non précisée | 77,2 % | 15,8 | https://epoch.ai/benchmarks |
| 11 | [Llama 2-13B](https://quelleia.com/modeles/llama-2-13b.md) | Meta AI | non précisée | 76,5 % | 11,7 | https://epoch.ai/benchmarks |
| 12 | [LLaMA-13B](https://quelleia.com/modeles/llama-13b.md) | Meta AI | non précisée | 75,2 % | 4,3 | https://epoch.ai/benchmarks |
| 13 | [Falcon-7B](https://quelleia.com/modeles/falcon-7b.md) | Technology Innovation Institute | non précisée | 74,9 % | 2,7 | https://epoch.ai/benchmarks |
| 14 | [Gopher (280B)](https://quelleia.com/modeles/gopher-280b.md) | DeepMind | non précisée | 74,5 % | 0,4 | https://epoch.ai/benchmarks |
| 15 | [Baichuan2-13B](https://quelleia.com/modeles/baichuan2-13b.md) | Baichuan | non précisée | 74 % | -2,3 | https://epoch.ai/benchmarks |
| 16 | [Llama 2-7B](https://quelleia.com/modeles/llama-2-7b.md) | Meta AI | non précisée | 73,3 % | -6,0 | https://epoch.ai/benchmarks |
| 16 | [Baichuan 2-7B](https://quelleia.com/modeles/baichuan-2-7b.md) | Baichuan | non précisée | 73,3 % | -6,0 | https://epoch.ai/benchmarks |
| 16 | [LLaMA-7B](https://quelleia.com/modeles/llama-7b.md) | Meta AI | non précisée | 73,3 % | -6,0 | https://epoch.ai/benchmarks |
| 19 | [internlm-20b](https://quelleia.com/modeles/internlm-20b.md) | Shanghai AI Laboratory | non précisée | 71,8 % | -13,9 | https://epoch.ai/benchmarks |
| 20 | [Stable Beluga 2](https://quelleia.com/modeles/stable-beluga-2.md) | Stability AI | non précisée | 71,3 % | -16,5 | https://epoch.ai/benchmarks |
| 21 | [Qwen-14B](https://quelleia.com/modeles/qwen-14b.md) | Alibaba | non précisée | 71,1 % | -17,5 | https://epoch.ai/benchmarks |
| 22 | [MPT-7B](https://quelleia.com/modeles/mpt-7b.md) | MosaicML | non précisée | 70 % | -23,0 | https://epoch.ai/benchmarks |
| 23 | [Qwen-7B](https://quelleia.com/modeles/qwen-7b.md) | Alibaba | non précisée | 67,9 % | -33,2 | https://epoch.ai/benchmarks |
| 24 | [internlm-7b](https://quelleia.com/modeles/internlm-7b.md) | Shanghai AI Laboratory | non précisée | 67 % | -37,5 | https://epoch.ai/benchmarks |
| 25 | [Qwen-1_8B](https://quelleia.com/modeles/qwen-1-8b.md) | Alibaba | non précisée | 58,4 % | -76,0 | https://epoch.ai/benchmarks |
| 26 | [chatglm2-6b](https://quelleia.com/modeles/chatglm2-6b.md) | Z.ai (Zhipu AI) | non précisée | 54,3 % | -93,4 | https://epoch.ai/benchmarks |

## En bref

**Que mesure LAMBADA ?** Deviner le dernier mot d'un passage de roman, ce qui exige d'avoir suivi tout le paragraphe. C'est un test historique, hors des scores d'aujourd'hui.

**Comment LAMBADA est-il noté ?** Part de mots exactement retrouvés. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 83 %.

**Qui est en tête sur LAMBADA ?** Megatron-Turing NLG 530B (Microsoft) est en tête de LAMBADA avec 87,2 %, dans l'édition du 28 septembre 2026. Suivent InstructGPT 175B (86,4 %) et Falcon-180B (79,8 %). 26 modèles y sont mesurés.

**Quelles sont les limites de LAMBADA ?** Test de 2016, pensé pour les modèles d'avant ChatGPT. Les scores viennent d'articles anciens aux réglages variés. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse LAMBADA dans le score IA ?** LAMBADA compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient LAMBADA ?** Paperno et al. (université de Trente, 2016). Sa page de référence : arxiv.org/abs/1606.06031.

## Les autres tests historiques

- [MMLU](https://quelleia.com/benchmarks/mmlu.md) : 127 modèles · hors score, archivé
- [WinoGrande](https://quelleia.com/benchmarks/winogrande.md) : 77 modèles · hors score, archivé
- [ARC (AI2 Reasoning Challenge)](https://quelleia.com/benchmarks/arc_ai2.md) : 76 modèles · hors score, archivé
- [BoolQ](https://quelleia.com/benchmarks/boolq.md) : 76 modèles · hors score, archivé
- [HellaSwag](https://quelleia.com/benchmarks/hellaswag.md) : 75 modèles · hors score, archivé
- [PIQA](https://quelleia.com/benchmarks/piqa.md) : 59 modèles · hors score, archivé
- [LiveBench](https://quelleia.com/benchmarks/livebench.md) : 48 modèles · hors score, archivé
- [BIG-Bench Hard (BBH)](https://quelleia.com/benchmarks/bbh.md) : 45 modèles · hors score, archivé
- [OpenBookQA](https://quelleia.com/benchmarks/openbookqa.md) : 42 modèles · hors score, archivé
- [TriviaQA](https://quelleia.com/benchmarks/triviaqa.md) : 38 modèles · hors score, archivé
- [ScienceQA](https://quelleia.com/benchmarks/scienceqa.md) : 23 modèles · hors score, archivé
- [ANLI (Adversarial NLI)](https://quelleia.com/benchmarks/anli.md) : 11 modèles · hors score, archivé
- [SuperGLUE](https://quelleia.com/benchmarks/superglue.md) : 8 modèles · hors score, archivé
- [CommonsenseQA 2.0](https://quelleia.com/benchmarks/csqa2.md) : 6 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
