Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Paperno et al. (université de Trente, 2016) · arxiv.org

LAMBADA

Deviner le dernier mot d'un passage de roman, ce qui exige d'avoir suivi tout le paragraphe.

ARCHIVÉ

À quoi il sert

LAMBADA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Part de mots exactement retrouvés.

Ce qu'il ne dit pas

Test de 2016, pensé pour les modèles d'avant ChatGPT. Les scores viennent d'articles anciens aux réglages variés.

Qui le tient

Paperno et al. (université de Trente, 2016).

arxiv.org/abs/1606.06031 · test historique · 26 modèles mesurés

Comment lire le score

26 modèles mesurés · 53 mesures

En tête : Megatron-Turing NLG 530B, 87,2 %

Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 83 %. Le meilleur, Megatron-Turing NLG 530B, atteint 87,2 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
83 %
Score IA 76niveau de Claude Sonnet 4.5
86 %
Score IA 100niveau de Claude Opus 5.5
88 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. LAMBADA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Megatron-Turing NLG 530BMicrosoft · 4 configurationsNon précisée87,2 %88,3
2InstructGPT 175BOpenAI · 6 configurationsNon précisée86,4 %81,5
3Falcon-180BTechnology Innovation Institute · poids ouvertsNon précisée79,8 %31,9
4Llama 2-70BMeta AI · poids ouverts · 2 configurationsNon précisée78,9 %26,2
5Inflection-1Inflection AINon précisée78,5 %23,7
6PaLM (540B)Google ResearchNon précisée77,9 %20,0
7LLaMA-65BMeta AI · poids ouverts · 2 configurationsNon précisée77,7 %18,8
8ChinchillaDeepMindNon précisée77,4 %17,0
9Falcon-40BTechnology Innovation Institute · poids ouvertsNon précisée77,3 %16,4
10LLaMA-33BMeta AI · poids ouverts · 2 configurationsNon précisée77,2 %15,8
26 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 26 →Replier le classement ↑
11Llama 2-13BMeta AI · poids ouverts · 2 configurationsNon précisée76,5 %11,7
12LLaMA-13BMeta AI · poids ouverts · 2 configurationsNon précisée75,2 %4,3
13Falcon-7BTechnology Innovation Institute · poids ouvertsNon précisée74,9 %2,7
14Gopher (280B)DeepMind · 3 configurationsNon précisée74,5 %0,4
15Baichuan2-13BBaichuan · poids ouverts · 2 configurationsNon précisée74 %-2,3
16Llama 2-7BMeta AI · poids ouverts · 2 configurationsNon précisée73,3 %-6,0
16Baichuan 2-7BBaichuan · poids ouverts · 2 configurationsNon précisée73,3 %-6,0
16LLaMA-7BMeta AI · poids ouverts · 2 configurationsNon précisée73,3 %-6,0
19internlm-20bShanghai AI Laboratory · 2 configurationsNon précisée71,8 %-13,9
20Stable Beluga 2Stability AI · poids ouverts · 2 configurationsNon précisée71,3 %-16,5
21Qwen-14BAlibaba · poids ouverts · 2 configurationsNon précisée71,1 %-17,5
22MPT-7BMosaicML · poids ouverts · 2 configurationsNon précisée70 %-23,0
23Qwen-7BAlibaba · poids ouverts · 2 configurationsNon précisée67,9 %-33,2
24internlm-7bShanghai AI Laboratory · 2 configurationsNon précisée67 %-37,5
25Qwen-1_8BAlibaba · 2 configurationsNon précisée58,4 %-76,0
26chatglm2-6bZ.ai (Zhipu AI) · 2 configurationsNon précisée54,3 %-93,4

En bref

Que mesure LAMBADA ?
Deviner le dernier mot d'un passage de roman, ce qui exige d'avoir suivi tout le paragraphe. C'est un test historique, hors des scores d'aujourd'hui.
Comment LAMBADA est-il noté ?
Part de mots exactement retrouvés. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 83 %.
Qui est en tête sur LAMBADA ?
Megatron-Turing NLG 530B (Microsoft) est en tête de LAMBADA avec 87,2 %, dans l'édition du 28 septembre 2026. Suivent InstructGPT 175B (86,4 %) et Falcon-180B (79,8 %). 26 modèles y sont mesurés.
Quelles sont les limites de LAMBADA ?
Test de 2016, pensé pour les modèles d'avant ChatGPT. Les scores viennent d'articles anciens aux réglages variés. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse LAMBADA dans le score IA ?
LAMBADA compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient LAMBADA ?
Paperno et al. (université de Trente, 2016). Sa page de référence : arxiv.org/abs/1606.06031.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →