À quoi il sert
LAMBADA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Test historiqueFiche benchmark · Paperno et al. (université de Trente, 2016) · arxiv.org
Deviner le dernier mot d'un passage de roman, ce qui exige d'avoir suivi tout le paragraphe.
LAMBADA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.
Part de mots exactement retrouvés.
Test de 2016, pensé pour les modèles d'avant ChatGPT. Les scores viennent d'articles anciens aux réglages variés.
Paperno et al. (université de Trente, 2016).
arxiv.org/abs/1606.06031 · test historique · 26 modèles mesurés
En tête : Megatron-Turing NLG 530B, 87,2 %
Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 83 %. Le meilleur, Megatron-Turing NLG 530B, atteint 87,2 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. LAMBADA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.