{
 "dossier": "Modèles de décision",
 "url": "https://quelleia.com/modeles-de-decision/",
 "verifie_le": "2026-09-30",
 "avertissement": "Dossier sans score : Quelle IA ne classe pas les modèles de décision. Chaque chiffre porte sa provenance (declare : déclaré par l'éditeur du modèle ; tiers : mesuré par un tiers) et l'adresse de sa source. Seul le tableau de Jevals (CC BY 4.0) est reproduit ; les chiffres de JevBench et du Jev Decision Index sont cités un par un, avec attribution.",
 "groupes": [
  {
   "id": "decision_ferme",
   "titre": "Les modèles de décision fermés",
   "intro": "Le même contrat que Jev : un texte, des questions fermées, des probabilités en retour. Leurs poids ne sont pas publiés, on y accède par une API. Jev, présenté plus haut, appartient à ce groupe."
  },
  {
   "id": "decision_ouvert",
   "titre": "Les reproductions ouvertes",
   "intro": "En quinze jours, des dizaines de reproductions de Jev sont apparues : JevBench recense 112 systèmes, le Jev Decision Index 70 reproductions. La plupart partent d'un petit modèle ouvert (Qwen3.5 de 2 à 9 milliards de paramètres, Gemma 4) dont on lit les probabilités sur les options, avec ou sans adaptateur LoRA."
  },
  {
   "id": "encodeur",
   "titre": "Les encodeurs et extracteurs à schéma",
   "intro": "Pour la plupart antérieurs à Jev, ces modèles reçoivent les étiquettes ou le schéma au moment de l'appel. Aucun banc commun ne les compare entre eux, et leurs chiffres viennent presque tous de leurs éditeurs."
  },
  {
   "id": "garde",
   "titre": "Les modèles de garde et de modération",
   "intro": "Un groupe à part. Ces modèles décident eux aussi, mais d'une seule chose : un contenu est-il acceptable ? Aucun test ne les relie à Jev, et il n'existe pas de classement indépendant à jour de la modération. La seule comparaison récente entre éditeurs est le tableau que Mistral publie sur la fiche de Shieldstral."
  }
 ],
 "modeles": [
  {
   "id": "jev",
   "nom": "Jev 1.13.0",
   "groupe": "decision_ferme",
   "editeur": "TypeSafe AI",
   "pays": "États-Unis",
   "date_sortie": "2026-09-15",
   "poids_ouverts": false,
   "licence": "Poids non publiés, accès par API. SDK Python et JavaScript sous licence MIT.",
   "prix": "0,042 $ par million de jetons d'entrée, soit 42 $ le milliard. La sortie est gratuite.",
   "entrees": "Texte seul. Une chaîne, un objet JSON ou une liste de textes, sans image, audio ni vidéo.",
   "contexte": "64 000 jetons par requête, dont 32 000 pour le texte à juger et la question la plus longue",
   "langues": "L'anglais d'abord. L'éditeur écrit que les autres langues sont « handled but not equally well » et ne cite pas le français.",
   "francais_cite": false,
   "source": "https://docs.typesafe.ai/models.md",
   "acces": [
    {
     "type": "essayer",
     "nom": "Console TypeSafe",
     "url": "https://console.typesafe.ai",
     "note": "accès anticipé, sur liste d'attente"
    },
    {
     "type": "api",
     "nom": "Documentation de l'API",
     "url": "https://docs.typesafe.ai"
    },
    {
     "type": "code",
     "nom": "SDK Python et JavaScript",
     "url": "https://github.com/typesafe-ai"
    }
   ],
   "en_une_phrase": "Jev reçoit un texte et une liste de questions fermées, et rend pour chacune un choix, une note ou un oui/non avec sa probabilité. Il ne rédige aucun texte.",
   "a_savoir": [
    "Trois formes de question : « Choice » (une option parmi une liste, jusqu'à 255), « Score » (une note sur une grille ordonnée) et « Noul » (oui ou non).",
    "Taille non publiée : l'éditeur écrit seulement que Jev « is neither small nor an LLM ».",
    "Les mêmes poids servent tous les comptes, sans ajustement possible par le client.",
    "Limites reconnues par l'éditeur : lecture littérale, comptage et calcul, comparaison de dates, raisonnement indirect, texte long et bruité, contenu adverse, consignes contradictoires."
   ],
   "limites_source": "https://docs.typesafe.ai/model-jaggedness/jev-1.13.md",
   "dires": [
    {
     "theme": "exactitude",
     "texte": "Jev atteint « similar levels of intelligence on System One tasks compared to existing LLMs », écrit le billet de lancement. TypeSafe refuse les bancs publics : « Put no weight on public benchmarks ».",
     "source": "https://typesafe.ai/blog/introducing-system-one-models-and-jev"
    },
    {
     "theme": "langues",
     "texte": "L'anglais est la langue principale d'entraînement, « where accuracy is currently best ». Les autres langues sont « handled but not equally well ». Le français n'est pas cité.",
     "source": "https://docs.typesafe.ai/models.md"
    }
   ],
   "slogan": {
    "accueil": "https://typesafe.ai",
    "banc": "https://evals.typesafe.ai",
    "billet": "https://typesafe.ai/blog/introducing-system-one-models-and-jev",
    "date": "2026-09-30",
    "vitesse": 193.6,
    "prix": 444.6,
    "chaines": [
     {
      "nom": "facturation",
      "cas": 150
     },
     {
      "nom": "service client",
      "cas": 204
     },
     {
      "nom": "observabilité d'agents",
      "cas": 111
     },
     {
      "nom": "incidents de sécurité",
      "cas": 240
     }
    ],
    "reference": "la moyenne des réponses de GPT-6 Astra et de Claude Fable 5.1, tous deux en réflexion élevée",
    "aveux": [
     "Les chaînes ont été écrites par l'équipe de TypeSafe : « some bias could exist ».",
     "Les modèles de langage passent par un adaptateur de TypeSafe qui, selon l'éditeur, « tends to be slower and more expensive ».",
     "Les temps sont mesurés « from our laptops on the West Coast », là où le service est hébergé.",
     "L'éditeur écrit lui-même que ces multiplicateurs sont « on the higher end of real world gains »."
    ],
    "jev": {
     "accord": 67.8,
     "cout": 0.0004,
     "temps": 0.4
    },
    "comparaisons": [
     {
      "cle": "slogan_vitesse",
      "modele": "sonnet 5",
      "accord": 67.8,
      "cout_fois": 294,
      "temps_fois": 195
     },
     {
      "cle": "slogan_prix",
      "modele": "opus 5",
      "accord": 73.1,
      "cout_fois": 440,
      "temps_fois": 94
     },
     {
      "cle": "meilleur",
      "modele": "sol",
      "editeur": "OpenAI",
      "accord": 74.1,
      "cout_fois": 209,
      "temps_fois": 58
     },
     {
      "cle": "comparable",
      "modele": "luna",
      "editeur": "OpenAI",
      "accord": 66.8,
      "cout_fois": 8,
      "temps_fois": 32
     }
    ]
   },
   "chiffres": [
    {
     "theme": "vitesse",
     "valeur": "193,6 fois",
     "libelle": "plus rapide qu'un modèle de langage, dit le slogan de la page d'accueil, « based on workflows for System One tasks ». Le modèle comparé n'est pas nommé.",
     "provenance": "declare",
     "par": "TypeSafe AI",
     "source": "https://typesafe.ai",
     "date": "2026-09-30"
    },
    {
     "theme": "vitesse",
     "valeur": "40 à 200 fois",
     "libelle": "plus rapide « for the same levels of frontier intelligence », selon le billet de lancement.",
     "provenance": "declare",
     "par": "TypeSafe AI",
     "source": "https://typesafe.ai/blog/introducing-system-one-models-and-jev",
     "date": "2026-09-15"
    },
    {
     "cle": "latence",
     "theme": "vitesse",
     "valeur": "70 à 500 ms",
     "libelle": "de temps de réponse, de bout en bout.",
     "provenance": "declare",
     "par": "TypeSafe AI",
     "source": "https://typesafe.ai/blog/introducing-system-one-models-and-jev",
     "date": "2026-09-15"
    },
    {
     "theme": "prix",
     "valeur": "444,6 fois",
     "libelle": "moins cher qu'un modèle de langage, dit le même slogan. Le modèle comparé n'est pas nommé.",
     "provenance": "declare",
     "par": "TypeSafe AI",
     "source": "https://typesafe.ai",
     "date": "2026-09-30"
    },
    {
     "theme": "prix",
     "valeur": "238 fois",
     "libelle": "moins cher à l'entrée que Claude Fable 5.1, selon la page d'accueil.",
     "provenance": "declare",
     "par": "TypeSafe AI",
     "source": "https://typesafe.ai",
     "date": "2026-09-30"
    },
    {
     "cle": "prix",
     "theme": "prix",
     "valeur": "0,042 $",
     "libelle": "par million de jetons d'entrée. La sortie est gratuite.",
     "provenance": "declare",
     "par": "TypeSafe AI",
     "source": "https://docs.typesafe.ai/models.md",
     "date": "2026-09-30"
    },
    {
     "cle": "accord",
     "theme": "exactitude",
     "valeur": "67,8 %",
     "libelle": "d'accord avec la référence sur le banc maison de l'éditeur, moyenne de ses quatre chaînes. La référence est faite des réponses de deux modèles de langage : aucune étiquette humaine.",
     "provenance": "declare",
     "par": "TypeSafe AI, Workflow evals",
     "source": "https://evals.typesafe.ai",
     "date": "2026-09-30",
     "calcul": true
    },
    {
     "theme": "fiabilite",
     "valeur": "Zéro",
     "libelle": "hallucination, affiche la page d'accueil. Le billet précise : « Our number is not empirical ». La garantie porte sur la forme de la réponse, toujours conforme au schéma demandé. Elle ne dit rien de son exactitude.",
     "provenance": "declare",
     "par": "TypeSafe AI",
     "source": "https://typesafe.ai/blog/introducing-system-one-models-and-jev",
     "date": "2026-09-15"
    },
    {
     "theme": "vitesse",
     "ms": 430,
     "valeur": "0,43 s",
     "libelle": "de latence médiane sur 200 décisions.",
     "provenance": "tiers",
     "par": "jev-frontier-bench (M. Janardhan)",
     "source": "https://github.com/manjunathshiva/jev-frontier-bench",
     "date": "2026-09-30"
    },
    {
     "theme": "vitesse",
     "ms": 524,
     "valeur": "524 ms",
     "libelle": "de latence médiane.",
     "provenance": "tiers",
     "par": "Jev Decision Index 0.2.1",
     "source": "https://huggingface.co/spaces/multimodalart/jev-decision-index",
     "date": "2026-09-28"
    },
    {
     "theme": "vitesse",
     "ms": 620,
     "valeur": "0,62 s",
     "libelle": "de latence médiane, réseau compris.",
     "provenance": "tiers",
     "par": "JevBench v1.5.4",
     "source": "https://benchmarkheaven.com/jev-models",
     "date": "2026-09-30"
    },
    {
     "theme": "vitesse",
     "ms": 710,
     "valeur": "710 ms",
     "libelle": "de latence médiane sur 2 000 décisions.",
     "provenance": "tiers",
     "par": "typed-decisions (LocalLLaMA)",
     "source": "https://huggingface.co/datasets/LocalLLaMA/typed-decisions",
     "date": "2026-09-30"
    },
    {
     "theme": "prix",
     "valeur": "0,029 $",
     "libelle": "les 1 000 décisions oui/non sur PubMedQA, contre 0,80 $ pour Gemini 3.8 Flash, le modèle de langage le mieux noté de l'épreuve.",
     "provenance": "tiers",
     "par": "Jevals",
     "source": "https://jevals.com",
     "date": "2026-09-18"
    },
    {
     "cle": "intelligence",
     "theme": "exactitude",
     "valeur": "72,0",
     "libelle": "sur l'axe d'exactitude (« Intelligence ») de JevBench. Les modèles de langage de référence y montent jusqu'à 96,2, pour GPT-6 Luna.",
     "provenance": "tiers",
     "par": "JevBench v1.5.4",
     "source": "https://benchmarkheaven.com/jev-models",
     "date": "2026-09-30"
    },
    {
     "cle": "composite",
     "theme": "exactitude",
     "valeur": "72,1",
     "libelle": "de score composite (exactitude, calibration, vitesse, coût), intervalle de 71,0 à 72,6 : troisième sur 106 systèmes, derrière deux reproductions ouvertes.",
     "provenance": "tiers",
     "par": "JevBench v1.5.4",
     "source": "https://benchmarkheaven.com/jev-models",
     "date": "2026-09-30"
    },
    {
     "cle": "index",
     "theme": "exactitude",
     "valeur": "57,91",
     "libelle": "d'indice corrigé du hasard sur 38 bancs publics adaptés : premier sur 71 systèmes. Les reproductions n'y répondent qu'à 76 % des requêtes, ce qui avantage Jev.",
     "provenance": "tiers",
     "par": "Jev Decision Index 0.2.1",
     "source": "https://huggingface.co/spaces/multimodalart/jev-decision-index",
     "date": "2026-09-28"
    },
    {
     "cle": "frontier",
     "theme": "exactitude",
     "valeur": "72,5 %",
     "libelle": "d'exactitude sur 200 décisions (intervalle de 66,0 à 78,5), contre 84,0 % pour Claude Fable 5.1 et 79,0 % pour GPT-6 Astra.",
     "provenance": "tiers",
     "par": "jev-frontier-bench (M. Janardhan)",
     "source": "https://github.com/manjunathshiva/jev-frontier-bench",
     "date": "2026-09-30"
    },
    {
     "theme": "exactitude",
     "valeur": "76,0 %",
     "libelle": "d'exactitude moyenne sur 13 jeux à étiquettes humaines (3 880 cas), contre 74,8 % pour Nimble-9B. La mesure vient de Bespoke Labs, qui édite Nimble.",
     "provenance": "tiers",
     "par": "Bespoke Labs",
     "source": "https://github.com/bespokelabsai/nimble/blob/main/docs/PUBLIC_BENCHMARKS.md",
     "date": "2026-09-30"
    },
    {
     "theme": "exactitude",
     "valeur": "69,0",
     "libelle": "de « Decision Score » sur PubMedQA (oui ou non), contre 73,0 pour Gemini 3.8 Flash. Le tableau complet est plus bas.",
     "provenance": "tiers",
     "par": "Jevals",
     "source": "https://jevals.com",
     "date": "2026-09-18"
    },
    {
     "theme": "exactitude",
     "valeur": "14 sur 15",
     "libelle": "tâches de sciences sociales où le modèle de décision est derrière le meilleur modèle de langage, avec un écart médian de 11,6 points de macro-F1 (7 977 items, 19 modèles de langage).",
     "provenance": "tiers",
     "par": "Ibrahim et Zaki, arXiv 2609.24574",
     "source": "https://arxiv.org/abs/2609.24574",
     "date": "2026-09"
    },
    {
     "theme": "exactitude",
     "valeur": "0,908",
     "libelle": "de F1 sur des récits d'accidents (2 416 jugements humains). Un modèle de langage de pointe fait 0,059 de mieux.",
     "provenance": "tiers",
     "par": "Rafe et Das, arXiv 2609.24052",
     "source": "https://arxiv.org/abs/2609.24052",
     "date": "2026-09"
    },
    {
     "theme": "fiabilite",
     "valeur": "70,4 sur 100",
     "libelle": "réponses changent quand on renomme les options 0/1 en no/yes, sur 1 200 décisions. L'aire sous la courbe tombe de 0,94 à 0,23.",
     "provenance": "tiers",
     "par": "Sun et al., arXiv 2609.26758",
     "source": "https://arxiv.org/abs/2609.26758",
     "date": "2026-09"
    },
    {
     "theme": "fiabilite",
     "valeur": "88,0",
     "libelle": "sur l'axe de calibration de JevBench, qui vérifie que les probabilités annoncées correspondent aux taux de réussite.",
     "provenance": "tiers",
     "par": "JevBench v1.5.4",
     "source": "https://benchmarkheaven.com/jev-models",
     "date": "2026-09-30"
    },
    {
     "theme": "fiabilite",
     "valeur": "0,074",
     "libelle": "d'erreur de calibration (ECE) : plus le chiffre est bas, plus les probabilités sont fiables.",
     "provenance": "tiers",
     "par": "Jev Decision Index 0.2.1",
     "source": "https://huggingface.co/spaces/multimodalart/jev-decision-index",
     "date": "2026-09-28"
    },
    {
     "cle": "massive",
     "theme": "langues",
     "valeur": "86,9 %",
     "libelle": "en allemand, contre 87,4 % en anglais, sur les mêmes 350 requêtes du jeu MASSIVE. C'est la seule mesure hors de l'anglais trouvée. Aucune mesure en français n'existe.",
     "provenance": "tiers",
     "par": "Bespoke Labs",
     "source": "https://github.com/bespokelabsai/nimble/blob/main/docs/PUBLIC_BENCHMARKS.md",
     "date": "2026-09-30"
    }
   ],
   "url": "https://quelleia.com/modeles-de-decision/#jev"
  },
  {
   "id": "liquid-d1",
   "nom": "d1",
   "groupe": "decision_ferme",
   "editeur": "Liquid AI",
   "pays": "États-Unis",
   "poids_ouverts": false,
   "source": "https://docs.liquid.ai/lfm/models/decision-models",
   "acces": [
    {
     "type": "api",
     "nom": "Documentation Liquid AI",
     "url": "https://docs.liquid.ai/lfm/models/decision-models",
     "note": "identifiant « d1:free »"
    }
   ],
   "en_une_phrase": "Le modèle de la gamme « Decision Models » de Liquid AI reprend les trois mêmes formes de question que Jev : choix, note, oui ou non.",
   "a_savoir": [
    "La page de l'éditeur ne donne ni prix ni résultat de banc, et sa date de sortie n'a pas été vérifiée."
   ],
   "chiffres": [
    {
     "valeur": "0,742",
     "libelle": "d'exactitude sur 2 000 décisions, contre 0,727 pour Jev. La référence de ce banc est synthétique : elle vient d'un modèle d'environ 4 milliards de paramètres.",
     "provenance": "tiers",
     "par": "typed-decisions (LocalLLaMA)",
     "source": "https://huggingface.co/datasets/LocalLLaMA/typed-decisions",
     "date": "2026-09-30"
    }
   ],
   "url": "https://quelleia.com/modeles-de-decision/#liquid-d1"
  },
  {
   "id": "decider-1",
   "nom": "Decider 1 (sd-1)",
   "groupe": "decision_ferme",
   "editeur": "meraGPT",
   "poids_ouverts": false,
   "source": "https://huggingface.co/datasets/LocalLLaMA/typed-decisions",
   "en_une_phrase": "Un modèle de décision accessible par API, vu seulement dans le tableau du banc communautaire typed-decisions.",
   "a_savoir": [
    "Sa ligne, en tête de ce tableau, porte un lien de campagne publicitaire : son chiffre n'est pas repris ici. La page de l'éditeur n'a pas été consultée."
   ],
   "url": "https://quelleia.com/modeles-de-decision/#decider-1"
  },
  {
   "id": "decision-machine-1",
   "nom": "decision-machine-1",
   "groupe": "decision_ferme",
   "editeur": "milliseconds.ai",
   "poids_ouverts": false,
   "source": "https://benchmarkheaven.com/jev-models",
   "en_une_phrase": "Un modèle de décision fermé, servi par une API au format de celle de TypeSafe.",
   "chiffres": [
    {
     "valeur": "3,2",
     "libelle": "de score composite : 71e sur 106 systèmes.",
     "provenance": "tiers",
     "par": "JevBench v1.5.4",
     "source": "https://benchmarkheaven.com/jev-models",
     "date": "2026-09-30"
    }
   ],
   "url": "https://quelleia.com/modeles-de-decision/#decision-machine-1"
  },
  {
   "id": "instinct-dual-4b",
   "nom": "Instinct Dual 4B",
   "groupe": "decision_ferme",
   "editeur": "ZooWork",
   "poids_ouverts": false,
   "source": "https://benchmarkheaven.com/jev-models",
   "en_une_phrase": "Un modèle de décision fermé, connu par sa seule ligne dans JevBench.",
   "chiffres": [
    {
     "valeur": "47,0",
     "libelle": "de score composite : 27e sur 106 systèmes.",
     "provenance": "tiers",
     "par": "JevBench v1.5.4",
     "source": "https://benchmarkheaven.com/jev-models",
     "date": "2026-09-30"
    }
   ],
   "url": "https://quelleia.com/modeles-de-decision/#instinct-dual-4b"
  },
  {
   "id": "cygnet",
   "nom": "Cygnet",
   "groupe": "decision_ouvert",
   "editeur": "blockbrain",
   "poids_ouverts": true,
   "licence": "MIT pour le code ; Apache-2.0 et politique d'usage de Gemma pour les poids",
   "base": "Gemma-4-12B-it, sans entraînement",
   "source": "https://github.com/blockbrain-ai/cygnet-recipe",
   "acces": [
    {
     "type": "code",
     "nom": "GitHub",
     "url": "https://github.com/blockbrain-ai/cygnet-recipe"
    }
   ],
   "en_une_phrase": "Cygnet est une recette : elle lit, dans un Gemma 4 laissé tel quel, la probabilité du jeton de chaque option.",
   "chiffres": [
    {
     "cle": "composite",
     "valeur": "73,7",
     "libelle": "de score composite (intervalle de 72,4 à 74,5) : premier sur 106 systèmes, devant Jev. Les intervalles des dix premiers se recouvrent presque tous.",
     "provenance": "tiers",
     "par": "JevBench v1.5.4",
     "source": "https://benchmarkheaven.com/jev-models",
     "date": "2026-09-30"
    }
   ],
   "url": "https://quelleia.com/modeles-de-decision/#cygnet"
  },
  {
   "id": "winnow-12b",
   "nom": "Winnow-12B",
   "groupe": "decision_ouvert",
   "editeur": "EldanRing",
   "date_sortie": "2026-09-20",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "base": "google/gemma-4-12B-it",
   "source": "https://huggingface.co/EldanRing/Winnow-12B",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/EldanRing/Winnow-12B"
    }
   ],
   "en_une_phrase": "Une reproduction ouverte de Jev bâtie sur Gemma 4, présente dans les deux bancs tiers.",
   "chiffres": [
    {
     "valeur": "73,2",
     "libelle": "de score composite (intervalle de 72,0 à 74,0) : deuxième sur 106 systèmes, dans sa version Q8.",
     "provenance": "tiers",
     "par": "JevBench v1.5.4",
     "source": "https://benchmarkheaven.com/jev-models",
     "date": "2026-09-30"
    },
    {
     "valeur": "50,02",
     "libelle": "d'indice : dixième sur 71 systèmes. Deuxième d'un banc, dixième de l'autre.",
     "provenance": "tiers",
     "par": "Jev Decision Index 0.2.1",
     "source": "https://huggingface.co/spaces/multimodalart/jev-decision-index",
     "date": "2026-09-28"
    }
   ],
   "url": "https://quelleia.com/modeles-de-decision/#winnow-12b"
  },
  {
   "id": "jevk5",
   "nom": "JevK5",
   "groupe": "decision_ouvert",
   "editeur": "alibiserikbay",
   "date_sortie": "2026-09-22",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "base": "Qwen/Qwen3.5-4B",
   "source": "https://huggingface.co/alibiserikbay/JevK5",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/alibiserikbay/JevK5"
    }
   ],
   "en_une_phrase": "Une famille de reproductions ouvertes sur Qwen3.5 : 4B d'abord, puis des variantes v0.3, 2B, 9B et Lite.",
   "url": "https://quelleia.com/modeles-de-decision/#jevk5"
  },
  {
   "id": "decider",
   "nom": "decider-2b, decider-4b",
   "groupe": "decision_ouvert",
   "editeur": "Mapika",
   "date_sortie": "2026-09-16",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "base": "Qwen3.5-2B-Base et Qwen3.5-4B-Base",
   "source": "https://huggingface.co/Mapika/decider-2b",
   "acces": [
    {
     "type": "telechargement",
     "nom": "decider-2b",
     "url": "https://huggingface.co/Mapika/decider-2b"
    },
    {
     "type": "telechargement",
     "nom": "decider-4b",
     "url": "https://huggingface.co/Mapika/decider-4b"
    }
   ],
   "en_une_phrase": "Deux reproductions ouvertes sur Qwen3.5 : decider-2b est sorti le 16 septembre 2026, au lendemain de Jev, et decider-4b a suivi le 22 septembre. Une variante decider-35b-a3b existe aussi.",
   "url": "https://quelleia.com/modeles-de-decision/#decider"
  },
  {
   "id": "bespoke-nimble-9b",
   "nom": "Bespoke-Nimble-9B",
   "groupe": "decision_ouvert",
   "editeur": "Bespoke Labs",
   "date_sortie": "2026-09-18",
   "poids_ouverts": true,
   "licence": "Apache-2.0 pour le modèle ; le dépôt GitHub ne déclare pas de licence",
   "base": "Qwen/Qwen3.5-9B avec un adaptateur LoRA",
   "langues": "Anglais, d'après les métadonnées de la fiche Hugging Face.",
   "francais_cite": false,
   "source": "https://github.com/bespokelabsai/nimble",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/bespokelabs/Bespoke-Nimble-9B"
    },
    {
     "type": "code",
     "nom": "GitHub",
     "url": "https://github.com/bespokelabsai/nimble"
    }
   ],
   "en_une_phrase": "Une reproduction ouverte sur Qwen3.5, dont l'éditeur publie aussi une suite de tests à étiquettes humaines qui compare son modèle à Jev.",
   "chiffres": [
    {
     "valeur": "90,1 %",
     "libelle": "d'accord sur 324 exemples tenus à l'écart, contre 93,2 % pour Jev 1.13.0.",
     "provenance": "declare",
     "par": "Bespoke Labs",
     "source": "https://github.com/bespokelabsai/nimble",
     "date": "2026-09-30"
    },
    {
     "valeur": "74,8 %",
     "libelle": "d'exactitude moyenne sur 13 jeux à étiquettes humaines (3 880 cas), contre 76,0 % pour Jev.",
     "provenance": "declare",
     "par": "Bespoke Labs",
     "source": "https://github.com/bespokelabsai/nimble/blob/main/docs/PUBLIC_BENCHMARKS.md",
     "date": "2026-09-30"
    }
   ],
   "url": "https://quelleia.com/modeles-de-decision/#bespoke-nimble-9b"
  },
  {
   "id": "laya",
   "nom": "Laya",
   "groupe": "decision_ouvert",
   "editeur": "Convai Innovations",
   "date_sortie": "2026-09-18",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "taille": "421 millions de paramètres (anglais, sur ModernBERT-large) ; 322 millions (multilingue, sur mmBERT-base)",
   "langues": "L'éditeur annonce « 100+ languages » pour la variante multilingue.",
   "source": "https://huggingface.co/convaiinnovations/laya",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/convaiinnovations/laya"
    }
   ],
   "en_une_phrase": "Un petit encodeur (ModernBERT ou mmBERT) ajusté pour rendre des décisions typées, en version anglaise ou multilingue.",
   "chiffres": [
    {
     "valeur": "33 ms",
     "libelle": "environ, de temps de réponse.",
     "provenance": "declare",
     "par": "Convai Innovations",
     "source": "https://huggingface.co/convaiinnovations/laya",
     "date": "2026-09-30"
    },
    {
     "valeur": "0,766",
     "libelle": "d'exactitude pour la variante affinée sur typed-decisions, contre 0,362 pour le modèle de base.",
     "provenance": "declare",
     "par": "Convai Innovations",
     "source": "https://huggingface.co/convaiinnovations/laya",
     "date": "2026-09-30"
    },
    {
     "valeur": "0,0",
     "libelle": "sur l'axe d'exactitude de JevBench : 93e sur 106 systèmes.",
     "provenance": "tiers",
     "par": "JevBench v1.5.4",
     "source": "https://benchmarkheaven.com/jev-models",
     "date": "2026-09-30"
    }
   ],
   "url": "https://quelleia.com/modeles-de-decision/#laya"
  },
  {
   "id": "tev1",
   "nom": "Tev1-4B-experimental",
   "groupe": "decision_ouvert",
   "editeur": "Together AI",
   "date_sortie": "2026-09-23",
   "poids_ouverts": true,
   "licence": "Aucune licence déclarée",
   "base": "Qwen/Qwen3.5-4B",
   "source": "https://huggingface.co/togethercomputer/Tev1-4B-experimental",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/togethercomputer/Tev1-4B-experimental"
    }
   ],
   "en_une_phrase": "La reproduction expérimentale de Together AI, déclinée aussi en 0,8B. Les poids sont publiés sans licence : leur réutilisation n'est pas encadrée.",
   "url": "https://quelleia.com/modeles-de-decision/#tev1"
  },
  {
   "id": "intern-decision",
   "nom": "Intern-Decision",
   "groupe": "decision_ouvert",
   "editeur": "InternLM",
   "date_sortie": "2026-09-26",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "base": "Qwen/Qwen3.5-4B",
   "source": "https://huggingface.co/internlm/Intern-Decision-4B",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/internlm/Intern-Decision-4B"
    }
   ],
   "en_une_phrase": "Trois modèles de décision ouverts (0,8B, 2B et 4B) publiés par l'équipe InternLM.",
   "url": "https://quelleia.com/modeles-de-decision/#intern-decision"
  },
  {
   "id": "decision-1-0",
   "nom": "Decision-1.0",
   "groupe": "decision_ouvert",
   "editeur": "llm-semantic-router",
   "date_sortie": "2026-09-22",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "source": "https://huggingface.co/llm-semantic-router/Decision-1.0-Lux-9B",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/llm-semantic-router/Decision-1.0-Lux-9B"
    }
   ],
   "en_une_phrase": "Une gamme de six modèles de décision (Eos, Kai, Lex, Sol, Nox, Lux), publiée par l'organisation llm-semantic-router.",
   "url": "https://quelleia.com/modeles-de-decision/#decision-1-0"
  },
  {
   "id": "semif",
   "nom": "SemIf (ex-OpenJev)",
   "groupe": "decision_ouvert",
   "editeur": "Theodore Lee",
   "poids_ouverts": true,
   "licence": "MIT",
   "source": "https://github.com/TheoLeeCJ/SemIf-OpenJev",
   "acces": [
    {
     "type": "code",
     "nom": "GitHub",
     "url": "https://github.com/TheoLeeCJ/SemIf-OpenJev"
    }
   ],
   "en_une_phrase": "Un outil sans entraînement, qui lit les probabilités d'un modèle ouvert existant pour en tirer une décision typée.",
   "url": "https://quelleia.com/modeles-de-decision/#semif"
  },
  {
   "id": "simplejev",
   "nom": "SimpleJev",
   "groupe": "decision_ouvert",
   "editeur": "Featherless AI",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "source": "https://github.com/featherless-ai/simple-jev",
   "acces": [
    {
     "type": "code",
     "nom": "GitHub",
     "url": "https://github.com/featherless-ai/simple-jev"
    }
   ],
   "en_une_phrase": "La reproduction ouverte publiée par Featherless AI.",
   "chiffres": [
    {
     "valeur": "0,716",
     "libelle": "d'exactitude sur 2 000 décisions, contre 0,727 pour Jev. La référence de ce banc est synthétique.",
     "provenance": "tiers",
     "par": "typed-decisions (LocalLLaMA)",
     "source": "https://huggingface.co/datasets/LocalLLaMA/typed-decisions",
     "date": "2026-09-30"
    }
   ],
   "url": "https://quelleia.com/modeles-de-decision/#simplejev"
  },
  {
   "id": "djev",
   "nom": "djev",
   "groupe": "decision_ouvert",
   "editeur": "Maisa",
   "base": "DiffusionGemma",
   "source": "https://benchmarkheaven.com/jev-models",
   "en_une_phrase": "Une reproduction bâtie sur DiffusionGemma, proposée par une API hébergée en aperçu gratuit. La publication de ses poids n'a pas été vérifiée.",
   "url": "https://quelleia.com/modeles-de-decision/#djev"
  },
  {
   "id": "open-jev-deberta",
   "nom": "open-jev-deberta-v3-large",
   "groupe": "decision_ouvert",
   "editeur": "Kotoba Labs",
   "date_sortie": "2026-09-18",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "taille": "434 millions de paramètres",
   "source": "https://huggingface.co/com-kotobalabs/open-jev-deberta-v3-large",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/com-kotobalabs/open-jev-deberta-v3-large"
    }
   ],
   "en_une_phrase": "Une reproduction ouverte sur un encodeur DeBERTa, bien plus petite que les reproductions bâties sur un modèle de langage.",
   "url": "https://quelleia.com/modeles-de-decision/#open-jev-deberta"
  },
  {
   "id": "openthai-systemone",
   "nom": "OpenThai-SystemOne",
   "groupe": "decision_ouvert",
   "editeur": "iApp",
   "date_sortie": "2026-09-20",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "langues": "Thaï et anglais.",
   "francais_cite": false,
   "source": "https://huggingface.co/iapp/OpenThai-SystemOne",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/iapp/OpenThai-SystemOne"
    }
   ],
   "en_une_phrase": "Un modèle de décision ouvert pour le thaï et l'anglais.",
   "url": "https://quelleia.com/modeles-de-decision/#openthai-systemone"
  },
  {
   "id": "gliner2-5-decide",
   "nom": "GLiNER2.5-Decide",
   "groupe": "encodeur",
   "editeur": "Fastino",
   "date_sortie": "2026-09-23",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "taille": "340 millions selon la fiche, 486 millions de paramètres selon l'API Hugging Face",
   "langues": "Anglais pour la variante principale ; une variante « multi-Decide » est multilingue, sans liste de langues relevée.",
   "source": "https://huggingface.co/fastino/GLiNER2.5-Decide",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/fastino/GLiNER2.5-Decide"
    }
   ],
   "en_une_phrase": "Un encodeur de la lignée GLiNER publié fin septembre 2026 pour les tâches de décision, avec une variante multilingue (287 millions de paramètres) et une variante 1B.",
   "chiffres": [
    {
     "valeur": "60,2 %",
     "libelle": "d'exactitude sur fast-decisions, le banc de l'éditeur (17 domaines, 300 exemples chacun, en anglais), devant JevK5 à 57,6 %. Jev lui-même n'est pas dans ce tableau.",
     "provenance": "declare",
     "par": "Fastino",
     "source": "https://huggingface.co/datasets/fastino/fast-decisions",
     "date": "2026-09-30"
    },
    {
     "valeur": "11,21",
     "libelle": "d'indice : 54e sur 71 systèmes.",
     "provenance": "tiers",
     "par": "Jev Decision Index 0.2.1",
     "source": "https://huggingface.co/spaces/multimodalart/jev-decision-index",
     "date": "2026-09-28"
    }
   ],
   "url": "https://quelleia.com/modeles-de-decision/#gliner2-5-decide"
  },
  {
   "id": "gliner2",
   "nom": "GLiNER2 et GLiNER2.5",
   "groupe": "encodeur",
   "editeur": "Fastino",
   "date_sortie": "2025-07",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "source": "https://github.com/fastino-ai/GLiNER2",
   "acces": [
    {
     "type": "code",
     "nom": "GitHub",
     "url": "https://github.com/fastino-ai/GLiNER2"
    }
   ],
   "en_une_phrase": "Des encodeurs qui repèrent des entités, classent un texte, extraient des champs structurés et des relations en une seule passe. GLiNER2.5 (small, base, multi) date d'août 2026.",
   "chiffres": [
    {
     "valeur": "9 à 22",
     "libelle": "sur l'axe d'exactitude de JevBench, entre la 66e et la 80e place sur 106 : loin derrière les modèles de décision.",
     "provenance": "tiers",
     "par": "JevBench v1.5.4",
     "source": "https://benchmarkheaven.com/jev-models",
     "date": "2026-09-30"
    }
   ],
   "url": "https://quelleia.com/modeles-de-decision/#gliner2"
  },
  {
   "id": "gliclass",
   "nom": "GLiClass",
   "groupe": "encodeur",
   "editeur": "Knowledgator",
   "date_sortie": "2026-02",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "source": "https://huggingface.co/knowledgator/gliclass-instruct-large-v1.0",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/knowledgator/gliclass-instruct-large-v1.0"
    }
   ],
   "en_une_phrase": "Des classifieurs sans exemple : on donne les étiquettes à l'appel, pour de l'intention, du réordonnancement ou de la détection d'hallucination. Des variantes multilingues (edge, mini, ultra) ont suivi en avril 2026.",
   "chiffres": [
    {
     "valeur": "0,7199",
     "libelle": "de F1 moyen sans exemple, pour le modèle « large ».",
     "provenance": "declare",
     "par": "Knowledgator",
     "source": "https://huggingface.co/knowledgator/gliclass-instruct-large-v1.0",
     "date": "2026-09-30"
    }
   ],
   "url": "https://quelleia.com/modeles-de-decision/#gliclass"
  },
  {
   "id": "gliformer",
   "nom": "GLiFormer large-v1",
   "groupe": "encodeur",
   "editeur": "Knowledgator",
   "date_sortie": "2026-09-11",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "taille": "575,6 millions de paramètres ; une version « base » existe",
   "langues": "Anglais, d'après les métadonnées de la fiche Hugging Face.",
   "francais_cite": false,
   "source": "https://huggingface.co/knowledgator/gliformer-large-v1",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/knowledgator/gliformer-large-v1"
    }
   ],
   "en_une_phrase": "Un encodeur unique pour les entités, la classification, les relations, les enregistrements structurés et la mise en page de PDF.",
   "url": "https://quelleia.com/modeles-de-decision/#gliformer"
  },
  {
   "id": "gliner",
   "nom": "GLiNER",
   "groupe": "encodeur",
   "editeur": "Urchade Zaratiana et la communauté",
   "date_sortie": "2024-04",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "langues": "Multilingue, d'après les métadonnées de la fiche, sans liste de langues.",
   "source": "https://huggingface.co/urchade/gliner_multi-v2.1",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/urchade/gliner_multi-v2.1"
    }
   ],
   "en_une_phrase": "Le modèle d'origine de la lignée (gliner_multi-v2.1) : il repère dans un texte les entités dont on lui donne le nom à l'appel.",
   "url": "https://quelleia.com/modeles-de-decision/#gliner"
  },
  {
   "id": "nuextract3",
   "nom": "NuExtract3",
   "groupe": "encodeur",
   "editeur": "NuMind",
   "date_sortie": "2026-04-29",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "taille": "4 milliards de paramètres",
   "base": "Qwen3.5-4B",
   "source": "https://huggingface.co/numind/NuExtract3",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/numind/NuExtract3"
    }
   ],
   "en_une_phrase": "Un extracteur génératif : il remplit un gabarit JSON à partir d'un texte ou d'une image. Il écrit sa réponse, contrairement aux encodeurs de ce groupe.",
   "a_savoir": [
    "NuMind annonce un banc d'extraction et un classement ouverts « in the coming weeks » : ils n'étaient pas publiés le 30 septembre 2026."
   ],
   "url": "https://quelleia.com/modeles-de-decision/#nuextract3"
  },
  {
   "id": "privacy-filter",
   "nom": "privacy-filter",
   "groupe": "encodeur",
   "editeur": "OpenAI",
   "pays": "États-Unis",
   "date_sortie": "2026-04-17",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "taille": "1,4 milliard de paramètres",
   "source": "https://huggingface.co/openai/privacy-filter",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/openai/privacy-filter"
    }
   ],
   "en_une_phrase": "Un classifieur de jetons qui repère les données personnelles dans un texte, pour les masquer avant un traitement.",
   "url": "https://quelleia.com/modeles-de-decision/#privacy-filter"
  },
  {
   "id": "shieldstral",
   "nom": "Shieldstral-1.0-3B",
   "groupe": "garde",
   "editeur": "Mistral AI",
   "pays": "France",
   "date_sortie": "2026-07-16",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "langues": "Anglais, français, espagnol, allemand, italien, portugais, néerlandais, chinois, japonais et d'autres.",
   "francais_cite": true,
   "source": "https://huggingface.co/mistralai/Shieldstral-1.0-3B",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/mistralai/Shieldstral-1.0-3B"
    }
   ],
   "en_une_phrase": "Un classifieur de sécurité pour le texte et l'image : on lui écrit la règle à appliquer en langage courant, il dit si le contenu la respecte.",
   "a_savoir": [
    "Le tableau de sa fiche compare Shieldstral à GPT-OSS-Safeguard-20B, Qwen3Guard-8B, Nemotron-3.5, LlamaGuard-4-12B et ShieldGemma-9B. C'est la seule comparaison récente entre éditeurs, et c'est Mistral qui la publie."
   ],
   "chiffres": [
    {
     "valeur": "88,1",
     "libelle": "de F1 sur WildGuardTest.",
     "provenance": "declare",
     "par": "Mistral AI",
     "source": "https://huggingface.co/mistralai/Shieldstral-1.0-3B",
     "date": "2026-09-30"
    },
    {
     "valeur": "84,1",
     "libelle": "de F1 sur ToxicChat.",
     "provenance": "declare",
     "par": "Mistral AI",
     "source": "https://huggingface.co/mistralai/Shieldstral-1.0-3B",
     "date": "2026-09-30"
    },
    {
     "valeur": "86,2",
     "libelle": "de F1 sur Aegis v2.",
     "provenance": "declare",
     "par": "Mistral AI",
     "source": "https://huggingface.co/mistralai/Shieldstral-1.0-3B",
     "date": "2026-09-30"
    }
   ],
   "url": "https://quelleia.com/modeles-de-decision/#shieldstral"
  },
  {
   "id": "llama-guard-4",
   "nom": "Llama Guard 4",
   "groupe": "garde",
   "editeur": "Meta",
   "pays": "États-Unis",
   "date_sortie": "2025-04",
   "poids_ouverts": true,
   "licence": "Licence Llama 4, téléchargement sur demande",
   "taille": "12 milliards de paramètres",
   "langues": "Anglais, d'après les métadonnées de la fiche Hugging Face.",
   "francais_cite": false,
   "source": "https://huggingface.co/meta-llama/Llama-Guard-4-12B",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/meta-llama/Llama-Guard-4-12B",
     "note": "sur demande"
    }
   ],
   "en_une_phrase": "Le modèle de modération de Meta, dans sa version de 12 milliards de paramètres.",
   "url": "https://quelleia.com/modeles-de-decision/#llama-guard-4"
  },
  {
   "id": "llama-prompt-guard-2",
   "nom": "Llama Prompt Guard 2",
   "groupe": "garde",
   "editeur": "Meta",
   "pays": "États-Unis",
   "date_sortie": "2025-04",
   "poids_ouverts": true,
   "licence": "Licence Llama 4, téléchargement sur demande",
   "taille": "86 millions et 22 millions de paramètres",
   "langues": "Anglais, français, allemand, hindi, italien, portugais, espagnol et thaï, d'après les métadonnées de la fiche Hugging Face.",
   "francais_cite": true,
   "source": "https://huggingface.co/meta-llama/Llama-Prompt-Guard-2-86M",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Version 86M",
     "url": "https://huggingface.co/meta-llama/Llama-Prompt-Guard-2-86M",
     "note": "sur demande"
    },
    {
     "type": "telechargement",
     "nom": "Version 22M",
     "url": "https://huggingface.co/meta-llama/Llama-Prompt-Guard-2-22M",
     "note": "sur demande"
    }
   ],
   "en_une_phrase": "Deux très petits classifieurs de Meta contre l'injection de requêtes.",
   "url": "https://quelleia.com/modeles-de-decision/#llama-prompt-guard-2"
  },
  {
   "id": "shieldgemma-2",
   "nom": "ShieldGemma 2",
   "groupe": "garde",
   "editeur": "Google",
   "pays": "États-Unis",
   "date_sortie": "2025-03",
   "poids_ouverts": true,
   "licence": "Licence Gemma, téléchargement sur demande",
   "taille": "4 milliards de paramètres",
   "source": "https://huggingface.co/google/shieldgemma-2-4b-it",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/google/shieldgemma-2-4b-it",
     "note": "sur demande"
    }
   ],
   "en_une_phrase": "Le modèle de modération d'images de Google. Trois ShieldGemma plus anciens (2B, 9B, 27B) datent de juillet 2024.",
   "url": "https://quelleia.com/modeles-de-decision/#shieldgemma-2"
  },
  {
   "id": "granite-guardian",
   "nom": "Granite Guardian 4.1 8B",
   "groupe": "garde",
   "editeur": "IBM",
   "pays": "États-Unis",
   "date_sortie": "2026-04-16",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "langues": "Anglais, d'après les métadonnées de la fiche Hugging Face.",
   "francais_cite": false,
   "source": "https://huggingface.co/ibm-granite/granite-guardian-4.1-8b",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/ibm-granite/granite-guardian-4.1-8b"
    }
   ],
   "en_une_phrase": "Le modèle de garde d'IBM, de la famille Granite, publié sous licence libre.",
   "url": "https://quelleia.com/modeles-de-decision/#granite-guardian"
  },
  {
   "id": "nemotron-content-safety",
   "nom": "Nemotron-3.5-Content-Safety",
   "groupe": "garde",
   "editeur": "NVIDIA",
   "pays": "États-Unis",
   "date_sortie": "2026-05-22",
   "poids_ouverts": true,
   "licence": "OpenMDW",
   "langues": "Douze langues dont le français, d'après les métadonnées de la fiche Hugging Face.",
   "francais_cite": true,
   "source": "https://huggingface.co/nvidia/Nemotron-3.5-Content-Safety",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/nvidia/Nemotron-3.5-Content-Safety"
    }
   ],
   "en_une_phrase": "Le classifieur de sécurité des contenus de NVIDIA, dans sa gamme Nemotron.",
   "url": "https://quelleia.com/modeles-de-decision/#nemotron-content-safety"
  },
  {
   "id": "gpt-oss-safeguard",
   "nom": "gpt-oss-safeguard",
   "groupe": "garde",
   "editeur": "OpenAI",
   "pays": "États-Unis",
   "date_sortie": "2025-09",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "source": "https://huggingface.co/openai/gpt-oss-safeguard-20b",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Version 20b",
     "url": "https://huggingface.co/openai/gpt-oss-safeguard-20b"
    },
    {
     "type": "telechargement",
     "nom": "Version 120b",
     "url": "https://huggingface.co/openai/gpt-oss-safeguard-120b"
    }
   ],
   "en_une_phrase": "Les modèles de garde ouverts d'OpenAI, en deux tailles (20b et 120b).",
   "url": "https://quelleia.com/modeles-de-decision/#gpt-oss-safeguard"
  },
  {
   "id": "qwen3guard",
   "nom": "Qwen3Guard-Gen-8B",
   "groupe": "garde",
   "editeur": "Alibaba",
   "pays": "Chine",
   "date_sortie": "2025-09",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "source": "https://huggingface.co/Qwen/Qwen3Guard-Gen-8B",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/Qwen/Qwen3Guard-Gen-8B"
    }
   ],
   "en_une_phrase": "Le modèle de garde de la famille Qwen d'Alibaba.",
   "url": "https://quelleia.com/modeles-de-decision/#qwen3guard"
  },
  {
   "id": "gliguard",
   "nom": "gliguard-LLMGuardrails-300M",
   "groupe": "garde",
   "editeur": "Fastino",
   "date_sortie": "2026-05-09",
   "poids_ouverts": true,
   "licence": "Apache-2.0",
   "langues": "Anglais, d'après les métadonnées de la fiche Hugging Face.",
   "francais_cite": false,
   "source": "https://huggingface.co/fastino/gliguard-LLMGuardrails-300M",
   "acces": [
    {
     "type": "telechargement",
     "nom": "Hugging Face",
     "url": "https://huggingface.co/fastino/gliguard-LLMGuardrails-300M"
    }
   ],
   "en_une_phrase": "Un petit modèle de garde-fous pour modèles de langage, publié par Fastino.",
   "url": "https://quelleia.com/modeles-de-decision/#gliguard"
  }
 ],
 "bancs": [
  {
   "id": "jevbench",
   "nom": "JevBench",
   "version": "v1.5.4",
   "date": "2026-09-30",
   "mainteneur": "Benchmark Heaven, le projet personnel de Florian Standhartinger (Allemagne), sans lien avec TypeSafe AI",
   "url": "https://benchmarkheaven.com/jev-models",
   "depot": "https://github.com/fstandhartinger/jevbench",
   "inscrits": 112,
   "classes": 106,
   "mesure": "Quatre axes (exactitude corrigée du hasard, calibration, vitesse, coût), réunis en un score par une moyenne harmonique à poids égaux.",
   "protocole": "1 624 décisions par système, dont 720 gardées secrètes. Intervalles calculés par rééchantillonnage (2 000 tirages).",
   "limite": "Sa méthode et son podium bougent encore : la version du 27 septembre 2026 plaçait Imajev-4B premier et Jev quatrième, celle du 30 septembre place Cygnet premier et Jev troisième.",
   "autres_limites": [
    "220 décisions du niveau difficile ont été écrites par deux modèles de langage, qui se sont relus l'un l'autre.",
    "La vitesse et le coût des modèles hébergés par leurs auteurs reposent sur des hypothèses.",
    "Le score composite pénalise les modèles de langage sur la vitesse et le coût : GPT-6 Luna obtient 96,2 en exactitude et finit 35e.",
    "Les intervalles des dix premiers se recouvrent presque tous.",
    "Une évaluation prioritaire payante existe (49 ou 99 $), déclarée sans effet sur le score."
   ],
   "reutilisable": false,
   "pourquoi": "Le banc est sous licence MIT, mais rien ne couvre explicitement la reprise de ses résultats. Quelle IA attend l'accord écrit de son auteur avant de recopier son tableau."
  },
  {
   "id": "decision-index",
   "nom": "Jev Decision Index",
   "version": "0.2.1",
   "date": "2026-09-28",
   "mainteneur": "multimodalart (Apolinário), dans un espace Hugging Face",
   "url": "https://huggingface.co/spaces/multimodalart/jev-decision-index",
   "classes": 71,
   "mesure": "Un indice de 0 à 100, corrigé du hasard, sur 38 bancs publics réécrits en décisions, dans cinq domaines : connaissances, langue, recherche, outils, arts. L'erreur de calibration est donnée à part.",
   "protocole": "120 340 requêtes. Jev est interrogé par son API, les 70 reproductions tournent sur une même carte graphique.",
   "limite": "Les reproductions ne répondent qu'à 76 % des requêtes, contre 100 % pour Jev, et une requête sans réponse compte comme fausse : l'avance de Jev tient en partie à cet effet de couverture.",
   "autres_limites": [
    "Les bancs d'origine sont adaptés : les scores ne se comparent pas aux classements dont ils viennent, dit la méthodologie."
   ],
   "reutilisable": false,
   "pourquoi": "L'espace ne déclare aucune licence. Quelle IA attend l'accord écrit de son auteur avant de recopier son tableau."
  },
  {
   "id": "jevals",
   "nom": "Jevals",
   "version": "suite 0.1.0",
   "date": "2026-09-18",
   "mainteneur": "Jevals, dont l'auteur n'est pas nommé sur les pages consultées et qui se dit indépendant de TypeSafe AI",
   "url": "https://jevals.com",
   "depot": "https://github.com/Jevals/jevals-data",
   "classes": 7,
   "mesure": "Un « Decision Score » par épreuve, mesuré contre des étiquettes humaines : 100 pour un sans-faute, 0 pour qui devinerait d'après la fréquence des réponses. S'y ajoutent la calibration, le coût et la latence.",
   "protocole": "Trois épreuves de 300 questions : Jev et six modèles de langage, plus un témoin qui devine.",
   "limite": "Un seul modèle de décision y figure. Jevals situe Jev face à des modèles de langage et ne dit rien encore des reproductions ouvertes, annoncées dans sa rubrique « Coming next ».",
   "reutilisable": true,
   "pourquoi": "Les données sont sous licence CC BY 4.0, déclarée dans le dépôt et au pied du site.",
   "licence": "CC BY 4.0",
   "licence_url": "https://creativecommons.org/licenses/by/4.0/deed.fr",
   "donnees": "https://raw.githubusercontent.com/Jevals/jevals-data/HEAD/releases/2026-09-18/board.json",
   "citation": "Jevals (jevals.com), version du 18 septembre 2026, suite 0.1.0. CC BY 4.0.",
   "tableau": {
    "epreuves": [
     {
      "id": "pubmedqa",
      "nom": "PubMedQA",
      "forme": "oui ou non",
      "questions": 300
     },
     {
      "id": "banking77",
      "nom": "Banking77",
      "forme": "choix parmi 77 intentions",
      "questions": 300
     },
     {
      "id": "helpsteer2",
      "nom": "HelpSteer2",
      "forme": "note d'utilité",
      "questions": 300
     }
    ],
    "lignes": [
     {
      "modele": "Jev",
      "editeur": "TypeSafe AI",
      "decision": true,
      "pubmedqa": {
       "score": 69,
       "bas": 59.8,
       "haut": 76.5,
       "exactitude": 91.3,
       "mediane_ms": 438,
       "cout_1000": 0.029
      },
      "banking77": {
       "score": 67.8,
       "bas": 61.3,
       "haut": 74.5,
       "exactitude": 79.7,
       "mediane_ms": 467,
       "cout_1000": 0.043
      },
      "helpsteer2": {
       "score": 9.2,
       "bas": -4.4,
       "haut": 21,
       "exactitude": 41.3,
       "mediane_ms": 478,
       "cout_1000": 0.036
      }
     },
     {
      "modele": "DeepSeek V4.1 Flash",
      "editeur": "DeepSeek",
      "pubmedqa": {
       "score": 47.5,
       "bas": 34.7,
       "haut": 59.1,
       "exactitude": 83.7,
       "mediane_ms": 838,
       "cout_1000": 0.078
      },
      "banking77": {
       "score": 63.9,
       "bas": 58.5,
       "haut": 69.6,
       "exactitude": 75.9,
       "mediane_ms": 999,
       "cout_1000": 0.138
      },
      "helpsteer2": {
       "score": -19,
       "bas": -36,
       "haut": -3.3,
       "exactitude": 34.7,
       "mediane_ms": 912,
       "cout_1000": 0.125
      }
     },
     {
      "modele": "Gemini 3.8 Flash",
      "editeur": "Google",
      "pubmedqa": {
       "score": 73,
       "bas": 62.1,
       "haut": 82.2,
       "exactitude": 92.5,
       "mediane_ms": 1854,
       "cout_1000": 0.803
      },
      "banking77": {
       "score": 74.1,
       "bas": 68.4,
       "haut": 79.8,
       "exactitude": 84.6,
       "mediane_ms": 1636,
       "cout_1000": 1.368
      },
      "helpsteer2": {
       "score": 4.6,
       "bas": -12.2,
       "haut": 19,
       "exactitude": 42.4,
       "mediane_ms": 1887,
       "cout_1000": 1.269
      }
     },
     {
      "modele": "GLM-5.3",
      "editeur": "Z.ai",
      "pubmedqa": {
       "score": 60.6,
       "bas": 50,
       "haut": 69.8,
       "exactitude": 88.7,
       "mediane_ms": 1757,
       "cout_1000": 0.512
      },
      "banking77": {
       "score": 66.8,
       "bas": 62,
       "haut": 71.7,
       "exactitude": 78.9,
       "mediane_ms": 2110,
       "cout_1000": 0.719
      },
      "helpsteer2": {
       "score": 7.8,
       "bas": -4.6,
       "haut": 18.6,
       "exactitude": 43,
       "mediane_ms": 2211,
       "cout_1000": 0.785
      }
     },
     {
      "modele": "Mercury 2.5",
      "editeur": "Inception",
      "pubmedqa": {
       "score": 55.7,
       "bas": 44.8,
       "haut": 65.4,
       "exactitude": 87.1,
       "mediane_ms": 584,
       "cout_1000": 0.023
      },
      "banking77": {
       "score": 54,
       "bas": 47.8,
       "haut": 60.6,
       "exactitude": 70.3,
       "mediane_ms": 638,
       "cout_1000": 0.036
      },
      "helpsteer2": {
       "score": -5.5,
       "bas": -16.2,
       "haut": 4,
       "exactitude": 41.7,
       "mediane_ms": 618,
       "cout_1000": 0.034
      }
     },
     {
      "modele": "Mistral Medium 3.5",
      "editeur": "Mistral AI",
      "pubmedqa": {
       "score": 58,
       "bas": 45.3,
       "haut": 69.8,
       "exactitude": 88.8,
       "mediane_ms": 533,
       "cout_1000": 0.875
      },
      "banking77": {
       "score": 59.5,
       "bas": 54.3,
       "haut": 64.8,
       "exactitude": 74.5,
       "mediane_ms": 936,
       "cout_1000": 1.515
      },
      "helpsteer2": {
       "score": -13.7,
       "bas": -28.3,
       "haut": -0.1,
       "exactitude": 43.9,
       "mediane_ms": 706,
       "cout_1000": 1.325
      }
     },
     {
      "modele": "Qwen3.8 Flash",
      "editeur": "Alibaba",
      "pubmedqa": {
       "score": 62.4,
       "bas": 50.9,
       "haut": 72.5,
       "exactitude": 89.7,
       "mediane_ms": 1088,
       "cout_1000": 0.086
      },
      "banking77": {
       "score": 62.4,
       "bas": 55.9,
       "haut": 68.9,
       "exactitude": 76.8,
       "mediane_ms": 1713,
       "cout_1000": 0.122
      },
      "helpsteer2": {
       "score": -1.4,
       "bas": -15.4,
       "haut": 11.5,
       "exactitude": 36.1,
       "mediane_ms": 1422,
       "cout_1000": 0.126
      }
     }
    ]
   }
  }
 ],
 "raisons": [
  {
   "titre": "Des bancs trop jeunes",
   "texte": "Les deux bancs tiers qui couvrent les mêmes modèles, JevBench et le Jev Decision Index, avaient entre huit et treize jours le 30 septembre 2026."
  },
  {
   "titre": "Deux podiums différents",
   "texte": "JevBench place Cygnet premier et Jev troisième. Le Decision Index place Jev premier et ne contient pas Cygnet."
  },
  {
   "titre": "Une méthode qui change",
   "texte": "JevBench a changé de barème et de podium entre le 27 et le 30 septembre 2026. Un score hebdomadaire refléterait ces changements autant que les modèles."
  },
  {
   "titre": "Des chiffres d'éditeur invérifiables",
   "texte": "TypeSafe mesure Jev contre une référence faite par deux modèles de langage et refuse les bancs publics : « Put no weight on public benchmarks »."
  }
 ],
 "conditions_du_classement": [
  {
   "titre": "Trois sources indépendantes",
   "texte": "Trois bancs tenus par des auteurs différents, qui mesurent au moins huit à dix modèles en commun.",
   "aujourdhui": "Deux seulement : JevBench et le Decision Index. Jevals deviendrait le troisième s'il ajoute les reproductions ouvertes, comme il l'annonce."
  },
  {
   "titre": "Quatre semaines de stabilité",
   "texte": "La même méthode et les mêmes identifiants de modèles d'une semaine à l'autre.",
   "aujourdhui": "JevBench a changé de méthode en trois jours. Il publie un journal de ses révisions, ce qui permettra de le vérifier."
  },
  {
   "titre": "Une part de vérité humaine",
   "texte": "Des étiquettes posées par des humains dans chaque source retenue, ou au moins une source qui n'utilise qu'elles.",
   "aujourdhui": "Seuls Jevals, la suite de Bespoke Labs et des articles de recherche s'appuient sur des étiquettes humaines, et ils comparent Jev à des modèles de langage ou à un seul concurrent."
  },
  {
   "titre": "L'accord écrit des auteurs",
   "texte": "L'autorisation de Benchmark Heaven et de multimodalart de reprendre leurs lignes, avec attribution.",
   "aujourdhui": "Pas encore obtenu. Seul Jevals, sous licence CC BY 4.0, se reprend sans demander."
  }
 ],
 "engagements": [
  "N'entreront au classement que les modèles qui respectent le contrat de la famille : un texte, des questions fermées, des probabilités en retour. Les modèles de langage y figureront comme repères, hors classement.",
  "Un test en français, même petit, fera partie du score. Aucun banc ne mesure le français aujourd'hui."
 ],
 "questions": [
  {
   "question": "Qu'est-ce que Jev ?",
   "reponse": "Jev est un modèle de décision publié par TypeSafe AI (États-Unis) le 15 septembre 2026, en accès anticipé. Jev reçoit un texte et une liste de questions fermées, et rend pour chacune un choix, une note ou un oui/non avec sa probabilité. Il ne rédige aucun texte. Ses poids ne sont pas publiés : il s'utilise par une API, au prix déclaré de 0,042 $ par million de jetons d'entrée. TypeSafe appelle cette famille « System One »."
  },
  {
   "question": "Jev est-il meilleur que Claude ?",
   "reponse": "Sur l'exactitude, les mesures de tiers disponibles au 30 septembre 2026 disent que non. Sur jev-frontier-bench, Jev obtient 72,5 % d'exactitude sur 200 décisions (intervalle de 66,0 à 78,5), contre 84,0 % pour Claude Fable 5.1 et 79,0 % pour GPT-6 Astra. Sur le banc de l'éditeur lui-même, Jev (67,8 % d'accord) fait jeu égal avec « sonnet 5 » et reste derrière « opus 5 » (73,1 %). Jev est en revanche bien plus rapide et moins cher : TypeSafe annonce 70 à 500 ms de temps de réponse, et quatre bancs tiers mesurent une latence médiane de 0,43 à 0,71 s. Ces mesures portent sur de petits jeux de décisions en anglais."
  },
  {
   "question": "Jev est-il vraiment 193 fois plus rapide ?",
   "reponse": "Le « 193,6 fois plus rapide, 444,6 fois moins cher » de TypeSafe vient de son propre banc et réunit deux rapports pris sur deux modèles différents : ×195 en temps face à « sonnet 5 », l'un des plus lents du banc, et ×440 en coût face à « opus 5 », le plus cher. Face à « luna » (OpenAI), le modèle de langage d'exactitude comparable le moins cher, l'écart tombe à ×32 en temps et ×8 en coût. La référence de ce banc est faite des réponses de deux modèles de langage, sans étiquette humaine, et l'éditeur écrit lui-même que ces multiplicateurs sont « on the higher end of real world gains »."
  },
  {
   "question": "Existe-t-il des alternatives ouvertes à Jev ?",
   "reponse": "Oui. Quelle IA en recense 14 au 30 septembre 2026, dont Cygnet (blockbrain), Winnow-12B (EldanRing), JevK5 (alibiserikbay), decider-2b, decider-4b (Mapika) et Bespoke-Nimble-9B (Bespoke Labs). La plupart partent d'un petit modèle ouvert, Qwen3.5 ou Gemma 4, dont on lit les probabilités sur les options. Sur JevBench v1.5.4, Cygnet obtient 73,7 de score composite, devant Jev (72,1), mais leurs intervalles se recouvrent, et l'autre banc tiers, le Jev Decision Index, place Jev premier."
  },
  {
   "question": "Jev comprend-il le français ?",
   "reponse": "Rien ne le montre aujourd'hui. TypeSafe écrit que l'anglais est la langue principale d'entraînement de Jev, que les autres langues sont « handled but not equally well », et ne cite pas le français. Au 30 septembre 2026, la suite publique de Bespoke Labs mesure 86,9 % en allemand, contre 87,4 % en anglais, sur les mêmes 350 requêtes du jeu MASSIVE. C'est la seule mesure hors de l'anglais trouvée. Aucune mesure en français n'existe. Parmi les modèles voisins, Shieldstral-1.0-3B, Llama Prompt Guard 2 et Nemotron-3.5-Content-Safety citent le français dans leurs langues."
  },
  {
   "question": "Pourquoi Quelle IA ne classe-t-il pas les modèles de décision ?",
   "reponse": "Parce que la matière manque encore pour un classement honnête. Les deux bancs tiers qui couvrent les mêmes modèles, JevBench et le Jev Decision Index, avaient entre huit et treize jours le 30 septembre 2026. JevBench place Cygnet premier et Jev troisième. Le Decision Index place Jev premier et ne contient pas Cygnet. JevBench a changé de barème et de podium entre le 27 et le 30 septembre 2026. Un score hebdomadaire refléterait ces changements autant que les modèles. Quelle IA ouvrira un classement quand quatre conditions seront réunies : trois sources indépendantes, quatre semaines de stabilité, une part de vérité humaine et l'accord écrit des auteurs."
  }
 ]
}