# Modèles de décision : Jev et ses concurrents

> Un modèle de décision répond par un choix parmi des options fixées d'avance, accompagné d'une probabilité. Il ne rédige aucun texte. Ce dossier présente Jev et sa famille sans les classer : les bancs publics ont moins de quinze jours et se contredisent. Vérifié le 30 septembre 2026.

Page : https://quelleia.com/modeles-de-decision/
Données : https://quelleia.com/modeles-de-decision.json
Auteur : Ulrich Rozier (https://ulrichrozier.com), Quelle IA.

**Dossier sans score.** Quelle IA ne publie ni rang ni score pour ces modèles. Chaque chiffre dit qui l'a produit : « déclaré par l'éditeur » ou « mesuré par un tiers », avec sa source. 35 modèles, 44 chiffres (17 déclarés, 27 mesurés par des tiers), 3 bancs.

## En deux minutes

**Ce qu'il fait.** On lui donne un texte et une ou plusieurs questions fermées. Pour chacune, il rend un choix parmi les options proposées, une note sur une grille ou un oui/non, toujours avec une probabilité. La réponse a une forme fixe, qu'un programme lit sans avoir à l'interpréter.

**Face à un modèle de langage.** Un modèle de langage rédige sa réponse mot après mot. Un modèle de décision choisit parmi des options et s'arrête là. Il n'écrit rien, n'explique rien et calcule mal. Il est conçu pour répondre plus vite et pour moins cher. TypeSafe appelle cette famille « System One », d'après Daniel Kahneman. Le terme neutre, « modèle de décision », s'installe chez Liquid AI et dans les articles de recherche.

**À quoi il sert.** Trier : classer un message, une demande, un document ; Router : envoyer une requête vers le bon service ou le bon modèle ; Valider : juger la réponse d'un autre modèle, vérifier une règle ; Extraire : choisir la bonne valeur parmi des candidats ; Modérer : repérer un contenu interdit ou une tentative de contournement.

## Jev 1.13.0, de TypeSafe AI

Jev reçoit un texte et une liste de questions fermées, et rend pour chacune un choix, une note ou un oui/non avec sa probabilité. Il ne rédige aucun texte.

- Sortie : 15 septembre 2026
- Licence : Poids non publiés, accès par API. SDK Python et JavaScript sous licence MIT.
- Prix déclaré : 0,042 $ par million de jetons d'entrée, soit 42 $ le milliard. La sortie est gratuite.
- Entrées : Texte seul. Une chaîne, un objet JSON ou une liste de textes, sans image, audio ni vidéo.
- Contexte : 64 000 jetons par requête, dont 32 000 pour le texte à juger et la question la plus longue
- Langues : L'anglais d'abord. L'éditeur écrit que les autres langues sont « handled but not equally well » et ne cite pas le français.
- Trois formes de question : « Choice » (une option parmi une liste, jusqu'à 255), « Score » (une note sur une grille ordonnée) et « Noul » (oui ou non).
- Taille non publiée : l'éditeur écrit seulement que Jev « is neither small nor an LLM ».
- Les mêmes poids servent tous les comptes, sans ajustement possible par le client.
- Limites reconnues par l'éditeur : lecture littérale, comptage et calcul, comparaison de dates, raisonnement indirect, texte long et bruité, contenu adverse, consignes contradictoires.
- L'essayer : [Console TypeSafe](https://console.typesafe.ai) (accès anticipé, sur liste d'attente)
- Par API : [Documentation de l'API](https://docs.typesafe.ai)
- Le code : [SDK Python et JavaScript](https://github.com/typesafe-ai)

### Ce que dit l'éditeur, ce que disent les tiers

**Vitesse**

- **193,6 fois** plus rapide qu'un modèle de langage, dit le slogan de la page d'accueil, « based on workflows for System One tasks ». Le modèle comparé n'est pas nommé. _Déclaré par l'éditeur : TypeSafe AI, 30 septembre 2026._ https://typesafe.ai
- **40 à 200 fois** plus rapide « for the same levels of frontier intelligence », selon le billet de lancement. _Déclaré par l'éditeur : TypeSafe AI, 15 septembre 2026._ https://typesafe.ai/blog/introducing-system-one-models-and-jev
- **70 à 500 ms** de temps de réponse, de bout en bout. _Déclaré par l'éditeur : TypeSafe AI, 15 septembre 2026._ https://typesafe.ai/blog/introducing-system-one-models-and-jev
- **0,43 s** de latence médiane sur 200 décisions. _Mesuré par un tiers : jev-frontier-bench (M. Janardhan), 30 septembre 2026._ https://github.com/manjunathshiva/jev-frontier-bench
- **524 ms** de latence médiane. _Mesuré par un tiers : Jev Decision Index 0.2.1, 28 septembre 2026._ https://huggingface.co/spaces/multimodalart/jev-decision-index
- **0,62 s** de latence médiane, réseau compris. _Mesuré par un tiers : JevBench v1.5.4, 30 septembre 2026._ https://benchmarkheaven.com/jev-models
- **710 ms** de latence médiane sur 2 000 décisions. _Mesuré par un tiers : typed-decisions (LocalLLaMA), 30 septembre 2026._ https://huggingface.co/datasets/LocalLLaMA/typed-decisions

**Prix**

- **444,6 fois** moins cher qu'un modèle de langage, dit le même slogan. Le modèle comparé n'est pas nommé. _Déclaré par l'éditeur : TypeSafe AI, 30 septembre 2026._ https://typesafe.ai
- **238 fois** moins cher à l'entrée que Claude Fable 5.1, selon la page d'accueil. _Déclaré par l'éditeur : TypeSafe AI, 30 septembre 2026._ https://typesafe.ai
- **0,042 $** par million de jetons d'entrée. La sortie est gratuite. _Déclaré par l'éditeur : TypeSafe AI, 30 septembre 2026._ https://docs.typesafe.ai/models.md
- **0,029 $** les 1 000 décisions oui/non sur PubMedQA, contre 0,80 $ pour Gemini 3.8 Flash, le modèle de langage le mieux noté de l'épreuve. _Mesuré par un tiers : Jevals, 18 septembre 2026._ https://jevals.com

**Exactitude**

- Jev atteint « similar levels of intelligence on System One tasks compared to existing LLMs », écrit le billet de lancement. TypeSafe refuse les bancs publics : « Put no weight on public benchmarks ». _Déclaré par l'éditeur._ https://typesafe.ai/blog/introducing-system-one-models-and-jev
- **67,8 %** d'accord avec la référence sur le banc maison de l'éditeur, moyenne de ses quatre chaînes. La référence est faite des réponses de deux modèles de langage : aucune étiquette humaine. _Déclaré par l'éditeur : TypeSafe AI, Workflow evals, 30 septembre 2026._ https://evals.typesafe.ai
- **72,0** sur l'axe d'exactitude (« Intelligence ») de JevBench. Les modèles de langage de référence y montent jusqu'à 96,2, pour GPT-6 Luna. _Mesuré par un tiers : JevBench v1.5.4, 30 septembre 2026._ https://benchmarkheaven.com/jev-models
- **72,1** de score composite (exactitude, calibration, vitesse, coût), intervalle de 71,0 à 72,6 : troisième sur 106 systèmes, derrière deux reproductions ouvertes. _Mesuré par un tiers : JevBench v1.5.4, 30 septembre 2026._ https://benchmarkheaven.com/jev-models
- **57,91** d'indice corrigé du hasard sur 38 bancs publics adaptés : premier sur 71 systèmes. Les reproductions n'y répondent qu'à 76 % des requêtes, ce qui avantage Jev. _Mesuré par un tiers : Jev Decision Index 0.2.1, 28 septembre 2026._ https://huggingface.co/spaces/multimodalart/jev-decision-index
- **72,5 %** d'exactitude sur 200 décisions (intervalle de 66,0 à 78,5), contre 84,0 % pour Claude Fable 5.1 et 79,0 % pour GPT-6 Astra. _Mesuré par un tiers : jev-frontier-bench (M. Janardhan), 30 septembre 2026._ https://github.com/manjunathshiva/jev-frontier-bench
- **76,0 %** d'exactitude moyenne sur 13 jeux à étiquettes humaines (3 880 cas), contre 74,8 % pour Nimble-9B. La mesure vient de Bespoke Labs, qui édite Nimble. _Mesuré par un tiers : Bespoke Labs, 30 septembre 2026._ https://github.com/bespokelabsai/nimble/blob/main/docs/PUBLIC_BENCHMARKS.md
- **69,0** de « Decision Score » sur PubMedQA (oui ou non), contre 73,0 pour Gemini 3.8 Flash. Le tableau complet est plus bas. _Mesuré par un tiers : Jevals, 18 septembre 2026._ https://jevals.com
- **14 sur 15** tâches de sciences sociales où le modèle de décision est derrière le meilleur modèle de langage, avec un écart médian de 11,6 points de macro-F1 (7 977 items, 19 modèles de langage). _Mesuré par un tiers : Ibrahim et Zaki, arXiv 2609.24574, septembre 2026._ https://arxiv.org/abs/2609.24574
- **0,908** de F1 sur des récits d'accidents (2 416 jugements humains). Un modèle de langage de pointe fait 0,059 de mieux. _Mesuré par un tiers : Rafe et Das, arXiv 2609.24052, septembre 2026._ https://arxiv.org/abs/2609.24052

**Fiabilité**

- **Zéro** hallucination, affiche la page d'accueil. Le billet précise : « Our number is not empirical ». La garantie porte sur la forme de la réponse, toujours conforme au schéma demandé. Elle ne dit rien de son exactitude. _Déclaré par l'éditeur : TypeSafe AI, 15 septembre 2026._ https://typesafe.ai/blog/introducing-system-one-models-and-jev
- **70,4 sur 100** réponses changent quand on renomme les options 0/1 en no/yes, sur 1 200 décisions. L'aire sous la courbe tombe de 0,94 à 0,23. _Mesuré par un tiers : Sun et al., arXiv 2609.26758, septembre 2026._ https://arxiv.org/abs/2609.26758
- **88,0** sur l'axe de calibration de JevBench, qui vérifie que les probabilités annoncées correspondent aux taux de réussite. _Mesuré par un tiers : JevBench v1.5.4, 30 septembre 2026._ https://benchmarkheaven.com/jev-models
- **0,074** d'erreur de calibration (ECE) : plus le chiffre est bas, plus les probabilités sont fiables. _Mesuré par un tiers : Jev Decision Index 0.2.1, 28 septembre 2026._ https://huggingface.co/spaces/multimodalart/jev-decision-index

**Langues**

- L'anglais est la langue principale d'entraînement, « where accuracy is currently best ». Les autres langues sont « handled but not equally well ». Le français n'est pas cité. _Déclaré par l'éditeur._ https://docs.typesafe.ai/models.md
- **86,9 %** en allemand, contre 87,4 % en anglais, sur les mêmes 350 requêtes du jeu MASSIVE. C'est la seule mesure hors de l'anglais trouvée. Aucune mesure en français n'existe. _Mesuré par un tiers : Bespoke Labs, 30 septembre 2026._ https://github.com/bespokelabsai/nimble/blob/main/docs/PUBLIC_BENCHMARKS.md

### Ce que compare le « 193,6 fois »

Le « 193,6 fois plus rapide, 444,6 fois moins cher » de TypeSafe vient de son propre banc et réunit deux rapports pris sur deux modèles différents : ×195 en temps face à « sonnet 5 », l'un des plus lents du banc, et ×440 en coût face à « opus 5 », le plus cher. Face à « luna » (OpenAI), le modèle de langage d'exactitude comparable le moins cher, l'écart tombe à ×32 en temps et ×8 en coût. La référence de ce banc est faite des réponses de deux modèles de langage, sans étiquette humaine, et l'éditeur écrit lui-même que ces multiplicateurs sont « on the higher end of real world gains ».

- Les chaînes ont été écrites par l'équipe de TypeSafe : « some bias could exist ».
- Les modèles de langage passent par un adaptateur de TypeSafe qui, selon l'éditeur, « tends to be slower and more expensive ».
- Les temps sont mesurés « from our laptops on the West Coast », là où le service est hébergé.
- L'éditeur écrit lui-même que ces multiplicateurs sont « on the higher end of real world gains ».

Rapports recalculés par Quelle IA le 30 septembre 2026 à partir des valeurs arrondies que publie l'éditeur, moyenne des quatre chaînes : d'où ×195 et ×440 au lieu de 193,6 et 444,6.
Sources : https://evals.typesafe.ai, https://typesafe.ai/blog/introducing-system-one-models-and-jev, https://typesafe.ai

## Les concurrents, groupe par groupe

## Les modèles de décision fermés

Le même contrat que Jev : un texte, des questions fermées, des probabilités en retour. Leurs poids ne sont pas publiés, on y accède par une API. Jev, présenté plus haut, appartient à ce groupe.

### d1

Liquid AI, États-Unis. Poids fermés. Le modèle de la gamme « Decision Models » de Liquid AI reprend les trois mêmes formes de question que Jev : choix, note, oui ou non.

- À savoir : La page de l'éditeur ne donne ni prix ni résultat de banc, et sa date de sortie n'a pas été vérifiée.
- **0,742** d'exactitude sur 2 000 décisions, contre 0,727 pour Jev. La référence de ce banc est synthétique : elle vient d'un modèle d'environ 4 milliards de paramètres. _Mesuré par un tiers : typed-decisions (LocalLLaMA), 30 septembre 2026._ https://huggingface.co/datasets/LocalLLaMA/typed-decisions
- Par API : [Documentation Liquid AI](https://docs.liquid.ai/lfm/models/decision-models) (identifiant « d1:free »)

### Decider 1 (sd-1)

meraGPT. Poids fermés. Un modèle de décision accessible par API, vu seulement dans le tableau du banc communautaire typed-decisions.

- À savoir : Sa ligne, en tête de ce tableau, porte un lien de campagne publicitaire : son chiffre n'est pas repris ici. La page de l'éditeur n'a pas été consultée.
- Source : https://huggingface.co/datasets/LocalLLaMA/typed-decisions

### decision-machine-1

milliseconds.ai. Poids fermés. Un modèle de décision fermé, servi par une API au format de celle de TypeSafe.

- **3,2** de score composite : 71e sur 106 systèmes. _Mesuré par un tiers : JevBench v1.5.4, 30 septembre 2026._ https://benchmarkheaven.com/jev-models
- Source : https://benchmarkheaven.com/jev-models

### Instinct Dual 4B

ZooWork. Poids fermés. Un modèle de décision fermé, connu par sa seule ligne dans JevBench.

- **47,0** de score composite : 27e sur 106 systèmes. _Mesuré par un tiers : JevBench v1.5.4, 30 septembre 2026._ https://benchmarkheaven.com/jev-models
- Source : https://benchmarkheaven.com/jev-models

## Les reproductions ouvertes

En quinze jours, des dizaines de reproductions de Jev sont apparues : JevBench recense 112 systèmes, le Jev Decision Index 70 reproductions. La plupart partent d'un petit modèle ouvert (Qwen3.5 de 2 à 9 milliards de paramètres, Gemma 4) dont on lit les probabilités sur les options, avec ou sans adaptateur LoRA.

### Cygnet

blockbrain. Poids ouverts. Cygnet est une recette : elle lit, dans un Gemma 4 laissé tel quel, la probabilité du jeton de chaque option.

- Licence : MIT pour le code ; Apache-2.0 et politique d'usage de Gemma pour les poids
- Base : Gemma-4-12B-it, sans entraînement
- **73,7** de score composite (intervalle de 72,4 à 74,5) : premier sur 106 systèmes, devant Jev. Les intervalles des dix premiers se recouvrent presque tous. _Mesuré par un tiers : JevBench v1.5.4, 30 septembre 2026._ https://benchmarkheaven.com/jev-models
- Le code : [GitHub](https://github.com/blockbrain-ai/cygnet-recipe)

### Winnow-12B

EldanRing. Poids ouverts. Une reproduction ouverte de Jev bâtie sur Gemma 4, présente dans les deux bancs tiers.

- Sortie : 20 septembre 2026
- Licence : Apache-2.0
- Base : google/gemma-4-12B-it
- **73,2** de score composite (intervalle de 72,0 à 74,0) : deuxième sur 106 systèmes, dans sa version Q8. _Mesuré par un tiers : JevBench v1.5.4, 30 septembre 2026._ https://benchmarkheaven.com/jev-models
- **50,02** d'indice : dixième sur 71 systèmes. Deuxième d'un banc, dixième de l'autre. _Mesuré par un tiers : Jev Decision Index 0.2.1, 28 septembre 2026._ https://huggingface.co/spaces/multimodalart/jev-decision-index
- Télécharger : [Hugging Face](https://huggingface.co/EldanRing/Winnow-12B)

### JevK5

alibiserikbay. Poids ouverts. Une famille de reproductions ouvertes sur Qwen3.5 : 4B d'abord, puis des variantes v0.3, 2B, 9B et Lite.

- Sortie : 22 septembre 2026
- Licence : Apache-2.0
- Base : Qwen/Qwen3.5-4B
- Télécharger : [Hugging Face](https://huggingface.co/alibiserikbay/JevK5)

### decider-2b, decider-4b

Mapika. Poids ouverts. Deux reproductions ouvertes sur Qwen3.5 : decider-2b est sorti le 16 septembre 2026, au lendemain de Jev, et decider-4b a suivi le 22 septembre. Une variante decider-35b-a3b existe aussi.

- Sortie : 16 septembre 2026
- Licence : Apache-2.0
- Base : Qwen3.5-2B-Base et Qwen3.5-4B-Base
- Télécharger : [decider-2b](https://huggingface.co/Mapika/decider-2b)
- Télécharger : [decider-4b](https://huggingface.co/Mapika/decider-4b)

### Bespoke-Nimble-9B

Bespoke Labs. Poids ouverts. Une reproduction ouverte sur Qwen3.5, dont l'éditeur publie aussi une suite de tests à étiquettes humaines qui compare son modèle à Jev.

- Sortie : 18 septembre 2026
- Licence : Apache-2.0 pour le modèle ; le dépôt GitHub ne déclare pas de licence
- Base : Qwen/Qwen3.5-9B avec un adaptateur LoRA
- Langues : Anglais, d'après les métadonnées de la fiche Hugging Face.
- **90,1 %** d'accord sur 324 exemples tenus à l'écart, contre 93,2 % pour Jev 1.13.0. _Déclaré par l'éditeur : Bespoke Labs, 30 septembre 2026._ https://github.com/bespokelabsai/nimble
- **74,8 %** d'exactitude moyenne sur 13 jeux à étiquettes humaines (3 880 cas), contre 76,0 % pour Jev. _Déclaré par l'éditeur : Bespoke Labs, 30 septembre 2026._ https://github.com/bespokelabsai/nimble/blob/main/docs/PUBLIC_BENCHMARKS.md
- Télécharger : [Hugging Face](https://huggingface.co/bespokelabs/Bespoke-Nimble-9B)
- Le code : [GitHub](https://github.com/bespokelabsai/nimble)

### Laya

Convai Innovations. Poids ouverts. Un petit encodeur (ModernBERT ou mmBERT) ajusté pour rendre des décisions typées, en version anglaise ou multilingue.

- Sortie : 18 septembre 2026
- Licence : Apache-2.0
- Taille : 421 millions de paramètres (anglais, sur ModernBERT-large) ; 322 millions (multilingue, sur mmBERT-base)
- Langues : L'éditeur annonce « 100+ languages » pour la variante multilingue.
- **33 ms** environ, de temps de réponse. _Déclaré par l'éditeur : Convai Innovations, 30 septembre 2026._ https://huggingface.co/convaiinnovations/laya
- **0,766** d'exactitude pour la variante affinée sur typed-decisions, contre 0,362 pour le modèle de base. _Déclaré par l'éditeur : Convai Innovations, 30 septembre 2026._ https://huggingface.co/convaiinnovations/laya
- **0,0** sur l'axe d'exactitude de JevBench : 93e sur 106 systèmes. _Mesuré par un tiers : JevBench v1.5.4, 30 septembre 2026._ https://benchmarkheaven.com/jev-models
- Télécharger : [Hugging Face](https://huggingface.co/convaiinnovations/laya)

### Tev1-4B-experimental

Together AI. Poids ouverts. La reproduction expérimentale de Together AI, déclinée aussi en 0,8B. Les poids sont publiés sans licence : leur réutilisation n'est pas encadrée.

- Sortie : 23 septembre 2026
- Licence : Aucune licence déclarée
- Base : Qwen/Qwen3.5-4B
- Télécharger : [Hugging Face](https://huggingface.co/togethercomputer/Tev1-4B-experimental)

### Intern-Decision

InternLM. Poids ouverts. Trois modèles de décision ouverts (0,8B, 2B et 4B) publiés par l'équipe InternLM.

- Sortie : 26 septembre 2026
- Licence : Apache-2.0
- Base : Qwen/Qwen3.5-4B
- Télécharger : [Hugging Face](https://huggingface.co/internlm/Intern-Decision-4B)

### Decision-1.0

llm-semantic-router. Poids ouverts. Une gamme de six modèles de décision (Eos, Kai, Lex, Sol, Nox, Lux), publiée par l'organisation llm-semantic-router.

- Sortie : 22 septembre 2026
- Licence : Apache-2.0
- Télécharger : [Hugging Face](https://huggingface.co/llm-semantic-router/Decision-1.0-Lux-9B)

### SemIf (ex-OpenJev)

Theodore Lee. Poids ouverts. Un outil sans entraînement, qui lit les probabilités d'un modèle ouvert existant pour en tirer une décision typée.

- Licence : MIT
- Le code : [GitHub](https://github.com/TheoLeeCJ/SemIf-OpenJev)

### SimpleJev

Featherless AI. Poids ouverts. La reproduction ouverte publiée par Featherless AI.

- Licence : Apache-2.0
- **0,716** d'exactitude sur 2 000 décisions, contre 0,727 pour Jev. La référence de ce banc est synthétique. _Mesuré par un tiers : typed-decisions (LocalLLaMA), 30 septembre 2026._ https://huggingface.co/datasets/LocalLLaMA/typed-decisions
- Le code : [GitHub](https://github.com/featherless-ai/simple-jev)

### djev

Maisa. Poids non précisés. Une reproduction bâtie sur DiffusionGemma, proposée par une API hébergée en aperçu gratuit. La publication de ses poids n'a pas été vérifiée.

- Base : DiffusionGemma
- Source : https://benchmarkheaven.com/jev-models

### open-jev-deberta-v3-large

Kotoba Labs. Poids ouverts. Une reproduction ouverte sur un encodeur DeBERTa, bien plus petite que les reproductions bâties sur un modèle de langage.

- Sortie : 18 septembre 2026
- Licence : Apache-2.0
- Taille : 434 millions de paramètres
- Télécharger : [Hugging Face](https://huggingface.co/com-kotobalabs/open-jev-deberta-v3-large)

### OpenThai-SystemOne

iApp. Poids ouverts. Un modèle de décision ouvert pour le thaï et l'anglais.

- Sortie : 20 septembre 2026
- Licence : Apache-2.0
- Langues : Thaï et anglais.
- Télécharger : [Hugging Face](https://huggingface.co/iapp/OpenThai-SystemOne)

## Les encodeurs et extracteurs à schéma

Pour la plupart antérieurs à Jev, ces modèles reçoivent les étiquettes ou le schéma au moment de l'appel. Aucun banc commun ne les compare entre eux, et leurs chiffres viennent presque tous de leurs éditeurs.

### GLiNER2.5-Decide

Fastino. Poids ouverts. Un encodeur de la lignée GLiNER publié fin septembre 2026 pour les tâches de décision, avec une variante multilingue (287 millions de paramètres) et une variante 1B.

- Sortie : 23 septembre 2026
- Licence : Apache-2.0
- Taille : 340 millions selon la fiche, 486 millions de paramètres selon l'API Hugging Face
- Langues : Anglais pour la variante principale ; une variante « multi-Decide » est multilingue, sans liste de langues relevée.
- **60,2 %** d'exactitude sur fast-decisions, le banc de l'éditeur (17 domaines, 300 exemples chacun, en anglais), devant JevK5 à 57,6 %. Jev lui-même n'est pas dans ce tableau. _Déclaré par l'éditeur : Fastino, 30 septembre 2026._ https://huggingface.co/datasets/fastino/fast-decisions
- **11,21** d'indice : 54e sur 71 systèmes. _Mesuré par un tiers : Jev Decision Index 0.2.1, 28 septembre 2026._ https://huggingface.co/spaces/multimodalart/jev-decision-index
- Télécharger : [Hugging Face](https://huggingface.co/fastino/GLiNER2.5-Decide)

### GLiNER2 et GLiNER2.5

Fastino. Poids ouverts. Des encodeurs qui repèrent des entités, classent un texte, extraient des champs structurés et des relations en une seule passe. GLiNER2.5 (small, base, multi) date d'août 2026.

- Sortie : juillet 2025
- Licence : Apache-2.0
- **9 à 22** sur l'axe d'exactitude de JevBench, entre la 66e et la 80e place sur 106 : loin derrière les modèles de décision. _Mesuré par un tiers : JevBench v1.5.4, 30 septembre 2026._ https://benchmarkheaven.com/jev-models
- Le code : [GitHub](https://github.com/fastino-ai/GLiNER2)

### GLiClass

Knowledgator. Poids ouverts. Des classifieurs sans exemple : on donne les étiquettes à l'appel, pour de l'intention, du réordonnancement ou de la détection d'hallucination. Des variantes multilingues (edge, mini, ultra) ont suivi en avril 2026.

- Sortie : février 2026
- Licence : Apache-2.0
- **0,7199** de F1 moyen sans exemple, pour le modèle « large ». _Déclaré par l'éditeur : Knowledgator, 30 septembre 2026._ https://huggingface.co/knowledgator/gliclass-instruct-large-v1.0
- Télécharger : [Hugging Face](https://huggingface.co/knowledgator/gliclass-instruct-large-v1.0)

### GLiFormer large-v1

Knowledgator. Poids ouverts. Un encodeur unique pour les entités, la classification, les relations, les enregistrements structurés et la mise en page de PDF.

- Sortie : 11 septembre 2026
- Licence : Apache-2.0
- Taille : 575,6 millions de paramètres ; une version « base » existe
- Langues : Anglais, d'après les métadonnées de la fiche Hugging Face.
- Télécharger : [Hugging Face](https://huggingface.co/knowledgator/gliformer-large-v1)

### GLiNER

Urchade Zaratiana et la communauté. Poids ouverts. Le modèle d'origine de la lignée (gliner_multi-v2.1) : il repère dans un texte les entités dont on lui donne le nom à l'appel.

- Sortie : avril 2024
- Licence : Apache-2.0
- Langues : Multilingue, d'après les métadonnées de la fiche, sans liste de langues.
- Télécharger : [Hugging Face](https://huggingface.co/urchade/gliner_multi-v2.1)

### NuExtract3

NuMind. Poids ouverts. Un extracteur génératif : il remplit un gabarit JSON à partir d'un texte ou d'une image. Il écrit sa réponse, contrairement aux encodeurs de ce groupe.

- Sortie : 29 avril 2026
- Licence : Apache-2.0
- Base : Qwen3.5-4B
- Taille : 4 milliards de paramètres
- À savoir : NuMind annonce un banc d'extraction et un classement ouverts « in the coming weeks » : ils n'étaient pas publiés le 30 septembre 2026.
- Télécharger : [Hugging Face](https://huggingface.co/numind/NuExtract3)

### privacy-filter

OpenAI, États-Unis. Poids ouverts. Un classifieur de jetons qui repère les données personnelles dans un texte, pour les masquer avant un traitement.

- Sortie : 17 avril 2026
- Licence : Apache-2.0
- Taille : 1,4 milliard de paramètres
- Télécharger : [Hugging Face](https://huggingface.co/openai/privacy-filter)

## Les modèles de garde et de modération

Un groupe à part. Ces modèles décident eux aussi, mais d'une seule chose : un contenu est-il acceptable ? Aucun test ne les relie à Jev, et il n'existe pas de classement indépendant à jour de la modération. La seule comparaison récente entre éditeurs est le tableau que Mistral publie sur la fiche de Shieldstral.

### Shieldstral-1.0-3B

Mistral AI, France. Poids ouverts. Un classifieur de sécurité pour le texte et l'image : on lui écrit la règle à appliquer en langage courant, il dit si le contenu la respecte.

- Sortie : 16 juillet 2026
- Licence : Apache-2.0
- Langues : Anglais, français, espagnol, allemand, italien, portugais, néerlandais, chinois, japonais et d'autres.
- À savoir : Le tableau de sa fiche compare Shieldstral à GPT-OSS-Safeguard-20B, Qwen3Guard-8B, Nemotron-3.5, LlamaGuard-4-12B et ShieldGemma-9B. C'est la seule comparaison récente entre éditeurs, et c'est Mistral qui la publie.
- **88,1** de F1 sur WildGuardTest. _Déclaré par l'éditeur : Mistral AI, 30 septembre 2026._ https://huggingface.co/mistralai/Shieldstral-1.0-3B
- **84,1** de F1 sur ToxicChat. _Déclaré par l'éditeur : Mistral AI, 30 septembre 2026._ https://huggingface.co/mistralai/Shieldstral-1.0-3B
- **86,2** de F1 sur Aegis v2. _Déclaré par l'éditeur : Mistral AI, 30 septembre 2026._ https://huggingface.co/mistralai/Shieldstral-1.0-3B
- Télécharger : [Hugging Face](https://huggingface.co/mistralai/Shieldstral-1.0-3B)

### Llama Guard 4

Meta, États-Unis. Poids ouverts. Le modèle de modération de Meta, dans sa version de 12 milliards de paramètres.

- Sortie : avril 2025
- Licence : Licence Llama 4, téléchargement sur demande
- Taille : 12 milliards de paramètres
- Langues : Anglais, d'après les métadonnées de la fiche Hugging Face.
- Télécharger : [Hugging Face](https://huggingface.co/meta-llama/Llama-Guard-4-12B) (sur demande)

### Llama Prompt Guard 2

Meta, États-Unis. Poids ouverts. Deux très petits classifieurs de Meta contre l'injection de requêtes.

- Sortie : avril 2025
- Licence : Licence Llama 4, téléchargement sur demande
- Taille : 86 millions et 22 millions de paramètres
- Langues : Anglais, français, allemand, hindi, italien, portugais, espagnol et thaï, d'après les métadonnées de la fiche Hugging Face.
- Télécharger : [Version 86M](https://huggingface.co/meta-llama/Llama-Prompt-Guard-2-86M) (sur demande)
- Télécharger : [Version 22M](https://huggingface.co/meta-llama/Llama-Prompt-Guard-2-22M) (sur demande)

### ShieldGemma 2

Google, États-Unis. Poids ouverts. Le modèle de modération d'images de Google. Trois ShieldGemma plus anciens (2B, 9B, 27B) datent de juillet 2024.

- Sortie : mars 2025
- Licence : Licence Gemma, téléchargement sur demande
- Taille : 4 milliards de paramètres
- Télécharger : [Hugging Face](https://huggingface.co/google/shieldgemma-2-4b-it) (sur demande)

### Granite Guardian 4.1 8B

IBM, États-Unis. Poids ouverts. Le modèle de garde d'IBM, de la famille Granite, publié sous licence libre.

- Sortie : 16 avril 2026
- Licence : Apache-2.0
- Langues : Anglais, d'après les métadonnées de la fiche Hugging Face.
- Télécharger : [Hugging Face](https://huggingface.co/ibm-granite/granite-guardian-4.1-8b)

### Nemotron-3.5-Content-Safety

NVIDIA, États-Unis. Poids ouverts. Le classifieur de sécurité des contenus de NVIDIA, dans sa gamme Nemotron.

- Sortie : 22 mai 2026
- Licence : OpenMDW
- Langues : Douze langues dont le français, d'après les métadonnées de la fiche Hugging Face.
- Télécharger : [Hugging Face](https://huggingface.co/nvidia/Nemotron-3.5-Content-Safety)

### gpt-oss-safeguard

OpenAI, États-Unis. Poids ouverts. Les modèles de garde ouverts d'OpenAI, en deux tailles (20b et 120b).

- Sortie : septembre 2025
- Licence : Apache-2.0
- Télécharger : [Version 20b](https://huggingface.co/openai/gpt-oss-safeguard-20b)
- Télécharger : [Version 120b](https://huggingface.co/openai/gpt-oss-safeguard-120b)

### Qwen3Guard-Gen-8B

Alibaba, Chine. Poids ouverts. Le modèle de garde de la famille Qwen d'Alibaba.

- Sortie : septembre 2025
- Licence : Apache-2.0
- Télécharger : [Hugging Face](https://huggingface.co/Qwen/Qwen3Guard-Gen-8B)

### gliguard-LLMGuardrails-300M

Fastino. Poids ouverts. Un petit modèle de garde-fous pour modèles de langage, publié par Fastino.

- Sortie : 9 mai 2026
- Licence : Apache-2.0
- Langues : Anglais, d'après les métadonnées de la fiche Hugging Face.
- Télécharger : [Hugging Face](https://huggingface.co/fastino/gliguard-LLMGuardrails-300M)

## Les bancs

### JevBench (v1.5.4, 30 septembre 2026)

- Tenu par : Benchmark Heaven, le projet personnel de Florian Standhartinger (Allemagne), sans lien avec TypeSafe AI
- Il mesure : Quatre axes (exactitude corrigée du hasard, calibration, vitesse, coût), réunis en un score par une moyenne harmonique à poids égaux.
- Protocole : 1 624 décisions par système, dont 720 gardées secrètes. Intervalles calculés par rééchantillonnage (2 000 tirages).
- Limite principale : Sa méthode et son podium bougent encore : la version du 27 septembre 2026 plaçait Imajev-4B premier et Jev quatrième, celle du 30 septembre place Cygnet premier et Jev troisième.
- Autre limite : 220 décisions du niveau difficile ont été écrites par deux modèles de langage, qui se sont relus l'un l'autre.
- Autre limite : La vitesse et le coût des modèles hébergés par leurs auteurs reposent sur des hypothèses.
- Autre limite : Le score composite pénalise les modèles de langage sur la vitesse et le coût : GPT-6 Luna obtient 96,2 en exactitude et finit 35e.
- Autre limite : Les intervalles des dix premiers se recouvrent presque tous.
- Autre limite : Une évaluation prioritaire payante existe (49 ou 99 $), déclarée sans effet sur le score.
- Reprise : non reproductible ici. Le banc est sous licence MIT, mais rien ne couvre explicitement la reprise de ses résultats. Quelle IA attend l'accord écrit de son auteur avant de recopier son tableau.
- Adresse : https://benchmarkheaven.com/jev-models

### Jev Decision Index (0.2.1, 28 septembre 2026)

- Tenu par : multimodalart (Apolinário), dans un espace Hugging Face
- Il mesure : Un indice de 0 à 100, corrigé du hasard, sur 38 bancs publics réécrits en décisions, dans cinq domaines : connaissances, langue, recherche, outils, arts. L'erreur de calibration est donnée à part.
- Protocole : 120 340 requêtes. Jev est interrogé par son API, les 70 reproductions tournent sur une même carte graphique.
- Limite principale : Les reproductions ne répondent qu'à 76 % des requêtes, contre 100 % pour Jev, et une requête sans réponse compte comme fausse : l'avance de Jev tient en partie à cet effet de couverture.
- Autre limite : Les bancs d'origine sont adaptés : les scores ne se comparent pas aux classements dont ils viennent, dit la méthodologie.
- Reprise : non reproductible ici. L'espace ne déclare aucune licence. Quelle IA attend l'accord écrit de son auteur avant de recopier son tableau.
- Adresse : https://huggingface.co/spaces/multimodalart/jev-decision-index

### Jevals (suite 0.1.0, 18 septembre 2026)

- Tenu par : Jevals, dont l'auteur n'est pas nommé sur les pages consultées et qui se dit indépendant de TypeSafe AI
- Il mesure : Un « Decision Score » par épreuve, mesuré contre des étiquettes humaines : 100 pour un sans-faute, 0 pour qui devinerait d'après la fréquence des réponses. S'y ajoutent la calibration, le coût et la latence.
- Protocole : Trois épreuves de 300 questions : Jev et six modèles de langage, plus un témoin qui devine.
- Limite principale : Un seul modèle de décision y figure. Jevals situe Jev face à des modèles de langage et ne dit rien encore des reproductions ouvertes, annoncées dans sa rubrique « Coming next ».
- Reprise : reproductible. Les données sont sous licence CC BY 4.0, déclarée dans le dépôt et au pied du site.
- Adresse : https://jevals.com

Ces bancs ne sont pas d'accord entre eux. Sur JevBench v1.5.4, Cygnet est premier avec 73,7 et Jev troisième avec 72,1. Sur le Jev Decision Index 0.2.1, Jev est premier avec 57,91 et Cygnet n'y figure pas. Quelle IA cite ces chiffres avec leur source et ne recopie pas leurs tableaux, faute d'accord de leurs auteurs.

### Le tableau de Jevals

Source : Jevals (jevals.com), version du 18 septembre 2026, suite 0.1.0. CC BY 4.0. https://jevals.com · données : https://raw.githubusercontent.com/Jevals/jevals-data/HEAD/releases/2026-09-18/board.json · licence : https://creativecommons.org/licenses/by/4.0/deed.fr

| Modèle | Éditeur | PubMedQA (oui ou non) | Banking77 (choix parmi 77 intentions) | HelpSteer2 (note d'utilité) |
| --- | --- | --- | --- | --- |
| Jev | TypeSafe AI | 69,0 (de 59,8 à 76,5) | 67,8 (de 61,3 à 74,5) | 9,2 (de −4,4 à 21,0) |
| DeepSeek V4.1 Flash | DeepSeek | 47,5 (de 34,7 à 59,1) | 63,9 (de 58,5 à 69,6) | −19,0 (de −36,0 à −3,3) |
| Gemini 3.8 Flash | Google | 73,0 (de 62,1 à 82,2) | 74,1 (de 68,4 à 79,8) | 4,6 (de −12,2 à 19,0) |
| GLM-5.3 | Z.ai | 60,6 (de 50,0 à 69,8) | 66,8 (de 62,0 à 71,7) | 7,8 (de −4,6 à 18,6) |
| Mercury 2.5 | Inception | 55,7 (de 44,8 à 65,4) | 54,0 (de 47,8 à 60,6) | −5,5 (de −16,2 à 4,0) |
| Mistral Medium 3.5 | Mistral AI | 58,0 (de 45,3 à 69,8) | 59,5 (de 54,3 à 64,8) | −13,7 (de −28,3 à −0,1) |
| Qwen3.8 Flash | Alibaba | 62,4 (de 50,9 à 72,5) | 62,4 (de 55,9 à 68,9) | −1,4 (de −15,4 à 11,5) |

Decision Score : 100 pour un sans-faute, 0 pour qui devinerait d'après la fréquence des réponses. La bande couvre l'intervalle publié par Jevals, le trait marque le score. Sous chaque score : la latence médiane et le coût des 1 000 décisions, en dollars. En orange, un intervalle qui contient zéro : rien n'établit alors que le modèle fait mieux que deviner. Jev d'abord, puis l'ordre alphabétique : ce tableau situe Jev face à six modèles de langage, sans classer personne.

## Pourquoi pas de classement, et quand il viendra

- **Des bancs trop jeunes.** Les deux bancs tiers qui couvrent les mêmes modèles, JevBench et le Jev Decision Index, avaient entre huit et treize jours le 30 septembre 2026.
- **Deux podiums différents.** JevBench place Cygnet premier et Jev troisième. Le Decision Index place Jev premier et ne contient pas Cygnet.
- **Une méthode qui change.** JevBench a changé de barème et de podium entre le 27 et le 30 septembre 2026. Un score hebdomadaire refléterait ces changements autant que les modèles.
- **Des chiffres d'éditeur invérifiables.** TypeSafe mesure Jev contre une référence faite par deux modèles de langage et refuse les bancs publics : « Put no weight on public benchmarks ».

Quelle IA ouvrira un classement quand quatre conditions seront réunies :

1. **Trois sources indépendantes.** Trois bancs tenus par des auteurs différents, qui mesurent au moins huit à dix modèles en commun. Aujourd'hui : Deux seulement : JevBench et le Decision Index. Jevals deviendrait le troisième s'il ajoute les reproductions ouvertes, comme il l'annonce.
2. **Quatre semaines de stabilité.** La même méthode et les mêmes identifiants de modèles d'une semaine à l'autre. Aujourd'hui : JevBench a changé de méthode en trois jours. Il publie un journal de ses révisions, ce qui permettra de le vérifier.
3. **Une part de vérité humaine.** Des étiquettes posées par des humains dans chaque source retenue, ou au moins une source qui n'utilise qu'elles. Aujourd'hui : Seuls Jevals, la suite de Bespoke Labs et des articles de recherche s'appuient sur des étiquettes humaines, et ils comparent Jev à des modèles de langage ou à un seul concurrent.
4. **L'accord écrit des auteurs.** L'autorisation de Benchmark Heaven et de multimodalart de reprendre leurs lignes, avec attribution. Aujourd'hui : Pas encore obtenu. Seul Jevals, sous licence CC BY 4.0, se reprend sans demander.

- N'entreront au classement que les modèles qui respectent le contrat de la famille : un texte, des questions fermées, des probabilités en retour. Les modèles de langage y figureront comme repères, hors classement.
- Un test en français, même petit, fera partie du score. Aucun banc ne mesure le français aujourd'hui.

## En bref

### Qu'est-ce que Jev ?

Jev est un modèle de décision publié par TypeSafe AI (États-Unis) le 15 septembre 2026, en accès anticipé. Jev reçoit un texte et une liste de questions fermées, et rend pour chacune un choix, une note ou un oui/non avec sa probabilité. Il ne rédige aucun texte. Ses poids ne sont pas publiés : il s'utilise par une API, au prix déclaré de 0,042 $ par million de jetons d'entrée. TypeSafe appelle cette famille « System One ».

### Jev est-il meilleur que Claude ?

Sur l'exactitude, les mesures de tiers disponibles au 30 septembre 2026 disent que non. Sur jev-frontier-bench, Jev obtient 72,5 % d'exactitude sur 200 décisions (intervalle de 66,0 à 78,5), contre 84,0 % pour Claude Fable 5.1 et 79,0 % pour GPT-6 Astra. Sur le banc de l'éditeur lui-même, Jev (67,8 % d'accord) fait jeu égal avec « sonnet 5 » et reste derrière « opus 5 » (73,1 %). Jev est en revanche bien plus rapide et moins cher : TypeSafe annonce 70 à 500 ms de temps de réponse, et quatre bancs tiers mesurent une latence médiane de 0,43 à 0,71 s. Ces mesures portent sur de petits jeux de décisions en anglais.

### Jev est-il vraiment 193 fois plus rapide ?

Le « 193,6 fois plus rapide, 444,6 fois moins cher » de TypeSafe vient de son propre banc et réunit deux rapports pris sur deux modèles différents : ×195 en temps face à « sonnet 5 », l'un des plus lents du banc, et ×440 en coût face à « opus 5 », le plus cher. Face à « luna » (OpenAI), le modèle de langage d'exactitude comparable le moins cher, l'écart tombe à ×32 en temps et ×8 en coût. La référence de ce banc est faite des réponses de deux modèles de langage, sans étiquette humaine, et l'éditeur écrit lui-même que ces multiplicateurs sont « on the higher end of real world gains ».

### Existe-t-il des alternatives ouvertes à Jev ?

Oui. Quelle IA en recense 14 au 30 septembre 2026, dont Cygnet (blockbrain), Winnow-12B (EldanRing), JevK5 (alibiserikbay), decider-2b, decider-4b (Mapika) et Bespoke-Nimble-9B (Bespoke Labs). La plupart partent d'un petit modèle ouvert, Qwen3.5 ou Gemma 4, dont on lit les probabilités sur les options. Sur JevBench v1.5.4, Cygnet obtient 73,7 de score composite, devant Jev (72,1), mais leurs intervalles se recouvrent, et l'autre banc tiers, le Jev Decision Index, place Jev premier.

### Jev comprend-il le français ?

Rien ne le montre aujourd'hui. TypeSafe écrit que l'anglais est la langue principale d'entraînement de Jev, que les autres langues sont « handled but not equally well », et ne cite pas le français. Au 30 septembre 2026, la suite publique de Bespoke Labs mesure 86,9 % en allemand, contre 87,4 % en anglais, sur les mêmes 350 requêtes du jeu MASSIVE. C'est la seule mesure hors de l'anglais trouvée. Aucune mesure en français n'existe. Parmi les modèles voisins, Shieldstral-1.0-3B, Llama Prompt Guard 2 et Nemotron-3.5-Content-Safety citent le français dans leurs langues.

### Pourquoi Quelle IA ne classe-t-il pas les modèles de décision ?

Parce que la matière manque encore pour un classement honnête. Les deux bancs tiers qui couvrent les mêmes modèles, JevBench et le Jev Decision Index, avaient entre huit et treize jours le 30 septembre 2026. JevBench place Cygnet premier et Jev troisième. Le Decision Index place Jev premier et ne contient pas Cygnet. JevBench a changé de barème et de podium entre le 27 et le 30 septembre 2026. Un score hebdomadaire refléterait ces changements autant que les modèles. Quelle IA ouvrira un classement quand quatre conditions seront réunies : trois sources indépendantes, quatre semaines de stabilité, une part de vérité humaine et l'accord écrit des auteurs.
