StartHub accompagne les dirigeants à chaque étape du développement de leur entreprise en réunissant stratégie, expertise et les meilleurs partenaires autour de leurs projets.

Contact
Téléphone +352 27 04 82 37
Adresse 16 Zone d'Activités Economiques L-8287 Kehlen
Suivez-nous
Contact
Téléphone +352 27 04 82 37
Adresse 16 Zone d'Activités Economiques L-8287 Kehlen
Suivez-nous

Les analyses StartHub

Jev de TypeSafe : comprendre l’IA de décision de Diogo Almeida

Jev de TypeSafe : comprendre l’IA de décision de Diogo Almeida

Rédigé par
Starthub team
Publication
28 Septembre 2026
Catégorie
IA

11 minutes de lecture environ

Classer une demande, repérer une urgence ou choisir une étape de traitement ne nécessite pas toujours de générer un texte. Jev, le modèle présenté par Diogo Almeida chez TypeSafe, vise ces décisions courtes que les logiciels doivent prendre à partir d’informations parfois ambiguës. Son intérêt se comprend en séparant trois sujets : le format de la réponse, la qualité du jugement et la règle qui autorise une action.

Le conseil StartHub

Évaluez Jev sur une décision limitée, avec des exemples métier annotés et une possibilité de revue. Une sortie correctement typée facilite l’intégration ; elle ne garantit pas que le choix soit juste.

Dans cet article

Jev : une fonction de décision plutôt qu’un assistant de rédaction

TypeSafe a annoncé Jev le 15 septembre 2026 dans une publication signée par son fondateur Diogo Almeida. L’entreprise le présente comme un modèle « System One », conçu pour fournir des décisions structurées directement utilisables dans du code. Ce terme désigne ici le positionnement de TypeSafe, pas une certification de capacité cognitive.

L’application transmet une situation et des questions dont les réponses possibles sont définies. Jev retourne des valeurs et des probabilités, sans rédiger une explication libre. Il peut donc servir dans un parcours qui doit choisir une branche, classer ou noter. La rédaction d’un courrier et la synthèse ouverte restent des besoins différents.

L’intérêt pour une startup est de mieux répartir le travail : règles exactes dans le logiciel, jugement sémantique dans un modèle, validation humaine lorsque la situation l’exige. Cette répartition est plus utile qu’une recherche d’autonomie maximale pour toutes les tâches.

Pour approfondir : TypeSafe — annonce de Jev par Diogo Almeida, 15 septembre 2026 TypeSafe — fonctionnement général de Jev

Ce qui entre dans le modèle : un état et des questions

Le contrat de l’API comporte notamment trois champs : model désigne la version, state contient les données à examiner et questions décrit les jugements demandés. L’appel passe par POST https://api.typesafe.ai/v1/systemone. Le résultat regroupe les réponses sous les identifiants choisis par le développeur.

Un état peut réunir le message reçu, quelques attributs du dossier et une règle métier utile. Il faut distinguer ce qui est affirmé par l’utilisateur de ce qui est confirmé par le système. Un client disant « j’ai payé deux fois » apporte un signal ; les opérations enregistrées apportent une autre preuve.

Dans notre exemple de support, trois questions séparées seront plus faciles à contrôler qu’une instruction générale « traite correctement ce client » : quelle équipe doit examiner le message, exprime-t-il une demande de remboursement et quel niveau d’urgence décrit-il ? Le logiciel décide ensuite comment combiner ces informations.

Pour approfondir : TypeSafe — référence de l’API

Choice, Score et Noul : trois réponses à ne pas confondre

Choice sélectionne une option dans une liste et fournit sa distribution de probabilités ainsi qu’un champ confidence. Il convient à une catégorie : facturation, incident technique ou autre demande. Une option « autre » évite de forcer tous les cas dans une liste incomplète.

Score situe l’entrée sur des niveaux ordonnés, explicitement décrits. Le résultat peut se placer entre deux niveaux. Noul répond à une proposition oui/non par une valeur de 0 à 1 représentant la probabilité du oui ; il ne fournit pas de champ confidence séparé.

La différence est pratique : « le message demande-t-il un remboursement ? » et « quel est le degré de frustration ? » ne demandent pas la même mesure. Une probabilité de 0,5 pour la première ne représente pas une demande de remboursement « moyenne ». Elle indique une incertitude sur la proposition évaluée.

Pour approfondir : TypeSafe — Choice, Score et Noul

Choisir le type de question
PrimitiveQuestion métierRésultat à interpréter
ChoiceQuelle équipe doit examiner ce message ?Une option, sa distribution et confidence
ScoreÀ quel niveau d’urgence décrit correspond-il ?Une position sur des niveaux définis
NoulLe client demande-t-il explicitement un remboursement ?La probabilité du oui, sans confidence séparée

Réponses parallèles : organiser les dépendances dans le logiciel

Selon la documentation, plusieurs questions peuvent être évaluées dans un même appel, contre le même état, indépendamment les unes des autres. L’une ne reçoit donc pas automatiquement la réponse de l’autre. Cette propriété permet de regrouper des jugements, mais impose de rendre les dépendances explicites.

Si une première décision sert à charger des données absentes, le second appel doit attendre ces données. En revanche, lorsque toutes les questions portent sur le même message déjà disponible, il est possible de les poser ensemble et de sélectionner ensuite les résultats utiles.

Ne multipliez pas les questions simplement parce qu’elles peuvent être regroupées. Chacune doit avoir un rôle dans la décision finale. Pour une application maintenable, conservez un lien entre question, règle de traitement et test associé : vous saurez quoi réévaluer lorsqu’une formulation change.

Pour approfondir : TypeSafe — fonctionnement général de Jev TypeSafe — Choice, Score et Noul

RLCD et calibration : que signifie une probabilité fiable ?

TypeSafe nomme sa méthode d’entraînement Reinforcement Learning for Calibrated Decisions, ou RLCD. L’objectif annoncé porte sur des décisions dont les probabilités sont calibrées. Les documents consultés décrivent cette orientation ; ils ne permettent pas de reconstituer à eux seuls toute la recette d’entraînement et les paramètres internes.

La calibration est une propriété mesurée sur des ensembles de prédictions. Exemple pédagogique : parmi de nombreux événements auxquels un système attribue une probabilité proche de 0,8, on attend une fréquence de réalisation proche de 80 % si le système est bien calibré pour ce contexte. Cela ne permet pas de savoir avec certitude lequel des cas individuels sera faux.

Une probabilité produite sur des messages anglais ne prouve pas la même qualité sur des courriels français mêlés de vocabulaire métier. Vérifiez la calibration sur votre distribution de données, avec des observations suffisantes et une référence fiable. Une évolution du public ou des formulations peut modifier les résultats.

Pour approfondir : TypeSafe — apprentissage et décisions calibrées

Le champ confidence n’est pas un taux de réussite individuel

La documentation définit confidence comme une statistique dérivée de la distribution des probabilités pour Choice et Score. Elle résume la concentration du résultat. Ce champ ne doit donc pas être automatiquement lu comme « cette réponse a exactement cette chance d’être correcte ».

Une distribution très concentrée peut accompagner une erreur si le modèle interprète mal la situation. Inversement, une ambiguïté réelle peut justifier plusieurs réponses proches. Conservez la distribution lorsque son examen aide au diagnostic, plutôt que de ne journaliser que l’option retenue.

Votre seuil doit être associé à une question, une version et une action. Une règle acceptable pour ranger un message dans une file peut être insuffisante pour déclencher un remboursement. Mesurez le taux d’erreur parmi les cas effectivement automatisés et le volume envoyé en revue ; ces deux résultats montrent le compromis opérationnel.

Pour approfondir : TypeSafe — différence entre probabilité et confidence

« Sans hallucination » ne veut pas dire « sans erreur »

La promesse de TypeSafe sur l’absence d’erreurs de type concerne l’espace de sortie : une réponse doit respecter les possibilités et la structure prévues. Ce contrat réduit une classe de problèmes d’intégration. Il n’établit pas que le choix sélectionné corresponde à la réalité.

Avec les catégories « facture », « technique » et « autre », Jev peut produire une catégorie autorisée mais inappropriée. Les systèmes doivent donc continuer à gérer erreurs métier, indisponibilité, autorisations et données manquantes. Un contrat de sortie borné ne rend pas tout le processus infaillible.

Les modèles génératifs disposent eux aussi de mécanismes de sortie structurée. La comparaison utile ne consiste pas à opposer systématiquement un Jev bien encadré à un chatbot sans contrainte. Elle doit porter sur qualité, probabilités, latence et coût à tâche et protocole comparables.

Pour approfondir : TypeSafe — annonce de Jev par Diogo Almeida, 15 septembre 2026

Cas pratique : orienter des tickets sans déléguer le remboursement

Scénario entièrement fictif : un SaaS reçoit le message « Ma facture semble avoir été débitée deux fois ; pouvez-vous vérifier ? ». L’application envoie le message et les informations strictement nécessaires. Elle demande une catégorie et la présence d’une demande explicite de remboursement.

Supposons, uniquement pour illustrer la lecture, que Choice renvoie les probabilités suivantes : facturation 0,86, technique 0,09, autre 0,05. La somme vaut 1. Le message peut être candidat à la file facturation, selon un seuil préalablement validé. Ces nombres ne sont pas une réponse mesurée de Jev.

La décision financière reste séparée. Le logiciel rapproche les transactions et les droits du demandeur ; une personne valide les situations prévues par la procédure. Un classement plausible ne démontre ni l’existence du double débit ni l’autorisation de rembourser. Si l’API échoue, le ticket rejoint une file de reprise au lieu de disparaître.

Du ticket reçu à l’action autorisée
  1. PréparerSélectionner le message et les données utiles, avec les accès autorisés.
  2. ÉvaluerDemander les jugements typés et conserver leurs probabilités.
  3. ContrôlerAppliquer les seuils validés et les règles exactes du métier.
  4. OrienterTraiter le cas autorisé ou l’envoyer en revue, avec une trace.

Intégrer Jev : version, erreurs et traçabilité

Une intégration serveur conserve la clé API hors du navigateur, limite le temps d’attente et traite les réponses d’erreur. La référence HTTP décrit le contrat ; l’application doit prévoir sa propre stratégie de reprise, de limitation des appels et de suivi des échecs.

La documentation distingue les alias comme jev-latest des identifiants versionnés. Un alias peut évoluer ; la réponse indique la version ayant traité l’appel. Pour comparer des résultats, conservez version, questions, critères et référence du jeu de données. Évitez de recopier tout le contenu sensible dans les journaux par facilité.

Lorsqu’une décision déclenche une opération, vérifiez à nouveau les autorisations et l’état du dossier au moment de l’exécution. L’idempotence aide à éviter un effet répété après une reprise réseau. Le modèle propose un jugement ; le code garde la responsabilité des transitions autorisées et de leur traçabilité.

Pour approfondir : TypeSafe — référence de l’API TypeSafe — modèles, prix, langues et versions

Performances, prix et résultats de recherche : lire le périmètre

Au 28 septembre 2026, la page Models affiche pour Jev 1.13 un prix de 0,042 dollar par million de tokens entrants, avec sorties non facturées. Calcul fictif : 100 000 appels de 1 000 tokens entrants représentent 100 millions de tokens, soit 4,20 dollars selon ce tarif, hors autres services et coût d’exploitation.

Ce montant ne chiffre ni préparation, ni reprises, ni validation humaine. Mesurez aussi le temps complet depuis votre infrastructure. Une latence observée ailleurs ne représente pas nécessairement celle de vos utilisateurs au Luxembourg.

La prépublication Just Ask Jev, déposée le 24 septembre 2026, étudie la détection de plusieurs formes d’échec d’alignement. Les auteurs rapportent une AUROC médiane de 0,886 dans l’un de leurs protocoles. L’AUROC mesure une capacité de classement sur différents seuils : ce nombre ne signifie pas « 88,6 % de réponses correctes », ni une calibration validée pour votre entreprise. La prépublication apporte un résultat à examiner dans son périmètre, sans valider tous les usages.

Pour approfondir : TypeSafe — modèles, prix, langues et versions Guo et al. — Just Ask Jev, prépublication du 24 septembre 2026

Limites à tester, notamment pour un usage au Luxembourg

TypeSafe documente pour Jev 1.13 des difficultés en calcul précis, comparaison de dates, raisonnements indirects et contextes chargés d’informations inutiles. Les contenus adverses peuvent également influencer les réponses. Conservez les calculs exacts et les contrôles de permissions dans du code déterministe ; une sortie typée n’empêche pas une mauvaise interprétation provoquée par un texte.

La page Models précise que l’entrée est textuelle et que l’anglais est la langue la mieux prise en charge. Pour des demandes en français ou en luxembourgeois, préparez un test distinct avec des formulations locales et des messages mêlant plusieurs langues. Ne déduisez pas leur performance de démonstrations anglophones.

Examinez enfin les données autorisées à sortir de votre système, le contrat et les conditions du service réellement utilisé. Le protocole de test peut commencer sur des exemples fictifs ou des données adaptées, avant tout usage de dossiers réels.

Pour approfondir : TypeSafe — limites connues de Jev 1.13 TypeSafe — modèles, prix, langues et versions

Un pilote qui permet de décider

Constituez un jeu de référence avec cas ordinaires, catégories rares, demandes incomplètes et tentatives de manipulation. Faites annoter les exemples par des personnes compétentes, avec une règle pour résoudre les désaccords. Séparez les données de réglage des données d’évaluation finale.

Comparez Jev à une règle simple et, si pertinent, à un modèle génératif configuré pour la même décision. Suivez précision par classe, rappel des cas critiques, calibration, taux d’automatisation, temps de revue et latence au 95e percentile. Cette dernière indique un délai sous lequel se terminent 95 % des appels observés, dans votre test.

Commencez en mode observation : la proposition est enregistrée, mais ne modifie pas le traitement réel. Ouvrez ensuite une action réversible sur un périmètre limité si les critères sont satisfaits. Une baisse du nombre de tickets revus n’est un progrès que si les erreurs acceptées restent compatibles avec le service promis.

Votre plan d’action

  1. Définir une décision limitée et ses conséquences.
  2. Préparer un jeu annoté en français et dans les langues réellement utilisées.
  3. Mesurer erreurs et calibration avant de fixer les seuils.
  4. Tester indisponibilité, ambiguïtés et tentatives de manipulation.
  5. Déployer d’abord en observation, puis sur une action réversible.

Sources et références

Notions utiles dans le lexique

40.

Évaluation & qualité

Rappel

Mesure de la proportion d’éléments positifs de la référence effectivement retrouvés par le système.

88.

Données & architecture

Traçabilité

Capacité à retrouver l’origine, les transformations et les décisions associées à une information ou une opération.

89.

Données & architecture

API

Interface définissant comment un logiciel peut demander des informations ou des actions à un autre composant.

151.

Inférence & performance

Latence

La latence est le temps écoulé entre une action ou une requête et le résultat mesuré à un point défini.

Évaluez Jev sur une décision utile à votre activité.

Vous souhaitez utiliser Jev pour classer des demandes, orienter un workflow ou contrôler des réponses IA ? Contactez StartHub pour vous faire accompagner dans le cadrage du cas d’usage, le protocole d’évaluation et une intégration adaptée à vos contraintes.

Contacter StartHub

Mots-clés

Bâtissons l'avenir ensemble.

Vous pouvez modifier votre choix à tout moment depuis « Gérer les cookies » en bas de page.

Votre choix est conservé pendant six mois dans ce navigateur. Aucun outil publicitaire n’est installé. La mesure d’audience est facultative.

Détails sur les cookies

Rechercher sur le site

Saisissez au moins deux caractères.