Bokul Creatives - stock.adobe.co
Jev, le modèle de décision pensé pour accélérer l’IA agentique (et en réduire les coûts)
Jev, de TypeSafe AI, offre aux développeurs une alternative rapide et peu chère aux modèles de raisonnement polyvalents pour les tâches de routage et de prise de décision typée dans les flux de travail agentiques. Un modèle « cohérent », mais non déterministe.
Un nouveau modèle décisionnel lancé ce mois-ci suscite l’intérêt des développeurs confrontés à des défis en matière de coûts et de gouvernance liés à l’IA.
TypeSafe AI, qui est sortie de l’anonymat le 15 septembre, a publié ce même jour le modèle propriétaire « Jev ». Contrairement à un LLM qui génère du texte, Jev est conçu pour la prise de décision structurée au sein d’un logiciel. À partir d’une question en langage naturel et des états, il ne peut renvoyer que des valeurs de « noul » (une réponse positive ou négative associée à un degré de confiance), des scores (selon une grille d’évaluation) et des choix (questions à choix multiples). Bien que moins puissants qu’un grand modèle de langage (LLM) à part entière, les modèles décisionnels permettent de prendre des décisions rapides que les développeurs peuvent utiliser pour guider la prise de décision des LLM.
Qu’est-ce que Jev ?
En clair, Jev est un modèle de classification qui génère uniquement des valeurs typées, des scores de confiance et des probabilités au format JSON. La startup ne précise pas si elle s’appuie sur les fondations d’un Transformer, mais indique que Jev est « ni petit ni un LLM ». Le système est doté d’un échantillonneur qui parallélise les traitements, tandis que la méthode d’entraînement utilisée est nommée « apprentissage par renforcement pour décisions calibrées » (Reinforcement Learning for Calibrated Decisions ou RLCD). Il est toutefois entraîné pour effectuer des appels de fonction.
Le fondateur de TypeSafe est Diogo Almeida, un ancien chercheur chez OpenAI qui a co-rédigé en 2022 un article établissant l’apprentissage par renforcement à partir du retour d’information humain comme une méthode clé pour l’entraînement des LLM. Dans un billet de blog publié le 15 septembre, Diogo Almeida décrit Jev comme un modèle de « Système 1 », empruntant ainsi un concept de traitement cognitif tiré de l’ouvrage de Daniel Kahneman, « Système 1/Système 2 : les deux vitesses de la pensée ».
Les décisions du Système 1 sont réflexives et immédiates, explique Ned Bellavance, fondateur et formateur technique chez Ned in the Cloud.
À l’inverse, les grands modèles de raisonnement à usage général relèvent du Système 2 ; ils sont plus prolixes et non déterministes. C’est par exemple le cœur du moteur Atlas de Salesforce.
« Les décisions du Système 2 sont délibérées et réfléchies », poursuit Ned Bellavance. « Quelle est la meilleure façon d’aborder cette situation ? Que penses-tu vraiment de la couleur bleue ? Qu’est-ce que la vie ? »
Les résultats structurés de Jev pourraient offrir une alternative plus rapide et plus efficace aux développeurs qui intègrent dans leurs applications des LLM génériques, gourmands en ressources, pour guider leurs décisions, explique Ned Bellavance.
Mise en place de garde-fou, routage des demandes vers des LLM, linting sémantique, détection de fraudes, classification des intentions, reclassement de résultats dans un mécanisme RAG, extraction de données, etc. Les cas d’usage sont nombreux, selon TypeSafe.
« Il faut considérer les interactions avec Jev davantage comme une fonction que vous ajouteriez à un programme ou à une routine d’automatisation, et non comme quelque chose qui tiendrait une conversation ou écrirait du code à votre place », nuance le formateur « Si vous avez besoin de classer, de noter ou d’obtenir une décision par oui ou par non sur un sujet, Jev est la solution idéale ».
« Jev répond à deux problèmes courants liés à l’IA en entreprise », Affirme Torsten Volk, analyste chez Omdia, une division d’Informa TechTarget [également propriétaire du MagIT] « Premièrement, l’absence de résultats déterministes, et deuxièmement, le coût des tokens ».
D’autres dépôts populaires sur GitHub se sont attaqués au problème des coûts liés à la verbosité inutile des LLM en utilisant des compétences (skills) Claude personnalisées, telles que « ponytail » et « caveman ». Mais l’attrait de Jev tient également au fait qu’il utilise un modèle distinct qui ne nécessite pas de préentraînement, contrairement à certains autres modèles décisionnels, note Laurie Voss, responsable des relations avec les développeurs chez Arize, l’éditeur d’une plateforme d’observabilité dédiée à l’IA, dans un e-mail adressé à TechTarget.
« Depuis des années, les entreprises affinent de petits modèles pour en faire des modèles de classification et fournissent des décisions à moindre coût et rapidement », affirme Laurie Voss. « La grande avancée, c’est que Jev ne nécessite aucun préentraînement pour y parvenir, juste un prompt. Cela facilite considérablement son adoption, en particulier pour une toute nouvelle application qui ne dispose d’aucune donnée d’entraînement à utiliser. C’est également incroyablement bon marché ».
Selon l’article de blog publié par Diogo Almeida, Jev sera facturé 0,042 dollar par million de tokens en entrée et 0,00 dollar en sortie (le coût serait tellement faible qu’il est trop complexe à mesurer, argue-t-il dans une vidéo). À titre de comparaison, Claude Fable 5.1 coûte 10 dollars par million de tokens en entrée et 50 dollars pour le même volume en sortie.
Les premiers signes indiquent que Jev commence à susciter l’intérêt des développeurs. Il est déjà intégré dans le framework LangChain. Vercel, une plateforme de développement et d’hébergement d’applications Web qui propose Jev gratuitement dans le cadre de son AI Gateway jusqu’au 25 septembre, a indiqué que 13 % de ses utilisateurs payants de l’AI Gateway utilisaient Jev dans les 24 heures suivant son lancement. Cela représente deux fois plus d’équipes que lors du lancement de n’importe quel modèle précédent, selon un article publié sur le blog de l’entreprise.
Jev pourrait inciter à la refonte des applications d’IA
Jev ne remplace pas nécessairement les grands modèles de langage que les applications existantes utilisent pour prendre des décisions, acheminer les requêtes et générer des réponses, rappelle Laurie Voss. Jev ne prend en charge que les étapes de prise de décision et d’acheminement de ce flux de travail, mais de manière suffisamment rapide et économique pour inciter les développeurs à repenser l’architecture de leurs applications afin de l’utiliser, ajoute-t-il.
« [Cela signifie] qu’il faut séparer les tâches de prise de décision, d’acheminement et de classification de la génération de texte, en laissant aux LLM uniquement cette dernière tâche, et en confiant tout le reste à Jev », clarifie-t-il. « Il en résulte une application potentiellement beaucoup plus rapide, dont l’exploitation est également, heureusement, bien moins coûteuse ».
Cette rapidité pourrait rendre certaines applications en temps réel plus pratiques qu’elles ne l’auraient été avec des LLM, selon Ned Bellevance.
« Jev sera plus rapide et probablement plus performant pour ces décisions de type “Système 1” qui apparaissent dans l’automatisation et la programmation », affirme-t-il.
Jev peut parcourir des boucles de décision complètes, composées de plusieurs questions et d’états mis à jour, à raison de 10 fois par seconde, alors qu’un LLM aurait besoin de plusieurs secondes, affirme Torsten Volk.
« Difficile de dire combien de temps exactement, mais même si cela ne prenait qu’une seule seconde, Jev serait déjà 10 fois plus rapide », envisage l’analyste. « C’est un moyen ultrarapide de traiter des flux de travail très complexes qui incluent de multiples arbres de décision et facteurs contextuels. »
Pour les entreprises, des modèles tels que Jev pourraient servir de base au traitement en temps quasi réel des données de capteurs dans les microcontrôleurs en périphérie, au service client ou aux flux de travail d’analyse de contenu.
« Chaque matin [je demande à Fable de passer en revue] toutes les actualités technologiques pour déterminer si elles sont pertinentes et datent de moins de 24 heures », illustre l’analyste. « Avec Jev, on pourrait gagner en efficacité. Si l’information n’est pas pertinente, il s’arrête et ne consomme pas davantage de tokens. Si elle est pertinente, il transmet [le flux de travail] à Fable pour qu’il réponde à mes questions habituelles ».
La vitesse au détriment de l’explicabilité ?
Selon M. Bellevance, l’utilisation d’un modèle décisionnel au sein d’une application d’IA pourrait potentiellement privilégier la vitesse au détriment de l’explicabilité. Les grands modèles de langage produisent des réponses qui expliquent en détail leur « raisonnement », ce qui peut augmenter les coûts d’utilisation, mais permet également des audits et des évaluations par des humains.
À noter que les fournisseurs de LLM remarquent que ces cheminements de pensées sont moins explicables que par le passé. Une grande partie du raisonnement du modèle demeure enfermé dans les poids activés.
« Jev fournit effectivement un niveau de confiance pour ses réponses, ce qui est appréciable », déclare-t-il. « Mais il ne dispose pas d’un processus de réflexion qui permet de mûrir un problème pendant un certain temps. Pour les flux de travail impliquant une intervention humaine, on continuera à utiliser un LLM ».
Il existe également des éléments non déterministes dans Jev, selon Ned Bellevance. Son format est déterministe, mais son contenu ne l’est pas. En d’autres termes, le modèle renvoie un « oui » accompagné d’un intervalle de confiance, mais rien ne garantit que la réponse ou le score produits seront identiques lors d’une exécution ultérieure.
« Je considère cela comme une catégorie à part qui pourrait supplanter les grands modèles de langage (LLM) dans les flux de travail d’automatisation », avance-t-il. « Cependant […] si vous avez besoin d’un flux déterministe, Jev ne vous l’offrira pas ».
TypeSafe confirme les dires de Ned Bellevance.
« Jev garantit la forme de ses réponses, mais pas l’exactitude de chaque décision. Si vous lui fournissez une liste de catégories, il ne peut pas inventer de catégorie en dehors de cette liste, mais il peut choisir la mauvaise. L’incertitude fait partie intégrante du système ! », assure la startup dans sa FAQ. « Vous pouvez utiliser les probabilités et les niveaux de confiance fournis par Jev pour définir le seuil à partir duquel votre logiciel agit de manière autonome et celui à partir duquel il nécessite une vérification supplémentaire », poursuit-elle. « Un seuil plus élevé pour les décisions à enjeux importants, et un seuil plus bas lorsque les erreurs sont moins coûteuses ».
Jev n’est pas déterministe, mais est entraîné pour être cohérent, ajoute TypeSafe. « Nous définissons la cohérence comme le fait de prendre des décisions similaires lorsque le sens reste le même, même si la formulation change. Jev est conçu pour garantir cette cohérence ».
Malgré ces éventuels compromis, les premiers utilisateurs ont de bonnes raisons de se précipiter sur cette version, considère Laurie Voss.
« Je m’attends à ce que les principaux laboratoires d’IA publient très, très rapidement des modèles décisionnels, et Jev devra alors rivaliser avec des versions de pointe de lui-même et probablement se battre sur les prix », estime le responsable des relations avec les développeurs chez Arize. « Une fois que l’idée sera répandue, TypeSafe se rendra compte qu’elle ne dispose pas d’un avantage concurrentiel aussi important ».
Cet article est une adaptation d’un article écrit en anglais par Ben Lutkevich, publié sur un des sites Web de TechTarget.
