Il y a deux façons de se tromper sur le coût d'une Workforce IA. La première consiste à tout faire passer par le modèle le plus performant disponible, en partant du principe que c'est de l'intelligence que l'on achète et qu'elle doit être de la meilleure qualité possible. La seconde consiste à basculer vers un modèle moins cher dès que la facture devient inconfortable, à écouter quelques appels témoins, à juger que le résultat semble correct, et à passer à autre chose.
Les deux relèvent de l'intuition. La première fait payer trop cher un travail qui n'avait jamais vraiment besoin d'un raisonnement de pointe ; la seconde sacrifie discrètement un chiffre d'affaires que personne n'a mesuré, en échange d'économies plus faciles à constater. Dans les deux cas, l'équipe ignore ce que coûte une conversation, et ce que le prochain euro dépensé sur un modèle rapporte réellement en valeur incrémentale.
La bonne question n'est pas « comment dépenser moins sur les modèles », mais « quelle est la configuration la moins chère qui produit encore les résultats sur lesquels nous sommes évalués ».
Dans cet article, nous passons en revue les trois principaux leviers de la plateforme HappyRobot qui permettent de répondre à cette question de manière mesurable. Premièrement, une couche déterministe retire complètement le modèle de la boucle là où le travail n'est pas ambigu ; deuxièmement, la sélection du modèle s'effectue par nœud, ce qui vous aide à optimiser l'allocation de l'intelligence ; troisièmement, les expériences d'A/B testing vous aident à décider quel modèle affecter à quelle étape, à partir de données de production réelles. Examinons chaque levier un par un.
La modularité des workflows est un atout
Sur la plateforme HappyRobot, les workflows combinent IA agentique et logique déterministe. La partie agentique, c'est le raisonnement : un agent vocal ou textuel qui mène la conversation, auquel s'ajoutent des nœuds IA qui classent, extraient ou génèrent. La partie déterministe, c'est tout ce qui doit se produire de façon identique et fiable à chaque fois : appels vers vos systèmes de référence, validation des données, branches conditionnelles, boucles, relances, règles d'escalade, etc. exprimés sous forme de nœuds dans le workflow plutôt que d'instructions dans un prompt. Les agents décident de ce qu'il faut dire. La logique de workflow définit les étapes, les conditions et les limites dans lesquelles ils opèrent, quelle que soit la tournure de la conversation.
Prenons l'exemple d'un workflow de recouvrement : un agent appelle un client au sujet d'une facture en retard. Comme processus métier, cela ressemble à une seule tâche. Comme graphe d'exécution, cela représente environ six nœuds :
- [Déterministe] Récupérer le compte : un nœud d'action extrait l'historique de facturation et le comportement de paiement antérieur depuis la base de données client
- [Agentique] Qualifier la situation : un nœud AI Classify lit le fil d'e-mails précédent et catégorise le compte : litige réel, décalage de trésorerie, erreur de facturation, absence de réponse.
- [Agentique] Mener la conversation : un agent vocal appelle, traite l'objection, évalue si le client temporise ou s'il est réellement en difficulté, et négocie un engagement de paiement
- [Déterministe] Vérifier la conformité aux règles : un nœud de condition vérifie si le montant et les conditions engagés respectent les directives financières de l'entreprise
- [Agentique] Extraire l'engagement : un nœud AI Extract récupère la date, le montant et le moyen de paiement promis dans la transcription
- [Déterministe] Réécrire les données : un nœud d'action met à jour la base de données client et programme le suivi
Une seule de ces étapes (l'étape 3) relève d'un travail ouvert où un meilleur jugement se convertit en argent et où un modèle plus performant justifie son surcoût : une meilleure lecture de l'hésitation, une offre mieux calibrée dans le temps, un taux d'engagement plus élevé. Les étapes 2 et 5 sont bornées et répétables : la bonne réponse est la bonne réponse, et un modèle de pointe ne vous apporte ici qu'une latence plus faible et un coût plus élevé. Les étapes 1, 4 et 6 n'impliquent aucun modèle.
Les agents fondés uniquement sur un prompt réduisent ce type de workflow d'exécution à un seul modèle qui fait tout, ce qui revient à payer le prix du modèle de pointe pour extraire une date d'une transcription. Un seul jeu d'instructions, un seul modèle, un seul prix, appliqués indistinctement à des étapes dont l'économie n'a rien en commun. Décomposer le processus en nœuds permet de configurer, valoriser et mesurer chaque étape séparément — et c'est à ce moment-là que vous pouvez actionner les leviers qui suivent.
Premièrement : ne pas appeler le modèle du tout
Les étapes 1, 4 et 6 du workflow de recouvrement ci-dessus sont purement déterministes — récupération, validation, réécriture — et dans la plupart des workflows réels, elles sont plus nombreuses que les étapes de raisonnement. Pour les étapes de logique déterministe, vous n'invoquez aucun modèle. Un nœud de condition n'appelle pas de modèle. Un message basé sur un modèle prédéfini envoyé dans une session texte est délivré tel quel, en contournant entièrement le LLM. Un nœud de boucle parcourant dix mille comptes déclenche dix mille exécutions déterministes, et non dix mille appels de modèle. Tout cela ne relève pas de l'austérité : la logique déterministe offre simplement une meilleure prévisibilité et une meilleure fiabilité, de sorte que le raisonnement est réservé au travail réellement ambigu. Le déterminisme est à la fois moins coûteux et plus fiable.
Deuxièmement : calibrer les modèles que vous appelez
Restent les étapes 2, 3 et 5, qui font appel à l'IA, et seule l'étape 3 exige un véritable jugement. Sur la plateforme HappyRobot, la sélection du modèle se configure par nœud IA. Chaque nœud IA possède son propre champ de modèle, tout comme chaque nœud de prompt pilotant un agent vocal ou textuel — avec un catalogue partagé couvrant OpenAI, Anthropic, Google, Mistral, xAI et OpenRouter. La sélection par défaut de chaque nœud correspond toujours au modèle le plus économique et le plus rapide pour cette étape précise du workflow. Ainsi, l'étape 3 peut s'exécuter sur un modèle de pointe tandis que les étapes 2 et 5 tournent sur un modèle coûtant une fraction du prix, au sein d'un même workflow, lors du même appel.
Le même principe s'étend aux processus complexes dotés d'un agent orchestrateur principal et de nombreux sous-agents ou sous-workflows — vérification d'identité, traitement des paiements, escalade — chacun invoqué par le parent et configuré indépendamment. Le workflow qui exécute la vérification n'a pas besoin de tourner sur le même modèle que la conversation. Anish, d'A16Z, appelle cela l'« allocation par potentiel ». Il cite HappyRobot en exemple : « les modèles de pointe et propriétaires alimentent les ventes et le recouvrement ; les modèles open weights alimentent les opérations et le support. » L'objectif n'est pas de réduire la facture des modèles. C'est de ne dépenser sur le jugement que là où le jugement se convertit en argent.
Menez des expériences et laissez les résultats désigner le gagnant
À mesure que les workflows gagnent en complexité et en nuance, déterminer si une étape agentique a réellement besoin d'un modèle de pointe reste une pure impression tant que ce n'est pas testé face à l'indicateur métier. La plateforme HappyRobot propose des expériences d'A/B testing, qui permettent de figer la version du workflow et d'appliquer des surcharges de configuration à des nœuds sélectionnés. Pour revenir à notre exemple de recouvrement, vous pouvez tester l'effet du changement de LLM sur la seule étape 3, tout le reste demeurant identique. Le trafic est réparti au niveau de chaque conversation, l'affectation reste stable pendant toute sa durée, et le résultat réécrit est le résultat métier : paiement engagé, chargement réservé, rendez-vous planifié. Les résultats sont restitués sous forme de gain relatif, avec intervalles de confiance et valeurs p par traitement.
Vous pouvez également mesurer le coût de l'exécution elle-même, qui ventile la consommation de crédits par type d'événement : Speech-to-Text (STT), Text-to-Speech (TTS) et LLM. La ligne LLM détaille une ventilation par nœud et le coût par modèle, ce qui vous permet d'attribuer la dépense à chaque conversation. En rapprochant ces données des gains relatifs issus des expériences, vous obtenez un gain mesuré face à un coût mesuré, sur le même trafic de production, pour le seul changement de nœud effectué. Parfois, le modèle moins cher est statistiquement indiscernable sur le résultat et les économies sont gratuites. Parfois, le modèle de pointe justifie son surcoût plusieurs fois et la bonne décision est de dépenser davantage sur ce nœud — un constat sur lequel vous ne pouvez agir que si vous savez de quel nœud il s'agit. Vous ne pouvez rien savoir de tout cela sans le tester, et vous ne pouvez pas le tester si votre plateforme vous enferme chez un seul fournisseur.
Pourquoi cet effet se cumule
La logique déterministe sort totalement le modèle de la boucle partout où la tâche n'est pas ambiguë. La sélection par nœud place ensuite le juste niveau d'intelligence sur chaque étape restante : les étapes qui exigent un véritable jugement bénéficient des modèles de pointe, tandis que les autres nœuds fonctionnent très bien avec des modèles qui coûtent une fraction du prix. Les expérimentations transforment ces deux leviers, d'opinions en mesures. Le troisième levier est celui qui rend les deux premiers sûrs à arbitrer. Sans moyen de mesurer les résultats, chaque passage à un modèle moins coûteux ou à une branche déterministe relève d'un petit acte de foi : les équipes prudentes s'arrêtent trop tôt et laissent l'essentiel des économies de côté. Avec la mesure, vous pouvez être offensif, car une configuration qui vous coûte discrètement des conversions se traduit par un chiffre en quelques semaines, plutôt que jamais. Et chaque configuration qui survit à un test devient le témoin de la suivante : les gains s'accumulent rapidement.
Ce qui nous ramène à la question posée en ouverture de cet article, cette fois avec des réponses. Non pas « u2009à combien s'élève notre facture de modèles ”, mais « combien nous coûte une facture recouvrée » - par chargement réservé, par ticket résolu, par ce que l'entreprise est payée pour livrer. Faites tourner la boucle d'expérimentation et ce coût baisse pendant que la qualité augmente. Les deux à la fois, délibérément.




