Architecture
HappyRobot est une plateforme d'orchestration IA spécialement conçue pour permettre aux workers IA de fonctionner à grande échelle, y compris l'interaction vocale en temps réel. Cet article présente en détail l'architecture sous-jacente, les modèles d'IA intégrés et l'audit de l'IA. Il est destiné aux interlocuteurs techniques qui évaluent la résilience, l'extensibilité et la robustesse opérationnelle de la plateforme à l'échelle de l'entreprise.
L'architecture en un coup d'œil
- Un parc cloud-native et conteneurisé. Tous les services d'exécution sont déployés sur Kubernetes au sein d'un réseau virtuel isolé.
- Deux chemins en périphérie. Le trafic REST / webhook passe par un pare-feu applicatif et un répartiteur de charge ; la voix en temps réel entre via une passerelle SIP durcie. Les deux chemins terminent le TLS et ne transmettent au cluster que le trafic validé.
- Séparation sans état / avec état. L'orchestration, la logique métier et les gestionnaires de médias en temps réel montent en charge horizontalement, tandis que les artefacts durables (enregistrements d'appels, transcriptions, analyses) résident dans des magasins de données cloud managés avec réplication intégrée.
- L'observabilité d'abord. Les métriques, journaux et traces sont agrégés dans le cluster et diffusés vers une pile de supervision centralisée pour une couverture SRE 24h/24, 7j/7.
Interopérabilité des modèles
- Un pipeline modulaire. Les étapes de reconnaissance automatique de la parole, de modèle de langage et de synthèse vocale sont accessibles via des adaptateurs légers : les fournisseurs peuvent ainsi être remplacés — ou des options auto-hébergées insérées — sans toucher au code de téléphonie.
- Diversité des fournisseurs. La pile par défaut s'appuie sur les meilleurs moteurs commerciaux du marché, mais la couche d'orchestration peut router des locataires individuels (voire des appels individuels) vers d'autres points de terminaison, pour des raisons de souveraineté des données ou de performance.
- Compatibilité ascendante. Les futures compétences multimodales (par exemple image-vers-texte, questions-réponses sur documents) s'enregistrent selon le même contrat, ce qui protège les intégrations en aval de tout changement.
- Modèles exclusifs à la plateforme. Pour réduire la latence et améliorer la qualité vocale, HappyRobot exécute une série de modèles propriétaires — TTS amélioré, détection d'activité vocale / de fin de tour, filtres de nettoyage de la parole, etc. — directement au sein du cluster. Ces ressources ne sont pas exposées sous forme d'API autonomes ; elles restent privées à notre plateforme et sont invoquées de façon transparente via la même couche d'adaptateurs.
Intégration téléphonique
- SIP et SRTP fondés sur les standards. HappyRobot utilise le SIP standard sur TLS pour la signalisation et protège les médias avec SRTP de bout en bout, ce qui permet un peering transparent avec les transporteurs de rang 1, les PBX sur site et les plateformes vocales cloud.
- Votre propre fournisseur VoIP. Que le trafic provienne de Twilio, Telnyx, Vonage, d'un opérateur régional CLEC ou d'un trunk SIP direct, les passerelles en périphérie normalisent la signalisation afin que le flux d'appel en aval ne change jamais.
- Points de terminaison WebRTC. Au-delà des réseaux téléphoniques traditionnels, chaque bot peut être exposé sous forme de flux WebRTC sécurisé — idéal pour intégrer la voix en temps réel dans des pages web ou des applications mobiles, sans plug-in.
Résilience et mécanismes de repli

Enveloppe de scalabilité
- Voix. Les nœuds équipés de GPU sont provisionnés avec une marge suffisante pour les charges audio en temps réel. En cas de pic de trafic, l'autoscaler met en ligne de la capacité supplémentaire assez rapidement pour maintenir la latence conversationnelle dans une plage acceptable et imperceptible pour l'humain.
- Messagerie et API. Les workers pilotés par file d'attente s'étendent horizontalement à mesure que la file ou le débit de requêtes augmente, tandis que les points d'entrée HTTP montent en charge à la demande afin de préserver une faible latence de queue pour le trafic webhook et REST.
- Marge pour l'avenir. Des travaux sont en cours pour réduire le temps de provisionnement grâce à des images préchauffées et pour diffuser la tokenisation, permettant plusieurs milliers d'appels simultanés par région sans changement d'architecture.
Aperçu de la sécurité
- Le chiffrement partout. TLS 1.3 est imposé sur toutes les bordures publiques (REST, webhooks, SIP-TLS) ainsi que pour tous les appels sortants vers des points de terminaison de modèles externes.
- Gestion des identités et des accès. SSO basé sur OAuth, MFA obligatoire, RBAC granulaire pour les utilisateurs comme pour les identifiants machine.
- Surveillance continue. Les flux de détection des menaces, les alertes d'anomalies et les audits de politiques alimentent un workflow de réponse aux incidents aligné sur les contrôles SOC 2.
Modèles d'IA
Liste non exhaustive des modèles utilisés dans la plateforme d'orchestration et la stack vocale de HappyRobot — certains sont utilisés tels quels, d'autres ont nécessité un fine-tuning. Nous optimisons la performance et procédons au fine-tuning lorsque les modèles standard ne donnent pas de résultats suffisants.
Large Language Model (LLM)
Un large language model (LLM) fait office de moteur de raisonnement central : il interprète les entrées, prend des décisions et coordonne les actions. Il ingère des données structurées et non structurées et s'appuie sur sa compréhension du langage et du contexte pour déterminer l'intention, générer des réponses et déclencher des outils. Dans HappyRobot, les outils peuvent être mobilisés par le LLM pour effectuer un appel API, transférer un appel, envoyer un message ou exécuter du code personnalisé.
Le LLM joue le rôle de couche de liaison entre les différents composants d'IA, permettant une orchestration dynamique et sensible au contexte, sans coder en dur chaque règle.
Nous évaluons régulièrement la performance des LLM selon le coût, la latence et la qualité des réponses. Nous déterminons, pour chaque cas d'usage ou chaque « IA worker », quel LLM exécute la tâche le plus efficacement.
Text-to-Speech (TTS)
La synthèse vocale (TTS) est le processus qui transforme le langage écrit en paroles, avec une intonation, un rythme et une clarté naturels. C'est plus complexe que de simplement découper les mots, les convertir séparément en parole puis les recombiner. Le modèle TTS sous-jacent doit être capable de comprendre le contexte du texte, puis de générer une parole cohérente avec ce contexte, de façon naturelle et humaine.
Par exemple, une question comme « Elle n'y est pas allée ? » exige une intonation montante, tandis qu'une affirmation « Elle n'y est pas allée. » appelle un contour descendant. Un simple changement de ponctuation peut imposer un changement d'intonation : la capacité à comprendre finement le contexte du texte est donc essentielle pour produire une parole naturelle et humaine.
Gérer cette variation de manière cohérente est l'un des défis permanents du TTS — au même titre que la prononciation correcte d'entités complexes comme les nombres, la gestion des phrases courtes ou abruptes sans effet de coupure, et le maintien de la fluidité lors des transitions. Ces sujets font l'objet d'améliorations constantes, et les tendances récentes — comme la synthèse non autorégressive — contribuent à améliorer la vitesse et la stabilité tout en préservant l'expressivité.
Transcripteur
Un transcripteur est un système — généralement propulsé par la reconnaissance automatique de la parole (ASR) — qui convertit le langage parlé en texte écrit. Il écoute un flux audio et produit une transcription alignée dans le temps, capturant ce qui a été dit et souvent le moment où cela a été dit. Les transcripteurs sont fondamentaux dans les interfaces vocales : ils permettent la recherche, l'analyse et les traitements en aval par des modèles de langage ou des moteurs analytiques.
Le jargon, les accents, les conversations parallèles, les bruits de fond, etc. peuvent générer des erreurs de transcription — avec des effets négatifs sur la conversation en direct et des répercussions en aval sur le traitement et l'analyse. Ces difficultés sont souvent propres à chaque secteur, et notre spécialisation dans la supply chain nous permet d'affiner les transcripteurs pour les surmonter.
Pour concilier vitesse et précision, nous utilisons la transcription en ligne pour alimenter les interactions en direct, puis nous enrichissons les transcriptions hors ligne afin d'améliorer la précision et la cohérence des workflows d'analyse et d'audit.
End-of-turn (EOT)
Un modèle End-of-Turn (EOT) est un composant de machine learning utilisé dans les systèmes vocaux pour déterminer quand un locuteur a terminé son tour de parole. Il analyse les indices acoustiques (pauses, baisses de hauteur), les schémas linguistiques et le timing afin de prédire si l'utilisateur a fini de parler. Cela permet aux systèmes d'IA de répondre rapidement, sans interrompre ni créer de silences artificiels. Les modèles EOT sont déterminants dans les applications en temps réel, où une interaction fluide et humaine est essentielle.
L'EOT est souvent négligé, alors qu'il est déterminant pour l'expérience utilisateur et la réussite du déploiement de l'IA dans le monde réel. Même à mesure que les modèles de fondation gagnent en rapidité, savoir quand parler restera un défi. Nous affinons les modèles EOT pour couvrir les scénarios réels de nos clients.
Voice Activity Detection (VAD)
La détection d'activité vocale (VAD) est une technique de traitement du signal utilisée pour identifier la présence de parole dans un flux audio. Elle distingue les segments vocaux des segments non vocaux, aidant les systèmes à ignorer le bruit de fond, le silence ou d'autres sons non verbaux. La VAD constitue souvent la première étape d'un pipeline de traitement vocal, permettant aux composants en aval — comme les modèles ASR ou EOT — de ne s'activer que lorsque quelqu'un parle réellement.
Les modèles VAD éprouvent encore des difficultés dans les environnements bruyants, en cas de paroles superposées ou d'énoncés courts et hésitants, ce qui peut entraîner des détections manquées ou erronées. Il existe un compromis intrinsèque entre latence et précision : les systèmes en temps réel doivent minimiser le délai, mais des décisions plus rapides augmentent le risque d'erreurs. Associer la VAD à des modèles de transcription et à la suppression du bruit améliore la précision.
Des techniques comme le filtrage tenant compte de la langue et le seuillage dynamique ouvrent des perspectives prometteuses.
Audit de l'IA
Nous prenons les évaluations et la qualité des communications très au sérieux : nos clients nous confient la lourde responsabilité de contribuer à leurs relations clients, de traiter des données métier essentielles et de conduire leurs opérations. Chaque jour, nos workers IA gèrent des milliers de conversations et de documents, et lisent et écrivent des données dans des bases.
Nous pratiquons également l'audit manuel, mais l'ampleur et la complexité du suivi manuel du comportement des agents à grande échelle posent des défis considérables. Pour y répondre, nous avons développé un système d'audit avancé propulsé par l'IA, qui combine large language models (LLM), machine learning classique et algorithmes à base de règles. Cette approche hybride permet de détecter efficacement et précisément les problèmes clés, garantissant un haut niveau de performance et de conformité sur l'ensemble des interactions, à grande échelle.
Impact pour le client
Gagner du temps sur la surveillance manuelle
Plutôt que de devoir surveiller chaque interaction, nos clients peuvent avoir l'assurance que la qualité des appels et l'expérience des utilisateurs finaux sont contrôlées et documentées en permanence.
Alerter et réduire le délai de résolution
Nous visons la transparence et une résolution rapide des problèmes constatés en production pour nos agents. Notre système d'audit nous aide à identifier les régressions de façon proactive et à alerter nos équipes d'ingénierie ainsi que nos clients. Il permet de circonscrire la défaillance et de réduire au minimum le délai de résolution.
Évaluations multimodales
Dans les systèmes d'IA vocale, mesurer la qualité implique d'examiner les transcriptions, les journaux système, les réponses d'API et, surtout, la voix elle-même. Ayant construit notre stack vocale de A à Z, nous accordons une attention particulière à cette expérience vocale et auditons toutes les modalités de données disponibles pour un appel.
Ce que nous mesurons
Notre auditeur principal est le Post-Call Auditor : un système qui mesure la qualité des appels et détecte les événements et caractéristiques clés de nos agents. Chacun d'eux est rattaché à des SLA et à des résultats que nous nous engageons à délivrer pour nos clients. Voici une sélection non exhaustive des métriques et catégories de qualité suivies par notre système :
Expérience vocale
Chiffres clés :
- Nombre d'interruptions : suit les moments où l'IA parle en même temps que les clients, signe d'un mauvais déroulé de conversation et source de frustration pour les utilisateurs.
- Latence : mesure le délai de réponse entre la prise de parole du client et la réponse de l'IA. Une latence excessive rompt le rythme conversationnel et rend les échanges peu naturels.
- Précision de la transcription : mesure la précision de la conversion parole-texte des propos du client. Une transcription de mauvaise qualité entraîne des demandes mal comprises et des réponses erronées.
Engagement des utilisateurs et fluidité conversationnelle
Chiffres clés :
- Demandes d'escalade : suit les moments où les clients demandent un agent humain, révélant les limites de l'IA ou une insatisfaction. Un taux d'escalade élevé indique que l'IA ne répond pas efficacement aux besoins des clients.
- Scores de sentiment : suit l'état émotionnel du client tout au long de l'appel. Une dégradation du sentiment alerte sur d'éventuels problèmes avant qu'ils ne deviennent des escalades.
- Ratios de prise de parole : mesure l'équilibre entre le temps de parole de l'IA et celui du client. Une IA dominante traduit une mauvaise écoute ; un client dominant peut signaler de la confusion.
Autonomie des agents et collaboration homme-machine
Chiffres clés :
- Taux de transfert vers un humain : mesure la fréquence des appels nécessitant une intervention humaine, révélant les limites des capacités de l'IA. Un taux de transfert élevé traduit des lacunes d'entraînement ou des problèmes clients trop complexes.
- Analyse des déclencheurs de transfert : classe les raisons des transferts vers un humain afin d'identifier des tendances et des axes d'amélioration. Comprendre pourquoi les transferts se produisent aide à optimiser l'entraînement et les capacités de l'IA.
- Taux de résolution autonome : suit le pourcentage de problèmes résolus sans intervention humaine. Une plus grande autonomie réduit les coûts opérationnels et améliore la scalabilité.
- Score de fluidité du transfert : évalue la qualité du processus de transfert vers les agents humains. Des transferts fluides préservent la satisfaction client et l'efficacité opérationnelle.
Exactitude des données et exécution des outils
Chiffres clés :
- Justesse de la sélection des outils : mesure la capacité à choisir le bon outil selon les besoins spécifiques du client. Un mauvais choix d'outil fait perdre du temps et peut fournir des informations erronées.
- Exécution de la logique de nouvelle tentative : évalue la bonne gestion des erreurs transitoires ou réseau avec les API externes. Une logique de nouvelle tentative efficace évite que des problèmes temporaires ne deviennent des défaillances permanentes.
- Exactitude des informations : garantit l'exactitude des données récupérées et communiquées aux clients. Des informations inexactes nuisent à la confiance et peuvent avoir des conséquences pour l'activité.
Efficacité des appels et résultats métier
Chiffres clés :
- Durées d'appel : suit la durée d'appel optimale selon les types de résolution. Des appels excessivement longs indiquent un manque d'efficacité ; des appels trop courts peuvent signaler une résolution incomplète.
- Délai pour atteindre les actions clés : mesure la rapidité d'atteinte des objectifs principaux de l'appel, comme une prise de rendez-vous ou une vente. Une résolution plus rapide améliore la satisfaction client et l'efficacité opérationnelle.
- Taux de résolution des appels : mesure l'atteinte effective des objectifs fixés pour l'appel. Des taux de résolution faibles révèlent des lacunes dans l'entraînement de l'IA ou des problèmes de process.
- Taux de conversion : suit la réussite en matière de ventes, de rendez-vous ou d'actions clients attendues. Relie directement la performance de l'IA aux résultats métier et à la génération de revenus.
La suite de l'audit de l'IA : qui audite l'auditeur ?
Une tendance croissante dans les systèmes d'évaluation de l'IA, en particulier ceux qui intègrent des grands modèles de langage, est la question « Qui valide les validateurs ? » (voir les articles académiques consacrés à ce sujet). Et c'est une question importante : comment savoir si notre auditeur IA détecte correctement les régressions de nos agents IA ?
Par ailleurs, pour qu'un auditeur soit réellement utile, il doit faire preuve à la fois d'un rappel élevé (identifier tous les cas où il y a eu des régressions) et d'une précision élevée (n'alerter que pour les cas où il y a effectivement eu des régressions), ce qui signifie que notre système d'audit de l'IA doit présenter un F-score élevé. Pour nous en assurer, nous mesurons le degré de concordance entre notre auditeur IA et l'audit humain sur différents types d'interactions vocales.


