Architektur
HappyRobot ist eine KI-Orchestrierungsplattform, die speziell dafür entwickelt wurde, dass KI-Mitarbeitende in großem Umfang arbeiten können – einschließlich Sprachinteraktion in Echtzeit. Dieser Artikel bietet einen detaillierten Überblick über die zugrunde liegende Architektur, die integrierten KI-Modelle und die KI-Auditierung. Er richtet sich an technische Entscheidungstragende, die Resilienz, Erweiterbarkeit und operative Robustheit der Plattform auf Ebene von Großunternehmen bewerten.
Die Architektur auf einen Blick
- Cloud-native, containerisierte Umgebung. Alle Laufzeitdienste werden auf Kubernetes innerhalb eines isolierten virtuellen Netzwerks bereitgestellt.
- Zwei Edge-Pfade. REST-/Webhook-Traffic läuft über eine Web Application Firewall und einen Load Balancer; Echtzeit-Sprache kommt über ein gehärtetes SIP-Gateway herein. Beide Pfade terminieren TLS und leiten nur validierten Traffic an den Cluster weiter.
- Trennung von zustandslos und zustandsbehaftet. Orchestrierung, Geschäftslogik und Echtzeit-Media-Handler skalieren horizontal, während dauerhafte Artefakte (Anrufaufzeichnungen, Transkripte, Analysen) in verwalteten Cloud-Datenspeichern mit integrierter Replikation liegen.
- Observability zuerst. Metriken, Logs und Traces werden im Cluster aggregiert und an einen zentralen Monitoring-Stack gestreamt – für SRE-Abdeckung rund um die Uhr.
Modell-Interoperabilität
- Modulare Pipeline. Die Stufen für automatische Spracherkennung, Sprachmodell und Text-to-Speech werden über leichtgewichtige Adapter angesprochen. So lassen sich Anbieter austauschen – oder selbst gehostete Optionen einbinden –, ohne den Telefonie-Code anzufassen.
- Anbietervielfalt. Der Standard-Stack nutzt kommerzielle Best-in-Class-Engines, doch die Orchestrierungsschicht kann einzelne Mandanten (oder sogar einzelne Anrufe) aus Gründen der Datensouveränität oder Performance an alternative Endpunkte routen.
- Zukunftssicherheit. Künftige multimodale Fähigkeiten (z. B. Bild-zu-Text, Dokumenten-Q&A) registrieren sich über denselben Vertrag und schützen nachgelagerte Integrationen vor Änderungen.
- Plattformexklusive Modelle. Um die Latenz zu senken und die Sprachqualität zu steigern, betreibt HappyRobot eine Reihe proprietärer Modelle – etwa verbessertes TTS, Sprachaktivitäts- und End-of-Turn-Erkennung, Filter zur Sprachbereinigung usw. – direkt im Cluster. Diese Assets werden nicht als eigenständige APIs bereitgestellt; sie bleiben plattformintern und werden transparent über dieselbe Adapterschicht aufgerufen.
Telefonie-Integration
- Standardbasiertes SIP & SRTP. HappyRobot spricht reines SIP über TLS für die Signalisierung und schützt Medien End-to-End mit SRTP. Das ermöglicht nahtloses Peering mit Tier-1-Frachtführern, On-Premises-PBX-Anlagen und Cloud-Sprachplattformen.
- Bring your own VoIP-Provider. Ob der Traffic von Twilio, Telnyx, Vonage, einem regionalen CLEC oder einem direkten SIP-Trunk kommt: Die Edge-Gateways normalisieren die Signalisierung, sodass sich der nachgelagerte Anruffluss nie ändert.
- WebRTC-Endpunkte. Neben klassischen Telefonnetzen lässt sich jeder Bot als sicherer WebRTC-Stream bereitstellen – ideal, um Echtzeit-Sprache ohne Plug-ins in Webseiten oder mobile Apps einzubetten.
Resilienz & Fallbacks

Skalierungsrahmen
- Sprache. GPU-gestützte Nodes werden mit Reserven für Echtzeit-Audio-Workloads bereitgestellt. Bei Traffic-Spitzen schaltet der Autoscaler zusätzliche Kapazität schnell genug zu, damit die Gesprächslatenz deutlich im akzeptablen, für Menschen wahrnehmbaren Bereich bleibt.
- Messaging & APIs. Queue-gesteuerte Worker skalieren horizontal, wenn Backlog oder Anfragerate steigen, während HTTP-Edges bei Bedarf skalieren, um niedrige Tail-Latenzen für Webhook- und REST-Traffic zu erhalten.
- Reserven für die Zukunft. Derzeit wird daran gearbeitet, die Provisionierungszeit durch vorgewärmte Images zu verkürzen und die Tokenisierung zu streamen – für mehrere Tausend gleichzeitige Anrufe pro Region ohne architektonische Änderungen.
Sicherheit im Überblick
- Verschlüsselung überall. TLS 1.3 wird an allen öffentlichen Edges (REST, Webhooks, SIP-TLS) sowie für alle ausgehenden Aufrufe an externe Modell-Endpunkte erzwungen.
- Identitäts- und Zugriffsverwaltung. OAuth-basiertes SSO, MFA-Pflicht, fein abgestufte RBAC für Nutzende und Maschinen-Credentials.
- Kontinuierliches Monitoring. Threat-Detection-Feeds, Anomalie-Warnungen und Richtlinien-Audits steuern einen Incident-Response-workflow, der auf SOC 2-Kontrollen ausgerichtet ist.
KI-Modelle
Eine nicht abschließende Liste der Modelle, die in der Orchestrierungsplattform und im Voice-Stack von HappyRobot eingesetzt werden – einige Modelle werden unverändert genutzt, andere mussten feinabgestimmt werden. Wir optimieren auf Leistung und nehmen ein Fine-Tuning vor, wenn Standardmodelle keine ausreichenden Ergebnisse liefern.
Large Language Model (LLM)
Ein Large Language Model (LLM) dient als zentrale Reasoning-Engine, die Eingaben interpretiert, Entscheidungen trifft und Aktionen koordiniert. Es verarbeitet strukturierte und unstrukturierte Daten und nutzt sein Sprach- und Kontextverständnis, um Absichten zu erkennen, Antworten zu generieren und Tools auszulösen. Tools in HappyRobot können vom LLM genutzt werden, um einen API-Aufruf durchzuführen, ein Gespräch weiterzuleiten, eine Nachricht zu senden oder eigenen Code auszuführen.
Das LLM fungiert als verbindende Schicht zwischen den verschiedenen KI-Komponenten und ermöglicht eine dynamische, kontextbewusste Orchestrierung, ohne jede Regel fest zu codieren.
Wir bewerten die Leistung von LLMs regelmäßig anhand von Kosten, Latenz und Antwortqualität. Für jeden Anwendungsfall bzw. jeden „KI-Mitarbeiter“ optimieren wir, welches LLM die Aufgabe am wirksamsten und effizientesten erfüllt.
Text-to-Speech (TTS)
Text-to-Speech-Synthese (TTS) ist der Prozess, geschriebene Sprache mit natürlicher Intonation, Rhythmus und Klarheit in gesprochene Worte umzuwandeln. Das ist komplexer, als Wörter einfach aufzuteilen, sie einzeln in Sprache umzuwandeln und anschließend zusammenzufügen. Das zugrunde liegende TTS-Modell muss den Kontext des Textes verstehen und dann Sprache erzeugen, die zu diesem Kontext passt – auf natürliche, menschlich klingende Weise.
Eine Frage wie „Sie ist nicht gegangen?“ erfordert beispielsweise eine steigende Intonation, während die Aussage „Sie ist nicht gegangen.“ eine fallende Kontur verlangt. Schon eine einfache Änderung der Interpunktion kann eine andere Intonation erfordern, und die Fähigkeit, den Kontext des Textes tiefgreifend zu verstehen, ist entscheidend für natürliche, menschlich klingende Sprache.
Diese Variation konsistent zu beherrschen, ist eine von mehreren fortlaufenden Herausforderungen bei TTS – ebenso wie die korrekte Aussprache komplexer Entitäten wie Zahlen, der Umgang mit kurzen oder abrupten Sätzen, ohne abgehackt zu klingen, und die Wahrung der Flüssigkeit bei Übergängen. Dies sind Bereiche, an denen aktiv gearbeitet wird, und neuere Trends – etwa nicht-autoregressive Synthese – helfen dabei, Geschwindigkeit und Stabilität zu verbessern und dabei die Ausdruckskraft zu erhalten.
Transkriber
Ein Transkriber ist ein System – in der Regel auf Basis automatischer Spracherkennung (ASR) –, das gesprochene Sprache in geschriebenen Text umwandelt. Es hört einen Audiostream ab und erzeugt ein zeitlich zugeordnetes Transkript, das erfasst, was gesagt wurde, und häufig auch, wann es gesagt wurde. Transkriber sind grundlegend für Sprachschnittstellen und ermöglichen Suche, Analyse und die Weiterverarbeitung durch Sprachmodelle oder Analyse-Engines.
Fachjargon, Akzente, Nebengespräche, Hintergrundgeräusche usw. können zu Transkriptionsfehlern führen – das wirkt sich negativ auf das laufende Gespräch aus und hat Folgen für die anschließende Verarbeitung und Analyse. Diese Herausforderungen sind häufig branchenspezifisch, und unser Fokus auf die Lieferkette erlaubt es uns, Transkriber gezielt feinabzustimmen, um sie zu bewältigen.
Um Geschwindigkeit und Genauigkeit auszubalancieren, nutzen wir Online-Transkription für laufende Interaktionen und verbessern die Transkripte anschließend offline, um Präzision und Konsistenz in Analyse- und Audit-workflows zu erhöhen.
End-of-Turn (EOT)
Ein End-of-Turn-Modell (EOT) ist eine Machine-Learning-Komponente in sprachbasierten Systemen, die bestimmt, wann eine sprechende Person ihren Gesprächsbeitrag beendet hat. Es analysiert akustische Hinweise (etwa Pausen oder Tonhöhenabfälle), sprachliche Muster und Timing, um vorherzusagen, ob die Person fertig gesprochen hat. So können KI-Systeme prompt antworten, ohne zu unterbrechen oder unnatürliche Lücken entstehen zu lassen. EOT-Modelle sind in Echtzeitanwendungen entscheidend, in denen eine reibungslose, menschlich wirkende Interaktion unerlässlich ist.
EOT wird oft übersehen, ist aber entscheidend für das Nutzungserlebnis und den Erfolg beim Einsatz von KI in der realen Welt. Selbst wenn Foundation Models schneller werden, bleibt es eine Herausforderung, zu wissen, wann gesprochen werden soll. Wir stimmen EOT-Modelle gezielt auf die realen Szenarien unserer Kunden ab.
Voice Activity Detection (VAD)
Voice Activity Detection (VAD) ist ein Signalverarbeitungsverfahren, mit dem erkannt wird, wann in einem Audiostream Sprache vorhanden ist. Es unterscheidet zwischen Sprach- und Nicht-Sprach-Abschnitten und hilft Systemen, Hintergrundgeräusche, Stille oder andere nicht sprachliche Laute zu ignorieren. VAD ist häufig der erste Schritt in einer Sprachverarbeitungs-Pipeline und ermöglicht, dass nachgelagerte Komponenten – etwa ASR- oder EOT-Modelle – nur dann aktiv werden, wenn tatsächlich gesprochen wird.
VAD-Modelle haben nach wie wie vor Schwierigkeiten mit lauten Umgebungen, überlappender Sprache und kurzen oder zögerlichen Äußerungen, was zu verpassten oder falschen Erkennungen führen kann. Zwischen Latenz und Genauigkeit besteht ein inhärenter Zielkonflikt – Echtzeitsysteme müssen Verzögerungen minimieren, doch schnellere Entscheidungen erhöhen das Fehlerrisiko. Die Kombination von VAD mit Transkriptionsmodellen und Rauschunterdrückung verbessert die Präzision.
Verfahren wie sprachbewusste Filterung und dynamische Schwellenwerte sind vielversprechende Ansätze für die Zukunft.
KI-Auditierung
Wir nehmen Evaluierungen und Kommunikationsqualität sehr ernst, denn unsere Kunden vertrauen uns die große Verantwortung an, zu ihren Kundenbeziehungen beizutragen, zentrale Geschäftsdaten zu verarbeiten und ihre Abläufe auszuführen. Täglich führen unsere KI-Mitarbeitenden tausende Gespräche, bearbeiten Dokumente und lesen und schreiben Daten in Datenbanken.
Wir führen auch manuelle Auditierung durch, doch das manuelle Monitoring von Agentenverhalten in großem Umfang ist aufgrund von Umfang und Komplexität mit erheblichen Herausforderungen verbunden. Deshalb haben wir ein fortschrittliches, KI-gestütztes Auditierungssystem entwickelt, das Large Language Models (LLMs), klassisches ML und regelbasierte Algorithmen kombiniert. Dieser hybride Ansatz ermöglicht eine effiziente und präzise Erkennung zentraler Probleme und sichert hohe Standards bei Leistung und Compliance über alle Interaktionen hinweg – in großem Umfang.
Nutzen für Kunden
Zeit beim manuellen Monitoring sparen
Anstatt jede einzelne Interaktion überwachen zu müssen, können unsere Kunden darauf vertrauen, dass Gesprächsqualität und Endnutzererlebnis kontinuierlich überwacht und berichtet werden.
Warnungen und kürzere Lösungszeiten
Wir möchten Transparenz und eine schnelle Lösung für Probleme bieten, die im Produktivbetrieb unserer Agenten auftreten. Unser Auditierungssystem hilft uns, Regressionen proaktiv zu erkennen und unsere Engineering-Teams sowie Kunden zu alarmieren. Es hilft dabei, die Fehlerursache einzugrenzen und die Zeit bis zur Lösung zu minimieren.
Multimodale Evaluierungen
In Voice AI-Systemen umfasst die Qualitätsmessung Transkripte, Systemprotokolle, API-Antworten und vor allem die tatsächliche Stimme. Da wir unseren Voice-Stack von Grund auf selbst entwickelt haben, richten wir besonderes Augenmerk auf dieses Spracherlebnis und auditieren alle für einen Anruf verfügbaren Datenmodalitäten.
Was wir messen
Unser wichtigstes Auditwerkzeug ist der Post-Call Auditor – ein System, das die Qualität von Anrufen messt und zentrale Ereignisse bzw. Merkmale unserer Agenten erkennt. Jedes davon ist mit SLAs und Ergebnissen verknüpft, die wir für unsere Kunden erreichen wollen. Nachfolgend eine nicht abschließende Auswahl der Metriken und Qualitätskategorien, die unser System erfasst:
Sprachqualität
Kennzahlen:
- Anzahl der Unterbrechungen: Erfasst, wann die KI Kundinnen und Kunden ins Wort fällt – ein Hinweis auf einen schlechten Gesprächsfluss und frustrierende Nutzererlebnisse.
- Latenz: Misst die Verzögerung zwischen der Äußerung der Kundschaft und der Antwort der KI. Zu hohe Latenz stört den Gesprächsrhythmus und lässt Interaktionen unnatürlich wirken.
- Transkriptionsgenauigkeit: Misst die Präzision der Speech-to-Text-Umwandlung von Kundeneingaben. Eine schlechte Transkription führt zu missverstandenen Anliegen und falschen Antworten.
Nutzerinteraktion und Gesprächsfluss
Kennzahlen:
- Eskalationsanfragen: Erfasst, wann Kundinnen und Kunden nach einem menschlichen Ansprechpartner fragen – ein Hinweis auf Grenzen der KI oder Unzufriedenheit. Hohe Eskalationsraten deuten darauf hin, dass die KI die Kundenbedürfnisse nicht ausreichend erfüllt.
- Sentiment-Werte: Überwacht die Stimmungslage der Kundschaft während des gesamten Gesprächs. Sinkende Werte weisen frühzeitig auf mögliche Probleme hin, bevor daraus Eskalationen werden.
- Sprecherwechsel-Verhältnis: Überwacht die Balance zwischen der Redezeit von KI und Kundschaft. Dominiert die KI, deutet das auf mangelndes Zuhören hin; dominiert die Kundschaft, kann das auf Verwirrung hindeuten.
Agentenautonomie und Mensch-Maschine-Zusammenarbeit
Kennzahlen:
- Weiterleitungsrate an Menschen: Misst, wie häufig Anrufe menschliches Eingreifen erfordern, und zeigt so die Leistungsgrenzen der KI. Hohe Weiterleitungsraten deuten auf Trainingslücken oder besonders komplexe Kundenanliegen hin.
- Analyse der Weiterleitungsauslöser: Kategorisiert die Gründe für eine Übergabe an Menschen, um Muster und Verbesserungspotenziale zu erkennen. Zu verstehen, warum Weiterleitungen erfolgen, hilft, Training und Fähigkeiten der KI zu optimieren.
- Autonome Lösungsquote: Erfasst den Anteil der Anliegen, die ohne menschliches Eingreifen gelöst werden. Mehr Autonomie senkt die Betriebskosten und verbessert die Skalierbarkeit.
- Qualität der Übergabe: Bewertet die Qualität des Übergabeprozesses an menschliche Mitarbeitende. Reibungslose Übergaben erhalten die Kundenzufriedenheit und die betriebliche Effizienz.
Datengenauigkeit und Tool-Ausführung
Kennzahlen:
- Genauigkeit der Tool-Auswahl: Misst, ob für das jeweilige Kundenanliegen das richtige Tool gewählt wird. Eine falsche Tool-Auswahl kostet Zeit und kann zu falschen Informationen führen.
- Ausführung der Retry-Logik: Bewertet den korrekten Umgang mit temporären Fehlern oder Netzwerkfehlern bei externen API. Eine gute Retry-Logik verhindert, dass aus vorübergehenden Problemen dauerhafte Ausfälle werden.
- Informationsgenauigkeit: Stellt die Korrektheit der abgerufenen und an die Kundschaft übermittelten Daten sicher. Falsche Informationen schaden dem Vertrauen und können geschäftliche Folgen haben.
Gesprächseffizienz und Geschäftsergebnisse
Kennzahlen:
- Gesprächsdauer: Überwacht die optimale Gesprächslänge für unterschiedliche Arten von Lösungen. Übermäßig lange Gespräche deuten auf Ineffizienz hin; zu kurze können auf eine unvollständige Lösung hindeuten.
- Zeit bis zu zentralen Aktionen: Misst, wie schnell die wichtigsten Gesprächsziele wie Terminvereinbarung oder Abschluss erreicht werden. Eine schnellere Lösung steigert die Kundenzufriedenheit und die betriebliche Effizienz.
- Lösungsquote bei Anrufen: Misst, ob die angestrebten Anrufziele erfolgreich erreicht wurden. Niedrige Lösungsquoten weisen auf Lücken im KI-Training oder Prozessprobleme hin.
- Konversionsraten: Verfolgt den Erfolg bei Verkäufen, Terminen oder gewünschten Kundenaktionen. Verknüpft die KI-Leistung direkt mit Geschäftsergebnissen und Umsatz.
Die nächste Stufe der KI-Auditierung – wer auditiert den Auditor?
Ein wachsender Trend bei KI-Bewertungssystemen, insbesondere bei solchen, die große Sprachmodelle einbinden, ist die Frage „Wer validiert die Validierer?“ (siehe wissenschaftliche Arbeiten zu diesem Thema). Und das ist eine wichtige Frage: Woher wissen wir, dass unser KI-Auditor die Regressionen in unseren KI-Agenten korrekt erkennt?
Damit ein Auditor wirklich nützlich ist, muss er zudem sowohl hohe Trefferquote (Recall) (alle Fälle mit Regressionen erkennen) als auch hohe Präzision (nur dann warnen, wenn tatsächlich Regressionen vorliegen) aufweisen – das heißt, unser KI-Auditierungssystem muss einen hohen F-Score erreichen. Um das sicherzustellen, messen wir, wie stark unser KI-Auditor bei unterschiedlichen Arten von Sprachinteraktionen mit menschlicher Auditierung übereinstimmt.


