Für Teams, die Sprachagenten ausliefern, ist das Muster allzu bekannt: Modell tauschen, neu bereitstellen, ein paar Anrufe anhören – und das Ganze als Upgrade verbuchen. Ein Bauchgefühl-Check ist eine verlockende Abkürzung, besonders wenn Änderungen geringfügig erscheinen. Und genau so gelangen verborgene Regressionen in die Produktion.
In der ersten Welle der agentischen Ära ging es darum, Agenten überhaupt zum Laufen zu bringen. Wir befinden uns nun in der zweiten Welle, in der Agenten reale wirtschaftliche Prozesse steuern, und die Frage ist nicht können sie die Aufgabe erledigen sondern welche Version davon macht es am besten. Auf diese Frage hat der Rest der Softwarebranche eine gut verstandene Antwort: kontrollierte Experimente.
In diesem Beitrag geht es darum, wie wir bei HappyRobot Experimente durchführen – und um einige Herausforderungen, die speziell dann auftreten, wenn das Objekt des Experiments ein Agent ist. Wir gehen ein echtes Experiment End-to-End durch: einen Text-to-Speech-(TTS-)Stimmwechsel, der bei einem großen Telekommunikationsanbieter eine relative Steigerung von 20 % bei einer zentralen Geschäftskennzahl erzielte. Anschließend widmen wir uns den statistischen Herausforderungen, die auftreten, wenn Agenten immer schwerer zu verbessern sind.

Warum das schwieriger ist, als es aussieht
Ein Sprachagent ist nicht ein einzelnes Modell, das Sie im A/B-Test prüfen. Er ist ein Stack: ein Transkriptionsmodul, das Audio in Text umwandelt, ein LLM, das entscheidet, was gesagt und welche Tools aufgerufen werden, eine TTS-Engine, die die Antwort zurück in Audio verwandelt, ein Satz Prompts und Richtlinien, der all das umschließt, und ein Orchestrator, der die Schichten mit der Telefonie verbindet. Änderungen an jeder Schicht können Ergebnisse auf Wegen verschieben, die aus der Änderung selbst nicht ersichtlich sind.
Die entscheidenden Ergebnisse liegen außerdem am Ende langer, verzweigter Gespräche. Eine typische Kennzahl – „hat der Kunde zugestimmt, für das Upgrade zu zahlen“ – ist auf Anrufebene binär, hängt aber von Dutzenden vorgelagerten Entscheidungen ab: War die Authentifizierung erfolgreich, blieb der Anrufende in der Leitung, präsentierte der Agent das richtige Angebot zum richtigen Zeitpunkt. Jeder dieser Punkte bringt Varianz mit sich, die nichts mit der getesteten Änderung zu tun hat. Das Signal ist real, aber im Rauschen verborgen – und je mehr vorgelagerte Teilereignisse Ihre Kennzahl aggregiert, desto größer muss die Stichprobe sein, um sie klar ablesen zu können.
Und jedes Experiment verbraucht echten Produktions-Traffic. Ein schlecht durchgeführtes Experiment ist nicht nur statistisch falsch, es kostet Sie in derselben Währung, in der Sie Erfolg messen. Zusammengenommen bedeuten diese Eigenschaften, dass Experimente mit Sprachagenten auf Weisen sorgfältig sein müssen, die von außen nicht immer offensichtlich sind – und diese sorgfältige Arbeit muss im Tempo des Geschäfts geschehen.
Wie Experimente in der HappyRobot-Plattform funktionieren
Die Experimentierfunktion der HappyRobot-Plattform ermöglicht es Ihnen, für jeden bereits erstellten workflow einen A/B-Test einzurichten: Definieren Sie eine Kontroll- und eine Treatment-Variante, wählen Sie eine Traffic-Aufteilung und legen Sie los. Die Randomisierung erfolgt auf Anrufebene. Trifft ein Anruf ein, weist ihn der Orchestrator einer Variante zu, und diese Zuweisung bleibt für die Dauer des Anrufs bestehen. Der workflow führt die zugewiesene Variante End-to-End aus, und wenn der Anruf endet, wird das Ergebnis in den Kontext des Kunden – seine Datenschicht – geschrieben: ob der Kunde einer Zahlung zugestimmt hat, ob eine Ladung gebucht oder ein Termin erfolgreich vereinbart wurde. Dieses Ergebnis ist die Einheit, auf der das Experiment messt.

Dieselbe Mechanik funktioniert unabhängig vom Kanal: Telefonanrufe, E-Mail-Threads, WhatsApp / SMS oder Chatbot-Konversationen. Alles, was der Agent ausführen kann, können wir per Traffic-Aufteilung testen. In diesem Beitrag konzentrieren wir uns auf Sprache, aber die Grundbausteine des Experimentierens bleiben dieselben.
Sie legen im Vorfeld eine primäre Kennzahl fest, und auf dieser Kennzahl basiert die Entscheidung. Alles andere ist diagnostisch. Warum diese Unterscheidung wichtig ist, erklären wir später.
Ein echtes Experiment: 20 % mehr Tarif-Upgrades
Wir haben die Text-to-Speech-(TTS-)Stimme eines Agenten im A/B-Test geprüft, der für einen großen Telekommunikationsanbieter betrieben wird. Der Agent ruft Bestandskunden an, die bei ihrem aktuellen Tarif regelmäßig zu viel ausgeben und etwa beim Datenvolumen Zusatzkosten verursachen, erläutert ihnen einen besser passenden Tarif und bringt sie dazu, das Upgrade anzunehmen – telefonisch, per Weblink oder über jeden anderen Kanal, den der workflow unterstützt.
- Kontrolle: Stimme A (die zu Beginn des Experiments produktiv eingesetzte proprietäre Stimme)
- Treatment: Stimme B und Stimme C (zwei proprietäre Stimmen, die wir evaluieren wollten)
- Dauer: Drei Wochen
- Primäre Kennzahl: upgrade_accepted
Stimme B

Die richtige primäre Kennzahl wählen
Bei der Bewertung eines TTS-Wechsels ist die Versuchung groß, Dinge zu messen, die nach Stimme klingen: Unterbrechungen, Latenz, Natürlichkeitsbewertungen, Wörter pro Minute. Das sind alles echte Kennzahlen, und wir erfassen sie. Aber keine davon ist die Kennzahl, auf deren Basis Sie entscheiden sollten.
Die richtige primäre Kennzahl liegt so nah wie möglich am tatsächlichen wirtschaftlichen Ergebnis, das Ihnen wichtig ist. Für diesen Kunden ist dieses Ergebnis gezahlte Gebühr. Wir können die Zahlung im Moment des Anrufendes nicht direkt beobachten – Zahlungen werden später abgewickelt, manchmal Tage später – daher verwenden wir den nächstliegenden Proxy im Gespräch: Hat der Kunde während des Anrufs einer Zahlung zugestimmt? Wir haben Unterkennzahlen, die das aufschlüsseln (upgrade_accepted_by_phone, upgrade_accepted_by_web), doch die Entscheidung fällt auf Basis des Gesamtwerts. Der Kanalmix ist interessant; entscheidend ist das Hauptergebnis.
Sekundäre Kennzahlen (wir haben customer_engaged_with_agent und mehrere weitere erfasst) treiben nicht die Entscheidung. Sie treiben das nächste Experiment. Bewegt sich die primäre Kennzahl, helfen die sekundären zu verstehen, warum. Bewegt sie sich nicht, helfen sie dabei, den nächsten Versuch zu konzipieren.
Ergebnisse

| Variant | Upgrade accepted | Lift vs. Control | Relative | Significance |
|---|---|---|---|---|
| Voice A (control) | 13.01% | - | - | - |
| Voice B | 15.68% | +2.67pp | +20.1% | stat-sig |
| Voice C | 12.09% | -0.92pp | -7.1% | stat-sig |
Zwei Erkenntnisse, nicht eine. Die offensichtliche Erkenntnis: Stimme B ist deutlich besser als die produktive Stimme. Eine Steigerung von 2,67 Prozentpunkten auf einer Basis von 13,01 % entspricht einer relativen Verbesserung von 20 % bei der Kennzahl, die dem Unternehmen wirklich wichtig ist – über drei Wochen echten Produktions-Traffics hinweg. Beim Volumen dieses Kunden ist das eine erhebliche Größe.
Die weniger offensichtliche Erkenntnis: Stimme C hätte das Unternehmen rund 7 % der Tarif-Upgrades gekostet, wenn wir sie nach Intuition ausgeliefert hätten. Der Nachteil des Bauchgefühl-Checks ist nicht, dass man Gewinner verpasst. Es ist, dass man Verlierer ausliefert und es nie erfährt.
Warum Stimme B gewonnen hat
Die sekundäre Kennzahl, die wir neben upgrade_accepted erfasst haben, war customer_engaged_with_agent – ob sich der Anrufende tatsächlich auf den Agenten eingelassen hat, anstatt früh abzuspringen. Sie erzählt eine konsistente Geschichte:
| Voice A (control) | customer_engaged_with_agent | Lift vs. control |
|---|---|---|
| Voice A (control) | 52.00% | - |
| Voice B | 54.08% | +2.1 pp |
| Voice C | 49.92% | -2.1 pp |
Das Engagement bewegt sich in dieselbe Richtung wie die primäre Kennzahl, und Voice B erzielt den größten Zuwachs früh im Gespräch, bevor überhaupt tarifspezifische Inhalte vorgelesen wurden. Das ist ein deutlicher Hinweis darauf, dass der erste Eindruck der Stimme zählt: Wie menschlich sie in den ersten Sekunden klingt, entscheidet darüber, ob die anrufende Person lange genug am Apparat bleibt, um den Rest zu hören.
Betrachtet man eine Stichprobe von Gesprächstranskripten und Audioaufnahmen zusammen mit den sekundären Kennzahlen, stechen zwei Faktoren als wahrscheinliche Treiber hervor:
- Natürlichkeit ohne Theatralik. Voice B trifft genau den richtigen Punkt: dialogorientiert und menschlich klingend, ohne die überexpressive Prosodie, nach der manche moderne TTS-Stimmen greifen. Der Engagement-Zuwachs, der sich auf die ersten Sekunden des Gesprächs konzentriert, passt dazu: Klingt eine Stimme eindeutig nach Bot oder eindeutig nach Theateraufführung, steigen Anrufende aus, bevor der agent zum Wesentlichen kommt.
- Aussprache von Entitäten. Voice B erwies sich als deutlich besser darin, komplexe Zeichenfolgen auszusprechen: Kontonummern, Dollarbeträge, E-Mail-Adressen, Referenzcodes. Bei einem Anwendungsfall, in dem der agent exakte Mehrverbrauchsgebühren und den Preis des neuen Tarifs vorliest, ist das nicht kosmetisch. Falsch gelesene Ziffern führen dazu, dass Anrufende um Wiederholung bitten – das kostet Zeit und erhöht die Wahrscheinlichkeit eines frühen Auflegens.
Der zweite Faktor ist derjenige, den man übersieht, wenn man nicht das Richtige misst. Er zeigt sich nicht in einer Natürlichkeitsbewertung. Er zeigt sich in upgrade_accepted.
Die statistischen Herausforderungen der Agentenoptimierung
Alles bisher Beschriebene zeigt, wie ein sauberes Experiment mit hohem Signal aussieht. Interessant wird die Frage, was passiert, wenn die leichten Erfolge ausgeschöpft sind – wenn Ihre Agenten bereits optimiert sind und die Zuwächse, die Sie anstreben, bei 1–2 % statt bei 20 % liegen. In diesem Bereich steckt der Großteil der technischen Arbeit.
Die Dauer eines Experiments abschätzen
Bevor Sie ein Experiment starten, lohnt es sich abzuschätzen, wie lange es laufen muss. Die Eingangsgrößen sind bekannt: die Ausgangsrate der Kennzahl, die Sie verändern wollen (p), die minimale Effektgröße, die für Sie relevant wäre (δ, die MDE), die gewünschte statistische Power und das Signifikanzniveau. Für ein binäres Ergebnis im Vergleich zweier gleich großer Varianten hilft folgende Überschlagsrechnung:

Setzen Sie Zahlen ein, und Sie erhalten die erforderliche Stichprobengröße pro Variante; geteilt durch Ihr tägliches Anrufvolumen ergibt sich die Dauer des Experiments.
Kleinere MDEs benötigen deutlich mehr Daten. Eine Halbierung des nachweisbaren Effekts vervierfacht die erforderliche Stichprobengröße (beachten Sie das δ² im Nenner). Einen Zuwachs von 1 Prozentpunkt bei derselben Ausgangsbasis von 22 % nachzuweisen, hätte rund die 10-fache Stichprobengröße erfordert wie der Nachweis von 3 Prozentpunkten. Das ist keine Eigenart eines bestimmten Aufbaus – es ist die Geometrie statistischer Power. Aber es hat eine Konsequenz: Je besser die Agenten werden, desto schneller steigen die Kosten jedes weiteren Experiments.
Das MDE-Problem – und warum Varianzreduktion zählt
Das ist der Kreislauf, in dem jeder Kunde sein soll: einen agent ausliefern, Experimente zur Verbesserung durchführen, die Gewinner ausliefern, weitere Experimente durchführen, wiederholen. Je schneller sich dieser Kreislauf dreht, desto steiler die Kurve.
Was den Kreislauf verlangsamt, ist die statistische Power. Ein Team mit hohem Volumen und großen Zuwächsen kann wöchentlich iterieren. Ein Team mit kleinen Zuwächsen – etwa 1 % Verbesserung bei einer bereits optimierten Kennzahl – braucht bei gleichem Traffic womöglich Monate pro Experiment. Das ist keine Iteration. Das ist Warten.
Sie haben drei Hebel. Sie können den Traffic erhöhen (begrenzt durch die Zahl real existierender Kunden). Sie können länger laufen lassen (begrenzt durch die Zahl der Experimente, die in ein Quartal passen). Oder Sie können die Varianz Ihres Schätzers reduzieren, sodass dieselben Daten mehr Information über den wahren Behandlungseffekt tragen.
Beim dritten Hebel finden sich die interessanten Techniken. Die Intuition ist einfach: Ein Teil der Varianz Ihrer Ergebniskennzahl wird nicht durch Ihre Maßnahme verursacht, sondern durch Dinge, die für das Gespräch schon vor der Zuweisung der Maßnahme galten. Das bisherige Verhalten des Kunden, die Tageszeit, die Sprache des Gesprächs, das LLM-Modell. Wenn Sie diese bereits vorhandene Varianz herausrechnen können, kommt das Verbleibende einer sauberen Messung des Behandlungseffekts näher – und Ihre Konfidenzintervalle werden kostenlos enger.
Einige der Techniken, auf die wir zurückgreifen, in zunehmender Komplexität:
Multivariate Regression. Der einfachste Schritt. Statt die Rohmittelwerte von Kontroll- und Treatment-Gruppe zu vergleichen, regressieren Sie das Ergebnis auf die Treatment-Indikatorvariable und eine Reihe von Kovariaten, von denen Sie wissen, dass sie das Ergebnis vorhersagen – Sprache, Tageszeit, Kundensegment, bisherige Conversion-Rate. Der Koeffizient der Treatment-Indikatorvariable ist Ihre Effektschätzung, und solange die Kovariaten nicht selbst von der Maßnahme beeinflusst werden, ist die Schätzung unverzerrt und varianzärmer als die einfache Mittelwertdifferenz.

CUPED. Controlled-experiment Using Pre-Experiment Data. Die Kovariate ist das in einem Zeitraum vor dem Experiment gemessene Ergebnis derselben Einheit. Zum Beispiel die historische Buchungsrate des konkreten Frachtführers, den Sie anrufen. Die Intuition ist simpel: Ein Teil des Grundes, warum ein Anruf konvertiert oder nicht, ist schlicht, dass Sie mit diesem Frachtführer sprechen, der ohnehin mit einer bestimmten Rate bucht – unabhängig davon, welche Stimme der agent verwendet. CUPED rechnet diese vorbestehende Variation heraus und liefert eine sauberere Messung des Behandlungseffekts. Es ist asymptotisch äquivalent zu einer Regression mit dieser einen Kovariate und das Arbeitspferd der Varianzreduktion in den meisten großen Experimentierprogrammen. Leicht zu implementieren, schwer falsch zu machen, und oft bringt es 20–50 % Varianzreduktion gratis, wenn historisches Verhalten prädiktiv ist.
CUPAC. Control Using Predictors as Covariates. Dieselbe Idee wie CUPED, nur ist die Kovariate die Vorhersage eines ML-Modells, das auf Daten aus der Zeit vor dem Experiment trainiert wurde, statt eines einzelnen historischen Mittelwerts. CUPED lässt sich als Spezialfall betrachten, bei dem dieses ML-Modell ein einfacher Mittelwert pro Einheit ist; CUPAC verallgemeinert das auf jeden Prädiktor, den Sie auf Vorab-Daten anpassen können. Wenn der Zusammenhang zwischen Kovariaten und Ergebnis nicht linear ist – was bei Sprachagenten häufig der Fall ist, da Ergebnisse von Wechselwirkungen zwischen Merkmalen der Anrufenden, Zeit und Vorgeschichte abhängen –, kann ein flexibler Prädiktor (etwa Gradient-Boosted Trees) zusätzlich zu CUPED ein weiteres substanzielles Stück Varianzreduktion bringen.
Die gemeinsame Fallstricke all dieser Verfahren: Die Kovariate darf nicht von der Maßnahme beeinflusst sein. Andernfalls schleusen Sie eine Verzerrung in die Schätzung ein. Daten aus der Zeit vor dem Experiment sind die sicherste Quelle. Alles, was während des Experiments beobachtet wird, ist verdächtig, sofern Sie nicht begründen können, dass es nicht von der Zuweisung beeinflusst sein kann. Ein Beispiel: Gesprächsdauer ist als Kovariate verlockend – sie sagt Ergebnisse vorher und lässt sich leicht messen –, aber eine bessere TTS-Stimme, die Anrufende länger bei der Stange hält, verschiebt die Gesprächsdauer im Treatment-Arm zwangsläufig. Eine Adjustierung dafür würde den Effekt, den Sie messen wollen, teilweise neutralisieren.
Für die maßgebliche Darstellung dieser Methoden, einschließlich einer sauberen Simulation, die sie in linearen, nicht-linearen und adversarialen Szenarien vergleicht, empfehlen wir den Glovo-Engineering-Beitrag von Bouzas und Masip.
Verrauschte Kennzahlen brauchen mehr Daten, als Sie denken
Manche Kennzahlen verhalten sich gutmütig. Die Latenz pro Äußerung oder die Wörter pro Minute beispielsweise sind eng verteilt – man erfasst dabei etwas, das einer stabilen physikalischen Größe nahekommt, und die Varianz bleibt begrenzt.
Die Kennzahlen, auf die es tatsächlich ankommt, gehören meist nicht dazu. Eine primäre Kennzahl wie upgrade_accepted ist pro Anruf binär, doch der Weg zu diesem binären Ergebnis bündelt viele Teilereignisse: Hat die anrufende Person abgenommen, war die Authentifizierung erfolgreich, hat der agent das passende Angebot unterbreitet, blieb die anrufende Person lange genug im Gespräch, um es zu hören? Jedes davon ist ein eigenes Bernoulli-Ereignis mit eigener Varianz, und je weiter unten im Funnel Ihre Kennzahl liegt, desto mehr dieser vorgelagerten Varianz übernimmt sie. Aggregierte Geschäftsergebnis-Kennzahlen sind verrauschter als die Momentaufnahmen, die sich „wissenschaftlicher“ anfühlen – aber sie sind auch die einzigen, die direkt mit der Wirtschaftlichkeit verknüpft sind.
Die richtige Konsequenz ist nicht, sie aufzugeben. Sondern die benötigte Datenmenge einzuplanen: längere Experimente, sorgfältigere Kovariatenanpassung und die Disziplin, nicht vorzeitig in die kumulierten Zahlen zu schauen, wenn die Tageswerte vielversprechend aussehen.
Warum sich das kumuliert
Ein Mensch, der Anrufe zum Forderungsmanagement führt, wird mit der Zeit besser – aber nur linear. Er lernt das Skript, verinnerlicht die Einwände, erreicht ein Plateau. Ein agentisches System, das über kontrollierte Experimente optimiert wird, kennt diese Grenze nicht. Jedes Experiment, das ausgeliefert wird, hebt dauerhaft das Niveau für jeden folgenden Anruf. Das nächste Experiment läuft gegen Voice B als neue Kontrollgruppe, und die Verbesserungen summieren sich.
Wie schnell diese Kurve steigt, hängt nicht von der Größe des Modells oder der Raffinesse einer einzelnen Maßnahme ab. Entscheidend ist das Tempo, in dem Sie verlässliche Experimente durchführen können. „Compound Intelligence“ ist nur der Name für das, was passiert, wenn dieser Kreislauf Woche für Woche saubere Ergebnisse liefert: Produktionsverkehr ist dann keine Kostenstelle des Geschäftsbetriebs mehr, sondern wird zum Input für ein System, das monoton besser darin wird, wofür das Unternehmen bezahlt.
Quellen:
- Varianzreduktion in Experimenten mithilfe von Kovariatenanpassungsverfahren – Bouzas und Masip, Glovo Engineering.
- Autoresearch – Andrej Karpathy



-1.png%3F2026-09-22T15%253A22%253A29.689Z&w=3840&q=100)
