Latenz in der Telefonie
Warum die Antwortzeit über die Gesprächsqualität entscheidet
Latenz ist die Zeit zwischen dem Ende des Gesagten und dem Beginn der Antwort. Im menschlichen Gespräch liegt diese Pause typischerweise bei etwa zwei Zehntelsekunden. Ein System, das eine ganze Sekunde braucht, wirkt zögerlich; ab etwa anderthalb Sekunden halten Anrufer die Verbindung für gestört und sprechen hinein oder legen auf.
Woraus sich die Verzögerung zusammensetzt
Die Gesamtlatenz ist eine Kette, und jedes Glied trägt bei. Optimieren lässt sich fast immer nur das größte Glied — meist die Antwortzeit des Sprachmodells.
- Netzlaufzeit zwischen Anrufer und System
- Erkennung des Sprechendes (hier entscheidet sich viel)
- Antwortzeit der Spracherkennung
- Antwortzeit des Sprachmodells
- Zeit bis zum ersten hörbaren Ton der Sprachsynthese
Was die Wahrnehmung verbessert
Zwei Verfahren helfen unabhängig von der reinen Rechenzeit: Die Antwort wird bereits begonnen, während der Anrufer noch spricht, und die Sprachausgabe beginnt, sobald die ersten Wörter feststehen, statt auf den ganzen Satz zu warten. Beides senkt die gefühlte Wartezeit erheblich, ohne dass ein einziges Modell schneller geworden wäre.
Häufige Fragen
Welche Latenz ist bei KI-Telefonie realistisch?
Gute Systeme liegen unter einer Sekunde für die volle Runde. Entscheidend ist dabei weniger der Mittelwert als der schlechteste Fall — ein einzelner Ausreißer von drei Sekunden zerstört den Eindruck.
Beeinflusst der Serverstandort die Latenz?
Ja, spürbar. Jeder Weg über den Atlantik und zurück kostet Zehntelsekunden, die im Gespräch fehlen — ein zusätzliches Argument für EU-Verarbeitung neben dem Datenschutz.
Offene Fragen zu Ihrem Telefon?
Sagen Sie uns, wie Ihre Anrufe heute laufen. Wir sagen Ihnen, was sich davon automatisieren lässt und was nicht.
Unverbindliche Beratung · DSGVO-konform · Made in Germany