Aktualisiert

Latenz in der Telefonie

Warum die Antwortzeit über die Gesprächsqualität entscheidet

Latenz ist die Zeit zwischen dem Ende des Gesagten und dem Beginn der Antwort. Im menschlichen Gespräch liegt diese Pause typischerweise bei etwa zwei Zehntelsekunden. Ein System, das eine ganze Sekunde braucht, wirkt zögerlich; ab etwa anderthalb Sekunden halten Anrufer die Verbindung für gestört und sprechen hinein oder legen auf.

Woraus sich die Verzögerung zusammensetzt

Die Gesamtlatenz ist eine Kette, und jedes Glied trägt bei. Optimieren lässt sich fast immer nur das größte Glied — meist die Antwortzeit des Sprachmodells.

  • Netzlaufzeit zwischen Anrufer und System
  • Erkennung des Sprechendes (hier entscheidet sich viel)
  • Antwortzeit der Spracherkennung
  • Antwortzeit des Sprachmodells
  • Zeit bis zum ersten hörbaren Ton der Sprachsynthese

Was die Wahrnehmung verbessert

Zwei Verfahren helfen unabhängig von der reinen Rechenzeit: Die Antwort wird bereits begonnen, während der Anrufer noch spricht, und die Sprachausgabe beginnt, sobald die ersten Wörter feststehen, statt auf den ganzen Satz zu warten. Beides senkt die gefühlte Wartezeit erheblich, ohne dass ein einziges Modell schneller geworden wäre.

Häufige Fragen

Welche Latenz ist bei KI-Telefonie realistisch?

Gute Systeme liegen unter einer Sekunde für die volle Runde. Entscheidend ist dabei weniger der Mittelwert als der schlechteste Fall — ein einzelner Ausreißer von drei Sekunden zerstört den Eindruck.

Beeinflusst der Serverstandort die Latenz?

Ja, spürbar. Jeder Weg über den Atlantik und zurück kostet Zehntelsekunden, die im Gespräch fehlen — ein zusätzliches Argument für EU-Verarbeitung neben dem Datenschutz.

Offene Fragen zu Ihrem Telefon?

Sagen Sie uns, wie Ihre Anrufe heute laufen. Wir sagen Ihnen, was sich davon automatisieren lässt und was nicht.

Jetzt anrufen

Unverbindliche Beratung · DSGVO-konform · Made in Germany