Spracherkennung am Telefon
Warum Telefonaudio der schwierigste Fall ist
Spracherkennung, englisch Speech-to-Text, wandelt gesprochene Sprache in Text. Am Telefon ist die Aufgabe deutlich schwerer als beim Diktat am Schreibtisch: Das Signal ist auf einen schmalen Frequenzbereich beschränkt, oft komprimiert, häufig verrauscht, und der Sprecher hält kein Mikrofon in optimalem Abstand.
Was die Erkennung im Alltag scheitern lässt
Die Fehler treten selten gleichmäßig auf. Sie häufen sich bei genau den Wörtern, auf die es ankommt — Namen, Straßen, Fachbegriffe.
- Eigennamen und Straßennamen, besonders regionale
- Fachbegriffe der jeweiligen Branche
- Zahlenfolgen wie Kundennummern oder Kennzeichen
- Starker Dialekt und Hintergrundgeräusche
Wie man die Erkennung gezielt verbessert
Der wirksamste Hebel ist, dem System die Begriffe vorher zu nennen, die in diesem Betrieb häufig vorkommen: Behandlungsarten, Mitarbeiternamen, Ortsteile. Damit steigt die Trefferquote genau dort, wo Fehler teuer sind — deutlich stärker als durch den Wechsel auf ein größeres Modell.
Häufige Fragen
Wie gut ist Spracherkennung auf Deutsch?
Bei Hochdeutsch und ruhiger Umgebung sehr gut. Bei Dialekt, Nebengeräuschen und seltenen Eigennamen deutlich schwächer — und genau diese Fälle kommen am Telefon überdurchschnittlich oft vor.
Wird das Gespräch dafür aufgezeichnet?
Für die Erkennung wird Audio verarbeitet. Ob es darüber hinaus gespeichert wird, ist eine Frage der Konfiguration und gehört in den Auftragsverarbeitungsvertrag.
Offene Fragen zu Ihrem Telefon?
Sagen Sie uns, wie Ihre Anrufe heute laufen. Wir sagen Ihnen, was sich davon automatisieren lässt und was nicht.
Unverbindliche Beratung · DSGVO-konform · Made in Germany