IT-Glossar

Was ist Speech-to-Text?

Speech-to-Text (STT), auf Deutsch Spracherkennung, verwandelt gesprochene Worte automatisch in Text. Das Gegenstück, das Text in eine künstliche Stimme umsetzt, heißt Text-to-Speech.

Spracherkennung steckt heute in vielen Alltagsfunktionen: in Diktierprogrammen, in abgeschriebenen Voicemails und in jedem KI-Telefonassistenten.

So arbeitet die Erkennung

Ein trainiertes Modell zerlegt das Audiosignal in kurze Abschnitte und ermittelt die wahrscheinlichste Wortfolge. Moderne Verfahren berücksichtigen den Satzzusammenhang und liefern Ergebnisse fast in Echtzeit. Für Telefonie zählt beides: Genauigkeit und Geschwindigkeit, denn jede Verzögerung erhöht die Latenz des Gesprächs.

Einsatz in der Telefonie

  • Voicemail-Nachrichten als Text per E-Mail
  • Gesprächsnotizen und Zusammenfassungen
  • der erste Baustein eines Voicebots oder KI-Telefonassistenten: Erst wenn das Gesagte als Text vorliegt, kann ein Sprachmodell es verstehen

Grenzen und Datenschutz

Hintergrundlärm, schlechte Verbindungen, starke Dialekte, Fachbegriffe und Eigennamen führen zu Fehlern. Wichtige Angaben wie Rufnummern sollte ein Assistent deshalb bestätigen lassen. Da Sprache personenbezogene Daten enthält, gehören Verarbeitungsort und Speicherdauer in den Vertrag – mehr im Ratgeber KI-Telefonassistent und DSGVO.

Abschrift als eigenständiger Nutzen

Spracherkennung lohnt sich auch ohne KI-Assistent. Abgeschriebene Voicemails lassen sich überfliegen, durchsuchen und weiterleiten, statt sie nacheinander abzuhören. Gesprächsnotizen müssen nicht mehr getippt werden. Voraussetzung ist eine saubere rechtliche Grundlage, denn wer Gespräche aufzeichnet oder abschreibt, muss die Beteiligten darüber informieren.

Wie gut versteht eine KI Ihre Anrufer?

In einer Demo hören Sie, wie unser KI-Telefonassistent mit echten Gesprächssituationen umgeht.

05308 935030Mo–Do 8:30–17:00 Uhr, Fr 8:30–15:30 Uhr
AnrufenAnfrage senden