Gemini: Google revolutioniert Spracheingabe - neues KI-Modell optimiert diktierte Texte vollständig (Video)
Google hat erst vor wenigen Tagen eine echte Revolution für die Tastatur-App Gboard gezeigt und jetzt veröffentlicht man das hinter „Rambler“ stehende KI-Modell in einer öffentlich verfügbaren neuen Version. Ab...
- 2 min read
Google hat erst vor wenigen Tagen eine echte Revolution für die Tastatur-App Gboard gezeigt und jetzt veröffentlicht man das hinter „Rambler“ stehende KI-Modell in einer öffentlich verfügbaren neuen Version. Ab sofort steht das neue Speech-to-Text-Modell Gemini 3.5 Transcribe zur Nutzung bereit und kann mit sehr ähnlichen Features aufwarten wie die Tastatur-App.

Google baut die 3.5-Generation von Gemini weiter aus und hat jetzt das neue Gemini 3.5 Transcribe veröffentlicht, das als starke Erweiterung für Speech-to-Text an den Start geht. Dieses widmet sich weiterhin der Echtzeit-Transkription und fügt noch eine große Prise intelligenter Sprachinteraktionen hinzu, um den Nutzern nicht nur eine Transkribierung, sondern eine bereinigte und optimierte Version zu bieten.
Im Gegensatz zu herkömmlichen Modellen filtert es Füllwörter (wie „äh“ oder „ähm“) automatisch heraus, korrigiert Versprecher („Treffen wir uns Dienstag, äh nein, Mittwoch“) und formatiert den Text selbstständig. Das Modell liefert sehr präzise Ergebnisse, selbst bei Hintergrundgeräuschen oder komplexem Fachjargon. Es erreicht eine Wortfehlerrate (Word Error Rate) von nur 4,0 % beim Echtzeit-Streaming und 2,6 % bei Audioaufzeichnungen.
https://www.googlewatchblog.de/wp-content/uploads/gemini-transcribe.mp4
Im obigen Video könnt ihr euch das beispielhaft ansehen, wir haben es euch aber auch schon im Artikel zu Gboard Rambler ausführlich vorgestellt. Das neue Gemini 3.5 Transcribe unterstützt über 85 Sprachen (inklusive regionaler Akzente) und kann bei Aufzeichnungen bis zu drei verschiedene Sprecher unterscheiden und mit genauen Zeitstempeln versehen. Das Modell schreibt nicht nur Text, sondern versteht auch Absichten und kann Aufgaben wie Dateianalysen oder Bildgenerierungen per Sprachbefehl an andere Gemini-Modelle delegieren.
DAs neue KI-Modell steht jetzt für Entwickler über das Google AI Studio und die Gemini Enterprise Agent Platform in zwei Varianten zur Verfügung: als Live API für Anwendungen in Echtzeit (unter einer Sekunde Latenz) und als Interactions API für bereits aufgezeichnete Audiodateien.
» Android & Gemini: Google bringt den KI-ChatBot in das Kontextmenü – lässt sich noch schneller aufrufen