Google hat das Text-to-Speech-Modell Gemini 3.5 Transcribe in einer stark überarbeiteten Version vorgestellt. Wie der Konzern
informiert, kommt das neue Modell auch mit Hintergrundgeräuschen, komplexem Jargon sowie Sprachstörungen zurecht und wandelt Audio-Material präzise in formatierten Text um.
Gemini 3.5 Transcribe wird via Gemini Enterprise Agent Platform und auch via Gemini API in
Google AI Studio bereitgestellt. Dabei werden zwei APIs unterstützt: einerseits für Echtzeit-Streaming, andererseits für vorgängig aufgenommene Audiodaten.
Dabei kann Gemini 3.5 Transcribe mit einer ganzen Reihe cleverer Innovationen aufwarten. So soll Smart Transcription dafür sorgen, dass Korrekturen im Audio-Material automatisch berücksichtigt werden. Auch werden Füllwörter und Fülllaute wie "ähms" und dergleichen automatisch entfernt. Weiter ist das Modell in der Lage, bis zu drei verschiedene Sprecher zu erkennen und bis zu 85 Sprachen inklusive regionalen Dialekten zu unterstützen. Dabei erreicht das Modell bei gestreamten Daten eine Fehlerquote bei der Worterkennung von unter 4 Prozent und von unter 2,6 Prozent bei aufgenommenem Material.
Gemini 3.5 Transcribe kann als Public Preview im Gemini API via Google AI Studio und Google Antigravity, in Gemini Enterprise for Customer Experience sowie in der Gemini App auf MacOS und demnächst auch im Chrome-Browser getestet werden.
(rd)