Google hat Gemini 3.5 Transcribe vorgestellt, ein Speech-to-Text-Modell für intelligente Sprachinteraktionen und Echtzeit-Transkription. Entwicklern steht es laut dem Blogbeitrag in öffentlicher Vorschau über die Gemini API zur Verfügung, unter anderem über Google AI Studio und Google Antigravity; für Unternehmen nennt Google die Gemini Enterprise Agent Platform.

Quellenlage
PrimärquelleGoogle DeepMind Blog
Bestätigt durch1 unabhängiger Ursprung · 2 Quellen insgesamt
OffenPreise, Nutzungsgrenzen und technische Zugangsvoraussetzungen werden im vorliegenden Dossier nicht genannt.

Zwei Schnittstellen für Live- und aufgezeichnetes Audio

Google teilt das Angebot in zwei APIs auf. Für interaktive Sprachanwendungen soll das Modell „gemini-3.5-transcribe-live“ über die Live API kontinuierliches, bidirektionales Streaming mit einer Latenz von unter einer Sekunde liefern.

Für bereits aufgezeichnete Audiodateien, etwa Meetings und Gesprächsprotokolle, ist laut Google „gemini-3.5-transcribe“ über die Interactions API vorgesehen. Diese Variante bietet Sprecherzuordnung und Zeitstempel auf Wortebene.

Bei aufgezeichnetem Audio soll die Sprecherzuordnung für bis zu drei Sprecher ausgelegt sein. Unterstützung für mehr als drei Sprecher bezeichnet Google als experimentell.

Leistungsangaben stammen von Google

Google erklärt, Gemini 3.5 Transcribe verbessere sich gegenüber dem Vorgängermodell Chirp 3 bei Fähigkeiten, Wortfehlerrate und Latenz. Auf einer Auswahl wichtiger Sprachen und Regionen des FLEURS-Benchmarks habe das Modell eine Wortfehlerrate von 5,50 Prozent im Streaming-Betrieb und 5,04 Prozent ohne Streaming erreicht.

Zudem verweist Google auf Messungen von Artificial Analysis: Demnach liege die durchschnittliche Wortfehlerrate bei 4,0 Prozent für Streaming und 2,6 Prozent für Nicht-Streaming-Anwendungen. Die Zeit bis zur endgültigen Transkription verbessere sich demnach um 70 Prozent. Das Dossier enthält jedoch keine unabhängige Quelle, die Testaufbau, Vergleichsbedingungen oder diese Ergebnisse überprüft.

Sprach- und Produktfunktionen

Nach Angaben des Konzerns erkennt und transkribiert das Modell automatisch mehr als 85 Sprachen und kann während einer laufenden Transkription Sprachwechsel verarbeiten. Rohes Audio soll direkt in formatierten Text umgewandelt werden.

Für Endnutzer nennt Google die Gemini-App auf macOS auf Englisch sowie Rambler auf Android in ausgewählten Ländern und Sprachen. Eine Diktierfunktion für beliebige Web-Eingabefelder in Chrome sei angekündigt, aber noch nicht verfügbar.

Für Entwicklerplattformen nennt Google unter anderem Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel und Vision Agents als Nutzer der Gemini Live API für sprachgesteuerte Schnittstellen.

Einordnung

Die Einführung erweitert Googles Gemini-Angebot um getrennte Werkzeuge für Live-Dialoge und die nachträgliche Verarbeitung von Aufnahmen. Besonders relevant sind dabei Funktionen wie Sprecherzuordnung und Wortzeitstempel, die über eine reine Textausgabe hinausgehen.

Die Leistungspositionierung gegenüber Chirp 3 beruht in diesem Dossier allerdings ausschließlich auf Angaben von Google und auf von Google zitierten Messwerten. Sie erlaubt daher keinen unabhängigen Vergleich mit anderen Spracherkennungsmodellen oder Rückschlüsse auf die Qualität bei konkreten Einsatzbedingungen.

Wie es weitergeht

Entwickler und Unternehmenskunden können die öffentliche Vorschau über die genannten Gemini-Zugänge erproben. Entscheidend wird sein, ob Google weitere Details zu Preisen, Benchmark-Methodik und dem Start der Chrome-Integration veröffentlicht.

Änderungsvermerk: Erstmeldung auf Basis eines Google-DeepMind-Blogbeitrags vom 26. August 2026. Sämtliche Leistungs- und Verfügbarkeitsangaben sind als Angaben von Google kenntlich gemacht.