Google hat nach eigenen Angaben „agentic video understanding“ für Gemini 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite eingeführt. Die Funktion steht für hochgeladene Videos und YouTube-Videos über die Gemini API in Google AI Studio sowie auf der Gemini Enterprise Agent Platform bereit.
Wie die Funktion arbeiten soll
Nach Darstellung des Unternehmens kombiniert die Funktion das Schlussfolgern der Modelle mit nativen Video-Werkzeugen. Sie soll gezielt Videosegmente in Bildmaterial, Audiospur und Transkripten suchen, scannen und untersuchen können.
Entwickler aktivieren das Verfahren laut Google, indem sie in der API-Konfiguration den Verarbeitungsmodus auf „agentic“ setzen. Google zufolge gilt die reguläre Token-Preisgestaltung der Gemini API; eine zusätzliche Gebühr für die Funktion falle nicht an.
Google nennt Einsparungen bei Token und Kosten
Google erklärt, die agentische Videoanalyse senke in Standard-Benchmarks für Videoanalyse die Kosten um bis zu 66 Prozent und den Tokenverbrauch um bis zu 88 Prozent. Gleichzeitig könne die Genauigkeit um bis zu 7 Prozent steigen.
Diese Werte sind Unternehmensangaben aus der Ankündigung. Das vorliegende Material enthält weder eine unabhängige Überprüfung noch Details zu den konkreten Benchmarks, Testaufgaben, Vergleichskonfigurationen oder den Bedingungen, unter denen die Höchstwerte erreicht wurden.
Sollten sich die Angaben in realen Anwendungen bestätigen, könnte der geringere Tokenverbrauch insbesondere bei der Verarbeitung längerer Videos relevant sein. Niedrigere Nutzungskosten hängen jedoch von der jeweiligen Anfrage, dem Videomaterial und der regulären Token-Abrechnung ab.
Weitere Verteilung angekündigt
In den kommenden Monaten soll die Technik laut Google außerdem die Funktion „Ask YouTube“ auf YouTube-Videoseiten unterstützen. Einen konkreten Termin nannte das Unternehmen nicht.
Auch für die Gemini-App ist ein baldiger Rollout für Nutzer über Flash- und Flash-Lite-Modelle angekündigt. Details zum Zeitplan oder zu möglichen regionalen Einschränkungen wurden in den vorliegenden Angaben nicht genannt.
Wie es weitergeht
Entwickler können die Funktion laut Google bereits über die API-Konfiguration aktivieren. Entscheidend wird sein, ob Google weitere technische und evaluative Details veröffentlicht und ob die angekündigten Integrationen in YouTube und die Gemini-App planmäßig folgen.
Änderungsvermerk: Erstmeldung auf Basis einer primären Google-DeepMind-Ankündigung. Unternehmensangaben zu Leistung und Kosten sind klar als solche gekennzeichnet.