Gemini, Live

Gemini Live in Gmail und Docs: Google integriert Sprach-KI tiefer

Veröffentlicht am: 18.09.2026 um 02:12 Uhr | Redaktion boerse-global.de

Google bringt Sprachfunktionen in zentrale Workspace-Apps und veröffentlicht Gemini 3.8 Live mit neuen Audio-Modellen, Metriken und Preisen.

Google integriert Gemini Live in Gmail, Docs und Keep
Ein minimalistischer, moderner Büroraum mit einem leeren Schreibtisch und hellem Tageslicht, das durch ein großes Fenster fällt. Illustration mit AI erstellt.

Der US-Technologiekonzern Google hat die Integration seiner Sprach-KI Gemini Live in die zentralen Anwendungen des Workspace-Ökosystems bekannt gegeben. Nutzer von Gmail, Docs und Keep erhalten damit erweiterte Möglichkeiten, ihre Produktivität über sprachbasierte Assistenzsysteme zu steuern. Die Expansion ist Teil einer breiter angelegten Strategie, die künstliche Intelligenz tiefer in den Arbeitsalltag zu integrieren.

Funktionale Erweiterungen in Gmail, Docs und Keep

Die Ausweitung von Gemini Live umfasst spezifische Funktionen für verschiedene Workspace-Apps. Innerhalb von Gmail ermöglicht der Dienst den Nutzern, komplexe Fragen zum Inhalt ihres Postfachs per Sprache zu stellen. In Google Docs unterstützt die KI bei der Erstellung von Entwürfen, während Keep Live dazu dient, gesprochene Notizen automatisch zu strukturieren.

Der Zugang zu diesen Funktionen ist nach Abonnement-Stufen gestaffelt. Gmail Live und Keep Live stehen Nutzern der Tarife Google AI Plus, Pro und Ultra zur Verfügung. Docs Live ist hingegen auf die Abonnements Pro und Ultra begrenzt.

Auch bei der mobilen Nutzung gibt es Unterschiede: Während Gmail Live unter Android und iOS für alle drei genannten Stufen verfügbar ist, bleibt Keep Live vorerst auf Android-Nutzer der Stufen Pro und Ultra beschränkt. Docs Live kann auf mobilen Endgeräten ebenfalls nur in den Tarifen Pro und Ultra genutzt werden.

Technisch basieren die Sprachfunktionen in diesen Anwendungen auf dem im August vorgestellten Modell Gemini 3.5 Transcribe. Während Workspace-Kunden in Kürze Zugriff erhalten sollen, steht ein genauer Termin für Business-Kunden noch nicht fest.

Marktstart von Gemini 3.8 und neue Leistungsmetriken

Anzeige

Moderne Tools wie Gemini Live versprechen eine enorme Zeitersparnis, doch oft scheitert die Effizienz im Büroalltag an manuellen Arbeitsschritten. Dieser kostenlose PDF-Ratgeber enthüllt die wichtigsten Tastenkombinationen, mit denen Sie in Outlook, Word und Excel deutlich schneller zum Ziel kommen. Die besten Office-Shortcuts jetzt kostenlos herunterladen

Parallel zur Integration in die Nutzeranwendungen hat Google Mitte September die Modelle Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking veröffentlicht. Diese sind über die Gemini API sowie das AI Studio allgemein verfügbar.

Die neuen Modelle unterstützen mehr als 97 Sprachen, darunter Arabisch, Chinesisch, Hindi, Portugiesisch und Französisch. Eine Besonderheit der nativen Audio-Modelle ist die Fähigkeit, die Sprache während eines laufenden Gesprächs dynamisch zu wechseln. Durch asynchrones Function Calling kann die KI zudem Werkzeuge nutzen, während sie spricht.

Hinsichtlich der Leistungsfähigkeit erreicht Gemini 3.8 Live Extended Thinking laut Untersuchungen von Artificial Analysis 82,6 Punkte im Speech-to-Speech Quality Index. Bei der agentischen Aufgabenerfüllung liegt der Wert bei 68,6 Prozent, ebenso wie im Bereich ?-Voice.

In der Kategorie ?-Voice-banking wurden 35,1 Prozent erzielt, während das Modell in Big Bench Audio einen Wert von 97,7 Prozent erreicht. Zur Kennzeichnung der generierten Inhalte setzt Google auf die SynthID-Technologie, welche die Audiodaten markiert.

Anzeige

Wer täglich mit den Programmen der Google- oder Microsoft-Umgebung arbeitet, kann durch weniger Klicks spürbar produktiver werden. Erfahren Sie in diesem kostenlosen Report, welche Tastenkombinationen Profis nutzen, um ihre Aufgaben in der halben Zeit zu erledigen. Kostenlosen Tastenkombinationen-Guide sichern

Die Preisstruktur für die Audio-Nutzung von Gemini 3.8 Live wurde auf 3 US-dollar pro Million Input-Tokens (entspricht etwa 0,005 US-Dollar pro Minute) und 12 US-Dollar pro Million Output-Tokens (rund 0,018 US-Dollar pro Minute) festgesetzt.

Wachsender Wettbewerb bei KI-Sprachagenten

Neben Google treiben auch andere Marktteilnehmer die Entwicklung voran. Das Unternehmen NetEase Youdao präsentierte Mitte September in Peking eine umfangreiche KI-Agent-Matrix für die Bereiche Büro, Lernen und Marketing. Der CEO des Unternehmens, Zhou Feng, betonte in diesem Zusammenhang, dass sich der Wettbewerb zunehmend von Einzelmodellen hin zu einer Kombination aus Modell, Agent und Workflow verschiebe.

Neu vorgestellt wurde unter anderem der kostenlose AI Voice Agent Bage Shuo, der gesprochene Sprache direkt in strukturierten Text umwandelt. Laut Herstellerangaben erreicht das System eine bis zu fünffache Effizienz im Vergleich zum Tippen. Google-Daten stützen den Trend zur Spracheingabe mit der Feststellung, dass diese generell etwa 2,5-mal schneller sei als die manuelle Eingabe.

Bage Shuo unterstützt die Übersetzung in 124 Sprachen und soll in Fachgebieten wie Wirtschaft, Physik und Medizin eine Genauigkeit von bis zu 98 Prozent erreichen. Zudem wurden die Modellmatrix Ziyue, LobsterAI 2.0 sowie die Hardware OpenPods präsentiert.

Disclaimer...

de | wissenschaft | 70121078 |