Zum Inhalt springen
Strategie-Call buchen

Automatisierung · 27. März 2026

Gemini 3.1 Flash Live: Sprache direkt verarbeiten

Google hat am 26. März ein Echtzeit-Sprachmodell vorgestellt, das Audio direkt verarbeitet. Was das für Telefonassistenten im Mittelstand bedeutet.
Ruhiges Profil einer grünen Keramikskulptur mit feiner gelber Linie

Automatisierung 3 Min. Lesezeit Von Alexander Otto

Voice AISprachmodelleAutomatisierungDatenschutz

Google hat am 26. März 2026 Gemini 3.1 Flash Live vorgestellt, nach eigener Aussage das bislang beste Audio- und Sprachmodell des Unternehmens. Es soll Gespräche präziser und mit geringerer Verzögerung führen. Entwickler erhalten es als Vorschau über die Gemini Live API in Google AI Studio, Unternehmen über Gemini Enterprise for Customer Experience. Endnutzer treffen es in Search Live und Gemini Live.

Was neu ist

Klassische Sprachassistenten arbeiten in Stufen: Sprache wird in Text umgewandelt, ein Sprachmodell antwortet, ein weiteres System spricht den Text. Jede Stufe kostet Zeit und verliert Nuancen. Flash Live verarbeitet Audio direkt. Google nennt als Vorteil, dass das Modell Tonlage und Tempo besser erkennt und etwa Frust oder Verwirrung im Gespräch berücksichtigen kann.

Auf dem Benchmark ComplexFuncBench Audio, der prüft, ob ein Sprachmodell aufgrund gesprochener Anweisungen die richtigen Funktionen aufruft, erreicht es 90,8 Prozent. Im Scale-AI-Test Audio MultiChallenge sind es 36,1 Prozent mit aktiviertem Denkmodus. Der zweite Wert zeigt: Bei längeren, komplizierten Gesprächen bleibt viel Luft nach oben. Beide Zahlen sind Herstellerangaben.

Was das für Telefon und Service heißt

Für Voice-Projekte im Mittelstand sind zwei Punkte wichtig. Erstens kann ein Telefonassistent flüssiger wirken, wenn Antwortzeiten sinken. Zweitens kann ein Modell, das beim Sprechen Funktionen aufruft, direkt im Gespräch einen Termin prüfen oder einen Auftragsstatus abfragen. Der Assistent wird damit vom Auskunftsgeber zum Bearbeiter.

Das erhöht den Anspruch an die Absicherung. Eine falsch verstandene Zahl am Telefon landet sonst in einem Auftrag.

Kennzeichnung ist eingebaut

Bemerkenswert ist das Wasserzeichen SynthID: Google bettet es unhörbar in die erzeugte Sprache ein, damit sich KI-generiertes Audio zuverlässig erkennen lässt. Das passt zu den anstehenden Transparenzpflichten der KI-Verordnung. Sie gelten nach aktuellem Stand ab August 2026 und verlangen unter anderem, dass Nutzer erkennen, wenn sie mit einer KI sprechen. Planen Sie die Ansage am Gesprächsbeginn also von Anfang an ein.

Checkliste vor dem ersten Pilot

  • Welche Anrufarten eignen sich? Beginnen Sie mit Terminvereinbarungen oder Statusfragen, nicht mit Reklamationen.
  • Wo werden Gesprächsdaten verarbeitet, und wie lange werden sie gespeichert? Klären Sie das mit Ihrem Datenschutzbeauftragten, bevor Sie Kunden anrufen lassen.
  • Welche Übergabe an einen Menschen ist vorgesehen, und wie schnell?
  • Wie messen Sie Verständnisfehler? Hören Sie in der Testphase eine Stichprobe der Gespräche ab.

Wer bereits mit Voice-Ansätzen arbeitet, sollte das neue Modell als weitere Option in den Vergleich aufnehmen. Ein Wechsel lohnt erst, wenn Tests mit Ihrer Sprache, Ihrem Dialekt und Ihren Fachbegriffen besser ausfallen.

Quellen

Einen Voice-Pilot planen

Wir wählen mit Ihnen passende Anrufarten, klären Datenschutz und messen die Qualität im Pilot.