Zuletzt geprüft am
Gemini-Modelle

Gemini-Modelle im Vergleich: Welches passt zu deiner Aufgabe?

Google hat seit Mai 2026 vier Flash-Modelle veröffentlicht, das Pro-Modell steckt weiter im Preview-Status, und mit Gemini 4 Argon ist ein neues Spitzenmodell angekündigt, das noch nicht breit nutzbar ist. Hier siehst du, welches Modell in welchem Google-Produkt steckt, was es über die API kostet, welche Modelle in der EU laufen und welches du für welche Aufgabe wählst.

TL;DR: Das neueste allgemein verfügbare Gemini-Modell ist Gemini 3.8 Flash vom 2. September 2026. Aktuelles Pro-Modell bleibt Gemini 3.1 Pro im Preview-Status, Gemini 3.5 Pro führt Google weiter als ‚coming soon‘. Gemini 4 Argon ist seit dem 30. September angekündigt, aber noch nicht breit nutzbar. Die Flash-Modelle 3.6, 3.7 und 3.8 kosten über die API bis Ende 2026 0,75 $ Input und 3,75 $ Output pro Million Tokens, ab dem 1. Januar 2027 das Doppelte.

Neuestes allgemein verfügbares Modell 3.8 Flash

Seit 2. September 2026, laut Google das intelligenteste Flash-Modell.

Flash-Preis bis 31.12.2026 0,75 $ / 3,75 $

Input und Output pro Million Tokens, ab 2027 1,50 $ / 7,50 $.

Gemini-App ohne Abo ab 9. Oktober Flash-Lite

Gilt laut Google für private Konten ohne Google-AI-Abo.

Überblick

Welche Gemini-Modelle gibt es 2026?

Das neueste allgemein verfügbare Gemini-Modell ist Gemini 3.8 Flash vom 2. September 2026. Aktuelles Pro-Modell bleibt Gemini 3.1 Pro im Preview-Status, Gemini 3.5 Pro führt Google weiter als ‚coming soon‘. Seit Mai 2026 kamen nach 3.5 Flash drei neue Flash-Generationen: 3.6 Flash am 21. Juli, 3.7 Flash am 13. August und 3.8 Flash am 2. September, dazu am 21. Juli 3.5 Flash-Lite. Gemini 4 Argon ist seit dem 30. September angekündigt, aber noch nicht breit nutzbar.

Die API rechnet pro Million Tokens ab, getrennt nach Input und Output; ein Token entspricht grob einem Wortteil. Das Kontextfenster ist die Textmenge, die ein Modell in einer Anfrage verarbeiten kann, der Output die maximale Länge der Antwort. Alle Preise in der Tabelle sind Listenpreise der Gemini API (Paid Tier) in US-Dollar, abgerufen am 5. Oktober 2026:

Modell Modell-ID Status Erschienen Kontext / Output (Tokens) Preis Input / Output pro Mio. Tokens
Gemini 3.8 Flash gemini-3.8-flash GA, laut Google „our most intelligent Flash model“ 02.09.2026 1.048.576 / 65.536 0,75 $ / 3,75 $ bis 31.12.2026, ab 01.01.2027 1,50 $ / 7,50 $
Gemini 3.7 Flash gemini-3.7-flash GA 13.08.2026 1.048.576 / 65.536 wie 3.8 Flash
Gemini 3.6 Flash gemini-3.6-flash GA 21.07.2026 1.048.576 / 65.536 wie 3.8 Flash
Gemini 3.5 Flash-Lite gemini-3.5-flash-lite GA 21.07.2026 1.048.576 / 65.536 0,30 $ / 2,50 $
Gemini 3.5 Flash gemini-3.5-flash Stable, von Google als „Legacy“ geführt 19.05.2026 1.048.576 / 65.536 1,50 $ / 9,00 $
Gemini 3.1 Flash-Lite gemini-3.1-flash-lite Stable, Abschaltung frühestens 07.05.2027 GA 07.05.2026 k. A. 0,25 $ (Audio 0,50 $) / 1,50 $
Gemini 3.1 Pro gemini-3.1-pro-preview Preview, aktuelles Pro-Modell 19.02.2026 1.048.576 / 65.536 2 $ / 12 $, bei Prompts über 200.000 Tokens 4 $ / 18 $
Gemini 3.5 Pro keine „coming soon“ nicht erschienen k. A. k. A.
Gemini 4 Argon keine öffentliche ID angekündigt, Stand 05.10.2026 weder in API noch App Ankündigung 30.09.2026 Output bis 1 Mio.; Eingabekontext von Google nicht genannt Einführungspreis 2 $ / 10 $, danach 4 $ / 20 $; auf keiner Preisseite gelistet
Kurz erklärt: Flash-Lite, Flash, Pro

Flash-Lite, Flash und Pro sind Googles drei Klassen von Textmodellen, so heißen sie auch im Modellwähler der Gemini-App. Flash-Lite ist für hohes Volumen zum kleinen Preis gedacht, Flash ist das Arbeitsmodell für die meisten Aufgaben, Pro die Klasse für die schwierigsten Aufgaben. GA (General Availability) bedeutet allgemein verfügbar, Preview kennzeichnet eine Vorabversion.

Für die Flash-Modelle 3.6 bis 3.8 gibt es zusätzlich ein Free Tier, also ein kostenloses Kontingent für Tests, für 3.1 Pro nicht. Was die Gemini-Abos und Google Workspace kosten, steht im Guide Gemini-Preise. Die Gegenstücke bei den anderen Anbietern findest du im Claude-Modell-Vergleich und in der Modellübersicht des ChatGPT-Guides.

Produkte

Welches Modell steckt in welchem Google-Produkt?

Das hängt vom Produkt und vom Plan ab. In der Gemini-App wählst du ab dem 9. Oktober 2026 je nach Abo zwischen Flash-Lite, Flash und Pro, im KI-Modus der Google Suche ist Gemini 3.5 Flash das Standardmodell, in der Gemini-Enterprise-App ist seit dem 23. September 2026 Gemini 3.8 Flash allgemein verfügbar und standardmäßig aktiviert. Über die API wählst du jedes verfügbare Modell direkt über seine Modell-ID.

Produkt und Plan Modelle (Stand 5. Oktober 2026) Wichtig zu wissen
Gemini-App ohne Abo (privates Konto) Bis 8. Oktober laut Abo-Seite 3.6 Flash und eingeschränkter Zugriff auf 3.1 Pro; ab 9. Oktober nur noch Flash-Lite Kontextfenster 32.000 Tokens. Die Fachpresse ordnet Flash-Lite als Gemini 3.5 Flash-Lite ein (Sekundärquelle), Googles Hilfeseite spricht nur von Flash-Lite.
Google AI Plus (4,99 € pro Monat) Flash-Lite und Flash Kontextfenster 128.000 Tokens. Den Termin der Umstellung teilt Google Plus-Kunden per E-Mail mit.
Google AI Pro (21,99 €) und Google AI Ultra (ab 99,99 €) Flash-Lite, Flash und Pro; Gemini 3.8 Flash laut Google in der App, im KI-Modus der Suche und in Gemini in Google Sheets Kontextfenster 1 Million Tokens. Deep Think gibt es mit Google AI Ultra; ob es mit der Umstellung auch zu Google AI Pro kommt, beschreiben Googles Hilfeseiten widersprüchlich (Stand 5. Oktober 2026).
Google Suche: KI-Modus und Übersicht mit KI KI-Modus: Gemini 3.5 Flash als Standardmodell weltweit seit 19. Mai 2026. Übersicht mit KI: Gemini 3 als Standardmodell seit 27. Januar 2026 Den KI-Modus gibt es in Deutschland seit 8. Oktober 2025. Mit Google AI Pro oder Ultra steht dort zusätzlich 3.8 Flash bereit.
Google Workspace (Business-Pläne) Gemini-App mit Unternehmensdatenschutz in allen Business-Plänen; Pro-Modell in Business Standard und Plus mit bis zu 25 Prompts pro 4 Stunden Kontextfenster in der Gemini-App: Business Starter 32.000 Tokens, Business Standard und Plus 1 Million Tokens.
Gemini Enterprise Gemini 3.8 Flash ist seit 23. September 2026 in der Gemini-Enterprise-App allgemein verfügbar und standardmäßig aktiviert, in den Regionen global, us und eu Gemini 3.1 Pro läuft in der EU ohne Datenresidenz und ohne ML-Verarbeitung.
Gemini API und Gemini Enterprise Agent Platform (früher Vertex AI) Alle Modelle der Übersicht per Modell-ID, außer 3.5 Pro und 4 Argon Free Tier für 3.6 bis 3.8 Flash in der Gemini API. Datenverarbeitung in der EU über die Agent Platform, Details im EU-Abschnitt.

Die Abo-Preise stammen von Googles deutscher Abo-Seite. Google AI Ultra gibt es in zwei Stufen: für 99,99 € mit fünffachen und für 219,99 € mit zwanzigfachen Pro-Limits. Die Umstellung am 9. Oktober betrifft laut Google private Konten. Je Modell lässt sich in der App die Denkstufe niedrig, mittel oder hoch wählen, also wie gründlich das Modell vor der Antwort nachdenkt. Feste Tageszahlen veröffentlicht Google nicht mehr: Die Limits sind rechenbasiert und erneuern sich alle fünf Stunden bis zu einem Wochenlimit. Was das für Gratisnutzer bedeutet, steht im Guide Gemini kostenlos nutzen.

Für Unternehmen wichtig: Ein bezahltes Google-AI-Abo ändert an den Datenregeln privater Konten nichts. Die Unternehmenszusagen (kein Training und keine menschliche Prüfung ohne Erlaubnis) gelten nur für Workspace-Konten. Private Konten haben im Unternehmen deshalb nichts zu suchen. Was Gemini in den Business-Plänen kann, erklärt der Guide Gemini in Google Workspace.

Arbeitsmodell

Was kann Gemini 3.8 Flash?

Gemini 3.8 Flash ist seit dem 2. September 2026 allgemein verfügbar und laut Google „our most intelligent Flash model“. Es baut laut Google auf 3.7 Flash auf und arbeitet bei komplexen Aufgaben gründlicher, mit zusätzlichen Denkschritten und teils höherem Tokenverbrauch, vor allem bei hoher Denkstufe. Google beschreibt es als Modell für lange Software-Projekte, autonome Agenten und komplexe Unternehmensabläufe („engineered for long-horizon software engineering, autonomous agents, and complex enterprise workflows“).

Modell-IDgemini-3.8-flash
Erschienen2. September 2026, allgemein verfügbar (GA)
Basisbaut laut Google auf Gemini 3.7 Flash auf
Kontextfenster / Output1.048.576 / 65.536 Tokens
WissensstandMärz 2026, in manchen Bereichen Januar 2025
API-Preis bis 31.12.20260,75 $ Input, 3,75 $ Output pro Million Tokens
API-Preis ab 01.01.20271,50 $ Input, 7,50 $ Output pro Million Tokens
Batch0,375 $ / 1,875 $ (ab 2027: 0,75 $ / 3,75 $)
Cached Input0,075 $ (ab 2027: 0,15 $), zuzüglich Speicher 0,50 $ (ab 2027: 1,00 $) pro Million Tokens und Stunde
Free Tiervorhanden
Gemini-Appmit Google AI Pro und Ultra
Weitere ProdukteKI-Modus der Suche und Gemini in Google Sheets (Google AI Pro und Ultra); seit 23.09.2026 in der Gemini-Enterprise-App standardmäßig aktiviert
EUAgent Platform mit Multiregion eu und ML-Verarbeitung in der EU
SondervarianteGemini 3.8 Flash Cyber, seit 2. September 2026 im Fairwind Program für Cyberabwehr

Kurz erklärt: Bei Batch sammelt Google Anfragen und verarbeitet sie nicht sofort, dafür halbiert sich der Preis. Beim Context Caching speichert Google gleichbleibende Teile eines Prompts zwischen, etwa lange Anweisungen; jedes weitere Lesen kostet dann nur einen Bruchteil des Input-Preises, dazu kommt eine Speichergebühr pro Stunde. Der Wissensstand zeigt, bis wann das Modell trainiert wurde. Für Fragen zu späteren Ereignissen braucht 3.8 Flash eine Websuche oder eure eigenen Dokumente.

Die zusätzlichen Denkschritte haben eine Kehrseite: Laut Google kann 3.8 Flash vor allem bei hoher Denkstufe mehr Tokens verbrauchen, um das beste Ergebnis zu erreichen. Bei gleichem Tokenpreis wie 3.7 Flash kann eine einzelne Aufgabe dadurch mehr kosten. Für einfache, häufige Aufgaben lohnt deshalb ein Vergleich mit niedriger Denkstufe oder mit 3.5 Flash-Lite. Google selbst spricht bei 3.8 Flash von der dritten Flash-Veröffentlichung in nur sechs Wochen. Bei diesem Tempo gehört die Modell-ID in eine Einstellung und nicht fest in den Code.

Flash-Reihe

Was unterscheidet 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite?

3.7 Flash und 3.6 Flash sind die direkten Vorgänger von 3.8 Flash und kosten über die API heute genauso viel; 3.5 Flash-Lite ist das günstige Modell für hohes Volumen. Alle drei sind allgemein verfügbar und verarbeiten bis zu 1.048.576 Tokens Kontext. Für die Wahl zählen deshalb vor allem Aufgabe, Volumen und laufende Integrationen. API-Listenpreise in US-Dollar pro Million Tokens:

Modell Erschienen Preis Input / Output Was du wissen solltest
3.7 Flash 13.08.2026 0,75 $ / 3,75 $ bis 31.12.2026, danach 1,50 $ / 7,50 $ Mit 3.7 Flash kam der halbierte Einführungspreis. 3.8 Flash baut auf diesem Modell auf.
3.6 Flash 21.07.2026 wie 3.7 Flash Startete mit 1,50 $ / 7,50 $, heute gilt auch hier der Einführungspreis. In der Gemini-App laut Abo-Seite bis 8. Oktober das Flash-Modell des kostenlosen Zugangs.
3.5 Flash-Lite 21.07.2026 0,30 $ / 2,50 $; Batch 0,15 $ / 1,25 $; Cached Input 0,03 $ Laut Google 350 Output-Tokens pro Sekunde. Ersatz für 3.1 Flash-Lite.
3.5 Flash (Legacy) 19.05.2026 1,50 $ / 9,00 $; Batch 0,75 $ / 4,50 $ Standardmodell im KI-Modus der Suche. Über die API teurer als die neueren Flash-Modelle.
3.1 Flash-Lite GA 07.05.2026 0,25 $ (Audio 0,50 $) / 1,50 $ Abschaltung frühestens am 7. Mai 2027, Ersatz 3.5 Flash-Lite.

Meine Einordnung: Für neue Projekte gibt es kaum einen Grund, 3.6 oder 3.7 Flash zu wählen, weil 3.8 Flash bis Jahresende denselben Listenpreis hat. Die älteren Versionen haben ihren Platz dort, wo eine Integration bereits läuft und sauber getestet ist. 3.5 Flash ist über die API teurer als die neueren Flash-Modelle, bleibt aber interessant, wenn ihr eine Einzelregion in Frankfurt braucht, die es laut einer Sekundärquelle nur für 3.5 Flash gibt (siehe EU-Abschnitt). Für Klassifizieren, Extrahieren, Übersetzen und andere einfache Aufgaben mit großem Volumen ist 3.5 Flash-Lite der naheliegende Startpunkt: Es kostet heute 60 Prozent weniger Input und ein Drittel weniger Output als 3.8 Flash, gegenüber den Flash-Preisen ab 2027 sind es beim Output zwei Drittel weniger, gerechnet mit den heutigen Listenpreisen.

Modellwahl in Abläufen

Welches Modell in welchem Ablauf arbeitet, sollte eine Einstellung sein und kein Umbau. Dazu gehören Tests mit echten Fällen, eine klare Kostenobergrenze und ein Mensch, der Ergebnisse mit Außenwirkung freigibt. Wie solche Automatisierungen aufgebaut sind, beschreibe ich unter KI-Automatisierung.

KI-Automatisierung ansehen
Pro-Klasse

Was ist mit Gemini 3.1 Pro und 3.5 Pro?

Gemini 3.1 Pro ist seit dem 19. Februar 2026 das aktuelle Pro-Modell, läuft aber weiter im Preview-Status. Gemini 3.5 Pro ist nicht erschienen, Google führt es auf der DeepMind-Seite als „coming soon“. Zur Google I/O am 19. Mai 2026 hatte Google 3.5 Pro für den „nächsten Monat“ angekündigt; am 21. Juli hieß es, das Modell werde mit Partnern getestet und breit verfügbar, sobald es fertig sei („as soon as it's ready“). Ein neues Datum nennt Google nicht.

3.1 Pro verarbeitet bis zu 1.048.576 Tokens Kontext und gibt bis zu 65.536 Tokens aus. Über die API kostet es 2 $ Input und 12 $ Output pro Million Tokens bei Prompts bis 200.000 Tokens, darüber 4 $ und 18 $. Cached Input kostet 0,20 $ beziehungsweise 0,40 $, ein Free Tier gibt es nicht, einen Wissensstand nennt Google für 3.1 Pro nicht. In der Gemini-App gibt es das Pro-Modell ab dem 9. Oktober mit Google AI Pro und Ultra, in Workspace in Business Standard und Plus mit bis zu 25 Prompts pro 4 Stunden.

Zwei Punkte für Unternehmen: Erstens ist 3.1 Pro ein Preview-Modell. Für dauerhaft laufende Prozesse würde ich deshalb nicht allein darauf bauen, sondern den Wechsel auf ein Flash-Modell oder ein späteres Pro-Modell von Anfang an einplanen. Zweitens läuft 3.1 Pro in Gemini Enterprise in der EU ohne Datenresidenz und ohne ML-Verarbeitung, auf der Agent Platform laut Sekundärquelle nur global. Wer Daten in der EU verarbeiten muss, landet damit bei den Flash-Modellen; von Google selbst belegt ist die ML-Verarbeitung in der EU derzeit für 3.8 Flash.

Ausblick

Was ist Gemini 4 Argon und wann kommt es?

Google hat am 30. September 2026 Gemini 4 Argon angekündigt. Breit nutzbar ist es noch nicht: Zuerst kommen ausgewählte Sicherheitsteams im Fairwind Program, danach zahlende API-Kunden und Google AI Ultra. Stand 5. Oktober 2026 ist Argon weder in der API noch in der Gemini-App verfügbar. Für Unternehmen im Mittelstand ändert sich deshalb kurzfristig wenig.

Google nennt Argon „Our frontier model for real-world coding, enterprise knowledge work, and cyber defense“, ein Datum für die breite Freigabe gibt es nicht. Zur Einführung soll Argon 2 $ Input und 10 $ Output pro Million Tokens kosten, danach 4 $ und 20 $; wann die Einführungsphase endet, sagt Google nicht. Argon kann bis zu 1 Million Tokens ausgeben, Gemini 3.8 Flash und 3.1 Pro kommen auf 65.536. Zum Eingabekontext macht Google keine Angabe, zur Verfügbarkeit in der EU ebenfalls nicht. Preise, Benchmarks und den Vergleich mit Claude Opus 5.5 und GPT-6 Astra findest du im Artikel Gemini 4 Argon: Was Googles neues Spitzenmodell kann.

Bild, Video, Audio

Welche Bild-, Video- und Audiomodelle bietet Google?

Für Bilder bietet Google die Nano-Banana-Modelle, für Video Gemini Omni 1.1 Flash und Veo 3.1, für Musik Lyria 3.5 und für Sprache eigene Modelle für Sprachausgabe, Live-Dialoge und Transkription. Zwei Einschränkungen gelten im EWR und damit auch in Deutschland: Das Stimmklonen der neuen TTS-Modelle ist dort nicht verfügbar, ebenso wenig in der Schweiz und im Vereinigten Königreich, und in der Gemini-App kannst du keine eigenen Videos zum Bearbeiten hochladen. Videos erzeugen kannst du in der App mit einem privaten Konto nur mit Google-AI-Abo, mit einem Arbeitskonto nur mit einer berechtigten Workspace-Lizenz, jeweils ab 18 Jahren.

Modell Wofür Stand und Preis (Gemini API)
Nano Banana 2 (gemini-3.1-flash-image) Bilder erzeugen, 0,5K bis 4K Stable; pro Bild 0,045 $ (0,5K), 0,067 $ (1K), 0,101 $ (2K), 0,151 $ (4K), über Batch die Hälfte. In der Gemini-App in allen Plänen
Nano Banana 2 Lite (gemini-3.1-flash-lite-image) Bilder in großer Menge, nur 1K rund 0,034 $ je Bild
Nano Banana Pro (gemini-3-pro-image) Premium-Bildmodell Preis in der Gemini API nicht ausgewiesen; Bildausgaben tragen seit November 2025 C2PA-Metadaten
Gemini Omni 1.1 Flash Video bis 4K, Szenenverlängerung bis 40 Sekunden, Start- und Endbild GA seit 27.08.2026; rund 0,10 $ pro Sekunde in 720p
Veo 3.1 Videogenerierung, laut DeepMind weiter das führende Videomodell Die Preview-Versionen in der Gemini API enden am 22.10.2026, Ersatz dort Omni 1.1 Flash
Lyria 3.5 Musik mit Gesang, kurze oder längere Tracks seit 04.09.2026, in der Gemini-App für alle Nutzer weltweit
Gemini 3.8 Flash TTS und Flash-Lite TTS Sprachausgabe (Text-to-Speech) in über 100 Sprachen mit mehr als 2.000 Stimmen seit 23.09.2026; Stimmklonen nicht im EWR, in der Schweiz und im Vereinigten Königreich
Gemini 3.8 Live und Live Extended Thinking Sprachdialoge in Echtzeit, 97 Sprachen, Tool-Aufrufe im Hintergrund seit 15.09.2026
Gemini 3.5 Transcribe Transkription in mehr als 85 Sprachen mit Sprechertrennung und Zeitstempel je Wort GA seit 26.08.2026

Bei generierten Medien zählt im Unternehmen die Kennzeichnung. Google versieht Bilder, Videos und Audio, die mit Google-KI erzeugt oder bearbeitet wurden, mit dem unsichtbaren Wasserzeichen SynthID; prüfen kannst du das in der Gemini-App. Seit dem 2. August 2026 gilt Art. 50 des EU AI Act mit Transparenzpflichten für KI-generierte Inhalte. Wie Wasserzeichen und Kennzeichnung zusammenhängen, erklärt der Beitrag KI-Wasserzeichen nach AI Act Art. 50. Welche Medienfunktionen die Gemini-App in Deutschland bietet, steht im Guide Gemini-Funktionen.

Datenschutz

Welche Gemini-Modelle laufen mit Datenverarbeitung in der EU?

Wer Gemini per API mit Datenverarbeitung in der EU nutzen will, geht über die Gemini Enterprise Agent Platform (früher Vertex AI) und die EU-Multiregion. Für Gemini 3.8 Flash nennt Google auf der Agent Platform die Regionen global sowie die Multiregionen us und eu, keine Einzelregion wie Frankfurt. Dass auch 3.7 und 3.6 Flash keine Einzelregion Frankfurt haben und 3.1 Pro dort nur global läuft, stützt sich auf eine Sekundärquelle (innFactory, Stand 30.09.2026). Eine Multiregion fasst mehrere Rechenzentren innerhalb eines Gebiets zusammen, hier der EU; ML-Verarbeitung heißt, dass auch die Berechnung der Antwort dort stattfindet und nicht nur die Speicherung.

Modell EU-Verarbeitung (Stand 5. Oktober 2026) Quelle
3.8 Flash Agent Platform: Regionen global, us und eu, ML-Verarbeitung in us und eu. Gemini Enterprise: in der EU-Multiregion mit Datenresidenz und ML-Verarbeitung, dort seit 23.09.2026 standardmäßig aktiviert Primärquelle Google
3.7 Flash, 3.6 Flash, 3.5 Flash-Lite EU-Multiregion mit Datenresidenz, keine Einzelregion Frankfurt Sekundärquelle (innFactory)
3.5 Flash zusätzlich in den Einzelregionen Frankfurt (europe-west3) und London Sekundärquelle (innFactory)
3.1 Pro Agent Platform nur global, ohne EU-Residenz; Gemini Enterprise in der EU ohne Datenresidenz und ohne ML-Verarbeitung Sekundärquelle innFactory (Agent Platform), Primärquelle Google (Gemini Enterprise)
4 Argon keine Angabe von Google Ankündigung vom 30.09.2026

Drei Details gehören zur Planung:

  • Aufpreis für die Region: Regionale statt globale Endpunkte, etwa die EU-Multiregion, kosten auf der Agent Platform seit dem 1. Juli 2026 für allgemein verfügbare Modelle ab Gemini 3 einen Aufschlag. Laut Preisliste kostet 3.8 Flash regional 0,825 $ statt 0,75 $ Input pro Million Tokens (ab 2027 1,65 $ statt 1,50 $), also 10 Prozent mehr.
  • Grounding und Speicherung: Grounding mit der Google Suche, also das Anreichern der Antwort mit aktuellen Suchergebnissen, speichert auf der Agent Platform 30 Tage und läuft in Gemini Enterprise nur global. Für Zero Data Retention verlangt Google eine Ausnahme von der Missbrauchsüberwachung, Web Grounding for Enterprise statt der normalen Suchanbindung, den Verzicht auf Grounding mit Google Maps und keine Session Resumption in der Live API. Das In-Memory-Caching verletzt Zero Data Retention laut Google nicht.
  • Gemini API über AI Studio: Für Nutzer im EWR, in der Schweiz und im Vereinigten Königreich gelten die Datenregeln der bezahlten Dienste auch für AI Studio und das kostenlose Kontingent; Google nutzt die Inhalte dann nicht zur Produktverbesserung. Diese Regel betrifft die Nutzung eurer Daten, nicht den Ort der Verarbeitung. Der von Google dokumentierte Weg zur EU-Verarbeitung ist die Agent Platform.

Gemini Enterprise bietet die Multiregion eu mit Datenresidenz und ML-Verarbeitung in der EU für die Editionen Standard, Plus, Pay-as-you-go und Frontline. Eine reine Deutschland-Region gibt es weder dort noch in Workspace. In Workspace lassen sich ruhende Daten ab Business Standard auf Europa festlegen, die Verarbeitung in Europa gibt es nur in Enterprise Plus, Enterprise Essentials Plus und Frontline Plus. Verträge, Training und Datenregionen im Detail stehen im Guide Gemini und DSGVO, die Gegenstücke unter Claude und DSGVO und ChatGPT und DSGVO. Eine Rechtsberatung im Sinne des RDG ist das nicht.

Lebenszyklus

Welche Modelle und Werkzeuge werden abgeschaltet?

Bis Mai 2027 laufen mehrere Gemini-Modelle und Google-Werkzeuge aus; die nächsten Termine sind die Veo-3.1-Previews am 22. Oktober und Opal am 17. November 2026. Google nennt bei Abkündigungen ausdrücklich die frühestmöglichen Termine („the earliest possible dates“). Wer Gemini in Automationen, Apps oder Skripten nutzt, sollte die Liste mit den eigenen Modell-IDs abgleichen.

Datum Was Ersatz
18.06.2026 Gemini CLI und die IDE-Erweiterungen von Gemini Code Assist bedienen keine Nutzer von Google AI Pro und Ultra und der kostenlosen Stufe Gemini Code Assist for individuals mehr Antigravity CLI; Gemini CLI bleibt mit bezahlten API-Schlüsseln nutzbar
21.07.2026 Sampling-Parameter temperature, top_p und top_k abgekündigt k. A.
17.08.2026 Imagen 4 in der Gemini API abgeschaltet Nano Banana 2
17.09.2026 Gemini Code Assist nicht mehr in neuen oder online verlängerten Abos von Gemini Enterprise Standard und Plus enthalten Google Antigravity
18.09.2026 Gemini 2.5 Pro, Flash und Flash-Lite nur noch für Nutzer, die sie zuvor aktiv genutzt haben Gemini 3.x
02.10.2026 Nano Banana (gemini-2.5-flash-image) abgeschaltet Nano Banana 2 oder 2 Lite
22.10.2026 Veo-3.1-Previews in der Gemini API Gemini Omni 1.1 Flash
17.11.2026 Opal (Google Labs) und „Gems made by Labs“, ohne automatische Migration Skills in Gemini bzw. AI Studio
26.11.2026 Vertex AI Extensions Gemini Enterprise Agent Platform
22.03.2027 Firebase Studio wird eingestellt Google AI Studio oder Google Antigravity
07.05.2027 Gemini 3.1 Flash-Lite, frühestens Gemini 3.5 Flash-Lite

Dazu kommt eine Preisänderung, die für die Planung genauso zählt wie eine Abschaltung: Die Einführungspreise der Flash-Modelle 3.6, 3.7 und 3.8 laufen am 31. Dezember 2026 aus. Außerdem führt Google Skills ein, also wiederverwendbare Anweisungen für bestimmte Aufgaben, die die Gems ablösen. In privaten Konten werden Gems im November 2026 automatisch migriert; in Workspace stehen Gems ab dem 17. November 2026 in den Einstellungen und werden am 1. März 2027 entfernt, mit automatischer Überführung in Skill-Entwürfe. Was Skills können, steht im Guide Gemini-Funktionen.

Entscheidungshilfe

Welches Gemini-Modell solltest du wählen?

Für die meisten Aufgaben im Unternehmen ist Gemini 3.8 Flash der richtige Start, für einfache Aufgaben mit großem Volumen 3.5 Flash-Lite und für die schwierigsten Analysen ein Vergleich mit 3.1 Pro. Die folgende Zuordnung ist meine Einordnung auf Basis von Googles Angaben, kein Testergebnis. Den Ausschlag geben 20 bis 50 echte Fälle aus eurem Alltag.

Aufgabe Startpunkt Warum
E-Mails, Zusammenfassungen, Texte im Büroalltag Gemini in Google Workspace, voller Umfang ab Business Standard läuft in Gmail, Docs und Meet mit Unternehmensdatenschutz, ohne eigene Integration
Klassifizieren, Extrahieren, Übersetzen in großer Menge 3.5 Flash-Lite 0,30 $ / 2,50 $ pro Million Tokens, laut Google 350 Output-Tokens pro Sekunde
Agenten, Dokumentenauswertung, Coding 3.8 Flash laut Google das intelligenteste Flash-Modell, bis Ende 2026 zum Einführungspreis
Schwierigste Analysen mit hohem Anspruch 3.1 Pro, im direkten Vergleich mit 3.8 Flash Pro-Klasse, aber Preview-Status; keine ML-Verarbeitung in der EU (Gemini Enterprise laut Google, Agent Platform laut Sekundärquelle nur global)
Daten müssen in der EU verarbeitet werden 3.8 Flash über die Agent Platform, EU-Multiregion ML-Verarbeitung in der EU laut Google belegt
Bilder für Marketing und Produktdarstellung Nano Banana 2, für große Mengen 2 Lite ab rund 0,034 $ je Bild; Kennzeichnung nach Art. 50 mitdenken
Sprachassistenten und Telefonie 3.8 Live, für Ansagen 3.8 Flash TTS 97 bzw. über 100 Sprachen; Stimmklonen nicht im EWR, in der Schweiz und im Vereinigten Königreich
Protokolle aus Meetings und Gesprächen 3.5 Transcribe Sprechertrennung und Zeitstempel je Wort; Information der Beteiligten und Betriebsrat vorher klären
Spitzenmodell für alles Gemini 4 Argon: abwarten Stand 5. Oktober 2026 nicht verfügbar, kein Datum

Budget 2027: Die Einführungspreise der Flash-Modelle 3.6, 3.7 und 3.8 laufen am 31. Dezember 2026 aus; ab 1. Januar 2027 verdoppeln sie sich auf 1,50 $ Input und 7,50 $ Output pro Million Tokens. Plant euer Budget 2027 mit dem doppelten Preis. Ein Rechenmuster mit Listenpreisen, ohne Batch, Cache und Steuern: 10 Millionen Input- und 2 Millionen Output-Tokens im Monat kosten mit 3.8 Flash heute 15 $ und ab Januar 2027 30 $, mit 3.5 Flash-Lite 8 $ und mit 3.1 Pro 44 $ (Prompts bis 200.000 Tokens). Wer Argon einplant, rechnet mit 4 $ und 20 $, weil Google das Ende der Einführungsphase nicht nennt.

Zwei Regeln helfen unabhängig vom Modell. Erstens: Legt die Modell-ID als Einstellung an und nicht fest im Code, denn Google hat neue Flash-Versionen zuletzt im Abstand von rund drei Wochen veröffentlicht. Zweitens: Vergleicht Modelle mit euren eigenen Fällen statt mit Benchmarks, gemessen an Ergebnis, Laufzeit und Kosten je brauchbarer Antwort. Wie die Modelle der anderen Anbieter einzuordnen sind, zeigen der Claude-Modell-Vergleich, die ChatGPT-Modelle im ChatGPT-Guide und der Artikel zu GPT-6.1 Sol. Den Plattformvergleich findest du unter Beste KI 2026, Claude vs. Gemini und ChatGPT vs. Gemini, Begriffe wie Token oder Kontextfenster im KI-Glossar.

Weiterführend

Was du als Nächstes lesen solltest

Quellen

Offizielle Quellen und Stand der Recherche

Alle Angaben zu Modellen, Preisen, Regionen und Terminen stammen aus Primärquellen von Google, abgerufen am 05.10.2026. Sekundärquellen sind als solche gekennzeichnet. Oberfläche, Modellauswahl und Freischaltung können je nach Konto, Plan und Region abweichen; Google rollt Änderungen schrittweise aus.

  1. Google AI for Developers: Gemini-API-Modelle und Modellseite Gemini 3.8 Flash, abgerufen am 05.10.2026
  2. Google AI for Developers: Preise der Gemini API, abgerufen am 05.10.2026
  3. Google AI for Developers: Abkündigungen und Changelog, abgerufen am 05.10.2026
  4. Google DeepMind: Modellkarten, Modellkarte Gemini 3.8 Flash und Gemini Pro, abgerufen am 05.10.2026
  5. Google: Gemini 3.8 Flash und 3.8 Flash Cyber, Gemini 3.7 Flash und Gemini 3.6 Flash und 3.5 Flash-Lite, abgerufen am 05.10.2026
  6. Google: Ankündigungen der I/O 2026, abgerufen am 05.10.2026
  7. Google: Gemini 4 Argon und Fairwind Program, abgerufen am 05.10.2026
  8. Gemini-Hilfe: Änderungen der Modellverfügbarkeit ab Oktober 2026 und Limits und Kontextfenster je Plan, abgerufen am 05.10.2026
  9. Gemini: deutsche Abo-Seite und Gemini Release Notes, abgerufen am 05.10.2026
  10. Google: Suche auf der I/O 2026, Updates für KI-Modus und AI Overviews und KI-Modus startet in DACH, abgerufen am 05.10.2026
  11. Workspace-Hilfe: Gemini-App je Edition, Gemini-App ein- und ausschalten und Datenregionen, abgerufen am 05.10.2026
  12. Google Workspace: Privacy Hub zu generativer KI und Gemini-Hilfe: Datenschutz in Gemini Apps, abgerufen am 05.10.2026
  13. Google Cloud: Gemini Enterprise Release Notes und Standorte, abgerufen am 05.10.2026
  14. Google Cloud: Gemini 3.8 Flash auf der Agent Platform, Preise der Agent Platform und Data Governance, abgerufen am 05.10.2026
  15. Google: Nutzungsbedingungen der Gemini API, abgerufen am 05.10.2026
  16. Google AI for Developers: Bildgenerierung, Gemini Omni 1.1 Flash, Veo, Lyria 3.5, Gemini 3.8 TTS und Gemini 3.8 Live, abgerufen am 05.10.2026
  17. Gemini-Hilfe: Videos erstellen und SynthID in der Gemini-App, abgerufen am 05.10.2026
  18. Google Developers Blog: Gemini CLI wird Antigravity CLI, Gemini Code Assist für Einzelpersonen, Opal FAQ, Firebase Studio und Vertex AI Release Notes, abgerufen am 05.10.2026
  19. Google: Skills in Gemini und Workspace Updates: Skills in Gemini-App und Workspace, abgerufen am 05.10.2026
  20. Sekundärquelle zur Einordnung von Flash-Lite für Gratisnutzer: 9to5Google, 03.10.2026
  21. Sekundärquelle zu EU-Regionen auf der Agent Platform: innFactory, Stand 30.09.2026, abgerufen am 05.10.2026
FAQ

Häufige Fragen zu den Gemini-Modellen

Welches ist das neueste Gemini-Modell?

Das neueste allgemein verfügbare Gemini-Modell ist Gemini 3.8 Flash vom 2. September 2026. Aktuelles Pro-Modell bleibt Gemini 3.1 Pro im Preview-Status, Gemini 3.5 Pro führt Google weiter als ‚coming soon‘. Gemini 4 Argon ist seit dem 30. September 2026 angekündigt, Stand 5. Oktober 2026 aber weder in der API noch in der Gemini-App verfügbar.

Was kostet Gemini 3.8 Flash über die API?

Bis zum 31. Dezember 2026 kostet Gemini 3.8 Flash 0,75 $ Input und 3,75 $ Output pro Million Tokens. Ab dem 1. Januar 2027 verdoppelt sich der Preis auf 1,50 $ und 7,50 $, dasselbe gilt für 3.7 und 3.6 Flash. Über Batch halbieren sich die Preise, und für Tests gibt es ein Free Tier.

Welches Modell bekommen Gratisnutzer der Gemini-App ab dem 9. Oktober 2026?

Nur noch Flash-Lite: Ab dem 9. Oktober 2026 stellt Google die Gemini-App für private Konten um, ohne Abo gibt es nur noch das Modell Flash-Lite. Flash gibt es ab Google AI Plus, das Pro-Modell ab Google AI Pro. Die Fachpresse ordnet Flash-Lite als Gemini 3.5 Flash-Lite ein, Googles Hilfeseite spricht nur von Flash-Lite.

Kann ich Gemini 4 Argon schon nutzen?

Nein, Stand 5. Oktober 2026 ist Argon weder in der API noch in der Gemini-App verfügbar. Zuerst bekommen ausgewählte Sicherheitsteams im Fairwind Program Zugang, danach zahlende API-Kunden und Abonnenten von Google AI Ultra. Ein Datum nennt Google nicht.

Wann kommt Gemini 3.5 Pro?

Das ist offen: Google führt Gemini 3.5 Pro als ‚coming soon‘ und nennt kein Datum. Zur I/O im Mai 2026 war es für den Folgemonat angekündigt, am 21. Juli hieß es, Google teste es mit Partnern. Bis dahin ist Gemini 3.1 Pro im Preview-Status das aktuelle Pro-Modell.

Welche Gemini-Modelle laufen mit Datenverarbeitung in der EU?

Über die Gemini Enterprise Agent Platform (früher Vertex AI) läuft Gemini 3.8 Flash laut Google in der EU-Multiregion mit ML-Verarbeitung in der EU, eine Einzelregion wie Frankfurt nennt Google dafür nicht. Laut einer Sekundärquelle (innFactory) laufen dort auch 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite mit Datenresidenz in der EU-Multiregion, Gemini 3.1 Pro dagegen nur global. Zu Gemini 4 Argon äußert sich Google nicht.

Was ist der Unterschied zwischen Flash-Lite, Flash und Pro?

Flash-Lite ist die Klasse für hohes Volumen zum kleinen Preis, etwa Gemini 3.5 Flash-Lite für 0,30 $ Input und 2,50 $ Output pro Million Tokens. Flash ist das Arbeitsmodell für die meisten Aufgaben, aktuell Gemini 3.8 Flash. Pro ist für die schwierigsten Aufgaben gedacht, aktuell Gemini 3.1 Pro im Preview-Status für 2 $ Input und 12 $ Output.

Welche Gemini-Modelle werden demnächst abgeschaltet?

Am 22. Oktober 2026 enden die Veo-3.1-Previews in der Gemini API, Ersatz ist Gemini Omni 1.1 Flash. Gemini 3.1 Flash-Lite wird frühestens am 7. Mai 2027 abgeschaltet, Gemini 2.5 Pro, Flash und Flash-Lite stehen seit dem 18. September 2026 nur noch Nutzern offen, die sie zuvor aktiv genutzt haben. Das alte Nano Banana ist seit dem 2. Oktober 2026 abgeschaltet.

Private KI-Konten im Team

Ab dem 9. Oktober bekommen Gratisnutzer der Gemini-App nur noch Flash-Lite. Wer im Team privat mit Gemini arbeitet, wechselt dann vielleicht ins eigene Abo oder zu einem anderen Werkzeug, beides oft ohne Regeln. Der Shadow-AI-Check macht sichtbar, wer welche KI mit welchen Daten nutzt, bevor daraus ein Datenschutzproblem wird.

Shadow-AI-Check ansehen
Einordnung

Was solltest du jetzt tun?

Teste Gemini 3.8 Flash mit echten Fällen, plane das Budget 2027 mit doppelten Flash-Preisen und warte bei Argon ab, bis Google Verfügbarkeit, Preis nach der Einführungsphase und die EU-Frage klärt. Wer Gemini im Team ohne Workspace nutzt, sollte vor dem 9. Oktober klären, mit welchen Konten gearbeitet wird. Ein neues Modell verbessert eure Abläufe nur, wenn Aufgabe, Daten und Freigaben vorher geklärt sind.

Du willst klären, welches Gemini-Modell eure Abläufe trägt und was es 2027 kostet? Schreib mir über die Kontaktseite oder buch direkt ein Gespräch.

Erstgespräch buchen →
Jean Hinz, KI-Berater für den Mittelstand aus Lüneburg

Über den Autor

Jean Hinz

KI-Berater für den Mittelstand, Lüneburg/Hamburg

Ich begleite Geschäftsführungen und Teams dabei, KI vom Einzelexperiment in einen belastbaren Betrieb zu überführen. Schwerpunkt: Prozesse zuerst, Werkzeuge danach. Praxis aus Industrie, Tourismus, Veranstaltungen und weiteren Unternehmensbereichen.

  • Beratung & Umsetzung aus einer Hand
  • Arbeit an euren eigenen Prozessen
  • Seit 2023 KI-Beratung
Gemini im Unternehmen?

Ich zeige dir, welches Modell eure Abläufe trägt.

Von der Modellwahl über Kosten bis zum sicheren Betrieb. Pragmatisch, mit Mensch in der Schleife.

Kostenfreies Erstgespräch buchen →

30 Minuten · Unverbindlich · Per Video-Call

Erstgespräch buchen →