TL;DR: Das neueste allgemein verfügbare Gemini-Modell ist Gemini 3.8 Flash vom 2. September 2026. Aktuelles Pro-Modell bleibt Gemini 3.1 Pro im Preview-Status, Gemini 3.5 Pro führt Google weiter als ‚coming soon‘. Gemini 4 Argon ist seit dem 30. September angekündigt, aber noch nicht breit nutzbar. Die Flash-Modelle 3.6, 3.7 und 3.8 kosten über die API bis Ende 2026 0,75 $ Input und 3,75 $ Output pro Million Tokens, ab dem 1. Januar 2027 das Doppelte.
Seit 2. September 2026, laut Google das intelligenteste Flash-Modell.
Input und Output pro Million Tokens, ab 2027 1,50 $ / 7,50 $.
Gilt laut Google für private Konten ohne Google-AI-Abo.
Welche Gemini-Modelle gibt es 2026?
Das neueste allgemein verfügbare Gemini-Modell ist Gemini 3.8 Flash vom 2. September 2026. Aktuelles Pro-Modell bleibt Gemini 3.1 Pro im Preview-Status, Gemini 3.5 Pro führt Google weiter als ‚coming soon‘. Seit Mai 2026 kamen nach 3.5 Flash drei neue Flash-Generationen: 3.6 Flash am 21. Juli, 3.7 Flash am 13. August und 3.8 Flash am 2. September, dazu am 21. Juli 3.5 Flash-Lite. Gemini 4 Argon ist seit dem 30. September angekündigt, aber noch nicht breit nutzbar.
Die API rechnet pro Million Tokens ab, getrennt nach Input und Output; ein Token entspricht grob einem Wortteil. Das Kontextfenster ist die Textmenge, die ein Modell in einer Anfrage verarbeiten kann, der Output die maximale Länge der Antwort. Alle Preise in der Tabelle sind Listenpreise der Gemini API (Paid Tier) in US-Dollar, abgerufen am 5. Oktober 2026:
| Modell | Modell-ID | Status | Erschienen | Kontext / Output (Tokens) | Preis Input / Output pro Mio. Tokens |
|---|---|---|---|---|---|
| Gemini 3.8 Flash | gemini-3.8-flash |
GA, laut Google „our most intelligent Flash model“ | 02.09.2026 | 1.048.576 / 65.536 | 0,75 $ / 3,75 $ bis 31.12.2026, ab 01.01.2027 1,50 $ / 7,50 $ |
| Gemini 3.7 Flash | gemini-3.7-flash |
GA | 13.08.2026 | 1.048.576 / 65.536 | wie 3.8 Flash |
| Gemini 3.6 Flash | gemini-3.6-flash |
GA | 21.07.2026 | 1.048.576 / 65.536 | wie 3.8 Flash |
| Gemini 3.5 Flash-Lite | gemini-3.5-flash-lite |
GA | 21.07.2026 | 1.048.576 / 65.536 | 0,30 $ / 2,50 $ |
| Gemini 3.5 Flash | gemini-3.5-flash |
Stable, von Google als „Legacy“ geführt | 19.05.2026 | 1.048.576 / 65.536 | 1,50 $ / 9,00 $ |
| Gemini 3.1 Flash-Lite | gemini-3.1-flash-lite |
Stable, Abschaltung frühestens 07.05.2027 | GA 07.05.2026 | k. A. | 0,25 $ (Audio 0,50 $) / 1,50 $ |
| Gemini 3.1 Pro | gemini-3.1-pro-preview |
Preview, aktuelles Pro-Modell | 19.02.2026 | 1.048.576 / 65.536 | 2 $ / 12 $, bei Prompts über 200.000 Tokens 4 $ / 18 $ |
| Gemini 3.5 Pro | keine | „coming soon“ | nicht erschienen | k. A. | k. A. |
| Gemini 4 Argon | keine öffentliche ID | angekündigt, Stand 05.10.2026 weder in API noch App | Ankündigung 30.09.2026 | Output bis 1 Mio.; Eingabekontext von Google nicht genannt | Einführungspreis 2 $ / 10 $, danach 4 $ / 20 $; auf keiner Preisseite gelistet |
Flash-Lite, Flash und Pro sind Googles drei Klassen von Textmodellen, so heißen sie auch im Modellwähler der Gemini-App. Flash-Lite ist für hohes Volumen zum kleinen Preis gedacht, Flash ist das Arbeitsmodell für die meisten Aufgaben, Pro die Klasse für die schwierigsten Aufgaben. GA (General Availability) bedeutet allgemein verfügbar, Preview kennzeichnet eine Vorabversion.
Für die Flash-Modelle 3.6 bis 3.8 gibt es zusätzlich ein Free Tier, also ein kostenloses Kontingent für Tests, für 3.1 Pro nicht. Was die Gemini-Abos und Google Workspace kosten, steht im Guide Gemini-Preise. Die Gegenstücke bei den anderen Anbietern findest du im Claude-Modell-Vergleich und in der Modellübersicht des ChatGPT-Guides.
Welches Modell steckt in welchem Google-Produkt?
Das hängt vom Produkt und vom Plan ab. In der Gemini-App wählst du ab dem 9. Oktober 2026 je nach Abo zwischen Flash-Lite, Flash und Pro, im KI-Modus der Google Suche ist Gemini 3.5 Flash das Standardmodell, in der Gemini-Enterprise-App ist seit dem 23. September 2026 Gemini 3.8 Flash allgemein verfügbar und standardmäßig aktiviert. Über die API wählst du jedes verfügbare Modell direkt über seine Modell-ID.
| Produkt und Plan | Modelle (Stand 5. Oktober 2026) | Wichtig zu wissen |
|---|---|---|
| Gemini-App ohne Abo (privates Konto) | Bis 8. Oktober laut Abo-Seite 3.6 Flash und eingeschränkter Zugriff auf 3.1 Pro; ab 9. Oktober nur noch Flash-Lite | Kontextfenster 32.000 Tokens. Die Fachpresse ordnet Flash-Lite als Gemini 3.5 Flash-Lite ein (Sekundärquelle), Googles Hilfeseite spricht nur von Flash-Lite. |
| Google AI Plus (4,99 € pro Monat) | Flash-Lite und Flash | Kontextfenster 128.000 Tokens. Den Termin der Umstellung teilt Google Plus-Kunden per E-Mail mit. |
| Google AI Pro (21,99 €) und Google AI Ultra (ab 99,99 €) | Flash-Lite, Flash und Pro; Gemini 3.8 Flash laut Google in der App, im KI-Modus der Suche und in Gemini in Google Sheets | Kontextfenster 1 Million Tokens. Deep Think gibt es mit Google AI Ultra; ob es mit der Umstellung auch zu Google AI Pro kommt, beschreiben Googles Hilfeseiten widersprüchlich (Stand 5. Oktober 2026). |
| Google Suche: KI-Modus und Übersicht mit KI | KI-Modus: Gemini 3.5 Flash als Standardmodell weltweit seit 19. Mai 2026. Übersicht mit KI: Gemini 3 als Standardmodell seit 27. Januar 2026 | Den KI-Modus gibt es in Deutschland seit 8. Oktober 2025. Mit Google AI Pro oder Ultra steht dort zusätzlich 3.8 Flash bereit. |
| Google Workspace (Business-Pläne) | Gemini-App mit Unternehmensdatenschutz in allen Business-Plänen; Pro-Modell in Business Standard und Plus mit bis zu 25 Prompts pro 4 Stunden | Kontextfenster in der Gemini-App: Business Starter 32.000 Tokens, Business Standard und Plus 1 Million Tokens. |
| Gemini Enterprise | Gemini 3.8 Flash ist seit 23. September 2026 in der Gemini-Enterprise-App allgemein verfügbar und standardmäßig aktiviert, in den Regionen global, us und eu | Gemini 3.1 Pro läuft in der EU ohne Datenresidenz und ohne ML-Verarbeitung. |
| Gemini API und Gemini Enterprise Agent Platform (früher Vertex AI) | Alle Modelle der Übersicht per Modell-ID, außer 3.5 Pro und 4 Argon | Free Tier für 3.6 bis 3.8 Flash in der Gemini API. Datenverarbeitung in der EU über die Agent Platform, Details im EU-Abschnitt. |
Die Abo-Preise stammen von Googles deutscher Abo-Seite. Google AI Ultra gibt es in zwei Stufen: für 99,99 € mit fünffachen und für 219,99 € mit zwanzigfachen Pro-Limits. Die Umstellung am 9. Oktober betrifft laut Google private Konten. Je Modell lässt sich in der App die Denkstufe niedrig, mittel oder hoch wählen, also wie gründlich das Modell vor der Antwort nachdenkt. Feste Tageszahlen veröffentlicht Google nicht mehr: Die Limits sind rechenbasiert und erneuern sich alle fünf Stunden bis zu einem Wochenlimit. Was das für Gratisnutzer bedeutet, steht im Guide Gemini kostenlos nutzen.
Für Unternehmen wichtig: Ein bezahltes Google-AI-Abo ändert an den Datenregeln privater Konten nichts. Die Unternehmenszusagen (kein Training und keine menschliche Prüfung ohne Erlaubnis) gelten nur für Workspace-Konten. Private Konten haben im Unternehmen deshalb nichts zu suchen. Was Gemini in den Business-Plänen kann, erklärt der Guide Gemini in Google Workspace.
Was kann Gemini 3.8 Flash?
Gemini 3.8 Flash ist seit dem 2. September 2026 allgemein verfügbar und laut Google „our most intelligent Flash model“. Es baut laut Google auf 3.7 Flash auf und arbeitet bei komplexen Aufgaben gründlicher, mit zusätzlichen Denkschritten und teils höherem Tokenverbrauch, vor allem bei hoher Denkstufe. Google beschreibt es als Modell für lange Software-Projekte, autonome Agenten und komplexe Unternehmensabläufe („engineered for long-horizon software engineering, autonomous agents, and complex enterprise workflows“).
| Modell-ID | gemini-3.8-flash |
|---|---|
| Erschienen | 2. September 2026, allgemein verfügbar (GA) |
| Basis | baut laut Google auf Gemini 3.7 Flash auf |
| Kontextfenster / Output | 1.048.576 / 65.536 Tokens |
| Wissensstand | März 2026, in manchen Bereichen Januar 2025 |
| API-Preis bis 31.12.2026 | 0,75 $ Input, 3,75 $ Output pro Million Tokens |
| API-Preis ab 01.01.2027 | 1,50 $ Input, 7,50 $ Output pro Million Tokens |
| Batch | 0,375 $ / 1,875 $ (ab 2027: 0,75 $ / 3,75 $) |
| Cached Input | 0,075 $ (ab 2027: 0,15 $), zuzüglich Speicher 0,50 $ (ab 2027: 1,00 $) pro Million Tokens und Stunde |
| Free Tier | vorhanden |
| Gemini-App | mit Google AI Pro und Ultra |
| Weitere Produkte | KI-Modus der Suche und Gemini in Google Sheets (Google AI Pro und Ultra); seit 23.09.2026 in der Gemini-Enterprise-App standardmäßig aktiviert |
| EU | Agent Platform mit Multiregion eu und ML-Verarbeitung in der EU |
| Sondervariante | Gemini 3.8 Flash Cyber, seit 2. September 2026 im Fairwind Program für Cyberabwehr |
Kurz erklärt: Bei Batch sammelt Google Anfragen und verarbeitet sie nicht sofort, dafür halbiert sich der Preis. Beim Context Caching speichert Google gleichbleibende Teile eines Prompts zwischen, etwa lange Anweisungen; jedes weitere Lesen kostet dann nur einen Bruchteil des Input-Preises, dazu kommt eine Speichergebühr pro Stunde. Der Wissensstand zeigt, bis wann das Modell trainiert wurde. Für Fragen zu späteren Ereignissen braucht 3.8 Flash eine Websuche oder eure eigenen Dokumente.
Die zusätzlichen Denkschritte haben eine Kehrseite: Laut Google kann 3.8 Flash vor allem bei hoher Denkstufe mehr Tokens verbrauchen, um das beste Ergebnis zu erreichen. Bei gleichem Tokenpreis wie 3.7 Flash kann eine einzelne Aufgabe dadurch mehr kosten. Für einfache, häufige Aufgaben lohnt deshalb ein Vergleich mit niedriger Denkstufe oder mit 3.5 Flash-Lite. Google selbst spricht bei 3.8 Flash von der dritten Flash-Veröffentlichung in nur sechs Wochen. Bei diesem Tempo gehört die Modell-ID in eine Einstellung und nicht fest in den Code.
Was unterscheidet 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite?
3.7 Flash und 3.6 Flash sind die direkten Vorgänger von 3.8 Flash und kosten über die API heute genauso viel; 3.5 Flash-Lite ist das günstige Modell für hohes Volumen. Alle drei sind allgemein verfügbar und verarbeiten bis zu 1.048.576 Tokens Kontext. Für die Wahl zählen deshalb vor allem Aufgabe, Volumen und laufende Integrationen. API-Listenpreise in US-Dollar pro Million Tokens:
| Modell | Erschienen | Preis Input / Output | Was du wissen solltest |
|---|---|---|---|
| 3.7 Flash | 13.08.2026 | 0,75 $ / 3,75 $ bis 31.12.2026, danach 1,50 $ / 7,50 $ | Mit 3.7 Flash kam der halbierte Einführungspreis. 3.8 Flash baut auf diesem Modell auf. |
| 3.6 Flash | 21.07.2026 | wie 3.7 Flash | Startete mit 1,50 $ / 7,50 $, heute gilt auch hier der Einführungspreis. In der Gemini-App laut Abo-Seite bis 8. Oktober das Flash-Modell des kostenlosen Zugangs. |
| 3.5 Flash-Lite | 21.07.2026 | 0,30 $ / 2,50 $; Batch 0,15 $ / 1,25 $; Cached Input 0,03 $ | Laut Google 350 Output-Tokens pro Sekunde. Ersatz für 3.1 Flash-Lite. |
| 3.5 Flash (Legacy) | 19.05.2026 | 1,50 $ / 9,00 $; Batch 0,75 $ / 4,50 $ | Standardmodell im KI-Modus der Suche. Über die API teurer als die neueren Flash-Modelle. |
| 3.1 Flash-Lite | GA 07.05.2026 | 0,25 $ (Audio 0,50 $) / 1,50 $ | Abschaltung frühestens am 7. Mai 2027, Ersatz 3.5 Flash-Lite. |
Meine Einordnung: Für neue Projekte gibt es kaum einen Grund, 3.6 oder 3.7 Flash zu wählen, weil 3.8 Flash bis Jahresende denselben Listenpreis hat. Die älteren Versionen haben ihren Platz dort, wo eine Integration bereits läuft und sauber getestet ist. 3.5 Flash ist über die API teurer als die neueren Flash-Modelle, bleibt aber interessant, wenn ihr eine Einzelregion in Frankfurt braucht, die es laut einer Sekundärquelle nur für 3.5 Flash gibt (siehe EU-Abschnitt). Für Klassifizieren, Extrahieren, Übersetzen und andere einfache Aufgaben mit großem Volumen ist 3.5 Flash-Lite der naheliegende Startpunkt: Es kostet heute 60 Prozent weniger Input und ein Drittel weniger Output als 3.8 Flash, gegenüber den Flash-Preisen ab 2027 sind es beim Output zwei Drittel weniger, gerechnet mit den heutigen Listenpreisen.
Modellwahl in Abläufen
Welches Modell in welchem Ablauf arbeitet, sollte eine Einstellung sein und kein Umbau. Dazu gehören Tests mit echten Fällen, eine klare Kostenobergrenze und ein Mensch, der Ergebnisse mit Außenwirkung freigibt. Wie solche Automatisierungen aufgebaut sind, beschreibe ich unter KI-Automatisierung.
KI-Automatisierung ansehenWas ist mit Gemini 3.1 Pro und 3.5 Pro?
Gemini 3.1 Pro ist seit dem 19. Februar 2026 das aktuelle Pro-Modell, läuft aber weiter im Preview-Status. Gemini 3.5 Pro ist nicht erschienen, Google führt es auf der DeepMind-Seite als „coming soon“. Zur Google I/O am 19. Mai 2026 hatte Google 3.5 Pro für den „nächsten Monat“ angekündigt; am 21. Juli hieß es, das Modell werde mit Partnern getestet und breit verfügbar, sobald es fertig sei („as soon as it's ready“). Ein neues Datum nennt Google nicht.
3.1 Pro verarbeitet bis zu 1.048.576 Tokens Kontext und gibt bis zu 65.536 Tokens aus. Über die API kostet es 2 $ Input und 12 $ Output pro Million Tokens bei Prompts bis 200.000 Tokens, darüber 4 $ und 18 $. Cached Input kostet 0,20 $ beziehungsweise 0,40 $, ein Free Tier gibt es nicht, einen Wissensstand nennt Google für 3.1 Pro nicht. In der Gemini-App gibt es das Pro-Modell ab dem 9. Oktober mit Google AI Pro und Ultra, in Workspace in Business Standard und Plus mit bis zu 25 Prompts pro 4 Stunden.
Zwei Punkte für Unternehmen: Erstens ist 3.1 Pro ein Preview-Modell. Für dauerhaft laufende Prozesse würde ich deshalb nicht allein darauf bauen, sondern den Wechsel auf ein Flash-Modell oder ein späteres Pro-Modell von Anfang an einplanen. Zweitens läuft 3.1 Pro in Gemini Enterprise in der EU ohne Datenresidenz und ohne ML-Verarbeitung, auf der Agent Platform laut Sekundärquelle nur global. Wer Daten in der EU verarbeiten muss, landet damit bei den Flash-Modellen; von Google selbst belegt ist die ML-Verarbeitung in der EU derzeit für 3.8 Flash.
Was ist Gemini 4 Argon und wann kommt es?
Google hat am 30. September 2026 Gemini 4 Argon angekündigt. Breit nutzbar ist es noch nicht: Zuerst kommen ausgewählte Sicherheitsteams im Fairwind Program, danach zahlende API-Kunden und Google AI Ultra. Stand 5. Oktober 2026 ist Argon weder in der API noch in der Gemini-App verfügbar. Für Unternehmen im Mittelstand ändert sich deshalb kurzfristig wenig.
Google nennt Argon „Our frontier model for real-world coding, enterprise knowledge work, and cyber defense“, ein Datum für die breite Freigabe gibt es nicht. Zur Einführung soll Argon 2 $ Input und 10 $ Output pro Million Tokens kosten, danach 4 $ und 20 $; wann die Einführungsphase endet, sagt Google nicht. Argon kann bis zu 1 Million Tokens ausgeben, Gemini 3.8 Flash und 3.1 Pro kommen auf 65.536. Zum Eingabekontext macht Google keine Angabe, zur Verfügbarkeit in der EU ebenfalls nicht. Preise, Benchmarks und den Vergleich mit Claude Opus 5.5 und GPT-6 Astra findest du im Artikel Gemini 4 Argon: Was Googles neues Spitzenmodell kann.
Welche Bild-, Video- und Audiomodelle bietet Google?
Für Bilder bietet Google die Nano-Banana-Modelle, für Video Gemini Omni 1.1 Flash und Veo 3.1, für Musik Lyria 3.5 und für Sprache eigene Modelle für Sprachausgabe, Live-Dialoge und Transkription. Zwei Einschränkungen gelten im EWR und damit auch in Deutschland: Das Stimmklonen der neuen TTS-Modelle ist dort nicht verfügbar, ebenso wenig in der Schweiz und im Vereinigten Königreich, und in der Gemini-App kannst du keine eigenen Videos zum Bearbeiten hochladen. Videos erzeugen kannst du in der App mit einem privaten Konto nur mit Google-AI-Abo, mit einem Arbeitskonto nur mit einer berechtigten Workspace-Lizenz, jeweils ab 18 Jahren.
| Modell | Wofür | Stand und Preis (Gemini API) |
|---|---|---|
Nano Banana 2 (gemini-3.1-flash-image) |
Bilder erzeugen, 0,5K bis 4K | Stable; pro Bild 0,045 $ (0,5K), 0,067 $ (1K), 0,101 $ (2K), 0,151 $ (4K), über Batch die Hälfte. In der Gemini-App in allen Plänen |
Nano Banana 2 Lite (gemini-3.1-flash-lite-image) |
Bilder in großer Menge, nur 1K | rund 0,034 $ je Bild |
Nano Banana Pro (gemini-3-pro-image) |
Premium-Bildmodell | Preis in der Gemini API nicht ausgewiesen; Bildausgaben tragen seit November 2025 C2PA-Metadaten |
| Gemini Omni 1.1 Flash | Video bis 4K, Szenenverlängerung bis 40 Sekunden, Start- und Endbild | GA seit 27.08.2026; rund 0,10 $ pro Sekunde in 720p |
| Veo 3.1 | Videogenerierung, laut DeepMind weiter das führende Videomodell | Die Preview-Versionen in der Gemini API enden am 22.10.2026, Ersatz dort Omni 1.1 Flash |
| Lyria 3.5 | Musik mit Gesang, kurze oder längere Tracks | seit 04.09.2026, in der Gemini-App für alle Nutzer weltweit |
| Gemini 3.8 Flash TTS und Flash-Lite TTS | Sprachausgabe (Text-to-Speech) in über 100 Sprachen mit mehr als 2.000 Stimmen | seit 23.09.2026; Stimmklonen nicht im EWR, in der Schweiz und im Vereinigten Königreich |
| Gemini 3.8 Live und Live Extended Thinking | Sprachdialoge in Echtzeit, 97 Sprachen, Tool-Aufrufe im Hintergrund | seit 15.09.2026 |
| Gemini 3.5 Transcribe | Transkription in mehr als 85 Sprachen mit Sprechertrennung und Zeitstempel je Wort | GA seit 26.08.2026 |
Bei generierten Medien zählt im Unternehmen die Kennzeichnung. Google versieht Bilder, Videos und Audio, die mit Google-KI erzeugt oder bearbeitet wurden, mit dem unsichtbaren Wasserzeichen SynthID; prüfen kannst du das in der Gemini-App. Seit dem 2. August 2026 gilt Art. 50 des EU AI Act mit Transparenzpflichten für KI-generierte Inhalte. Wie Wasserzeichen und Kennzeichnung zusammenhängen, erklärt der Beitrag KI-Wasserzeichen nach AI Act Art. 50. Welche Medienfunktionen die Gemini-App in Deutschland bietet, steht im Guide Gemini-Funktionen.
Welche Gemini-Modelle laufen mit Datenverarbeitung in der EU?
Wer Gemini per API mit Datenverarbeitung in der EU nutzen will, geht über die Gemini Enterprise Agent Platform (früher Vertex AI) und die EU-Multiregion. Für Gemini 3.8 Flash nennt Google auf der Agent Platform die Regionen global sowie die Multiregionen us und eu, keine Einzelregion wie Frankfurt. Dass auch 3.7 und 3.6 Flash keine Einzelregion Frankfurt haben und 3.1 Pro dort nur global läuft, stützt sich auf eine Sekundärquelle (innFactory, Stand 30.09.2026). Eine Multiregion fasst mehrere Rechenzentren innerhalb eines Gebiets zusammen, hier der EU; ML-Verarbeitung heißt, dass auch die Berechnung der Antwort dort stattfindet und nicht nur die Speicherung.
| Modell | EU-Verarbeitung (Stand 5. Oktober 2026) | Quelle |
|---|---|---|
| 3.8 Flash | Agent Platform: Regionen global, us und eu, ML-Verarbeitung in us und eu. Gemini Enterprise: in der EU-Multiregion mit Datenresidenz und ML-Verarbeitung, dort seit 23.09.2026 standardmäßig aktiviert | Primärquelle Google |
| 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite | EU-Multiregion mit Datenresidenz, keine Einzelregion Frankfurt | Sekundärquelle (innFactory) |
| 3.5 Flash | zusätzlich in den Einzelregionen Frankfurt (europe-west3) und London |
Sekundärquelle (innFactory) |
| 3.1 Pro | Agent Platform nur global, ohne EU-Residenz; Gemini Enterprise in der EU ohne Datenresidenz und ohne ML-Verarbeitung | Sekundärquelle innFactory (Agent Platform), Primärquelle Google (Gemini Enterprise) |
| 4 Argon | keine Angabe von Google | Ankündigung vom 30.09.2026 |
Drei Details gehören zur Planung:
- Aufpreis für die Region: Regionale statt globale Endpunkte, etwa die EU-Multiregion, kosten auf der Agent Platform seit dem 1. Juli 2026 für allgemein verfügbare Modelle ab Gemini 3 einen Aufschlag. Laut Preisliste kostet 3.8 Flash regional 0,825 $ statt 0,75 $ Input pro Million Tokens (ab 2027 1,65 $ statt 1,50 $), also 10 Prozent mehr.
- Grounding und Speicherung: Grounding mit der Google Suche, also das Anreichern der Antwort mit aktuellen Suchergebnissen, speichert auf der Agent Platform 30 Tage und läuft in Gemini Enterprise nur global. Für Zero Data Retention verlangt Google eine Ausnahme von der Missbrauchsüberwachung, Web Grounding for Enterprise statt der normalen Suchanbindung, den Verzicht auf Grounding mit Google Maps und keine Session Resumption in der Live API. Das In-Memory-Caching verletzt Zero Data Retention laut Google nicht.
- Gemini API über AI Studio: Für Nutzer im EWR, in der Schweiz und im Vereinigten Königreich gelten die Datenregeln der bezahlten Dienste auch für AI Studio und das kostenlose Kontingent; Google nutzt die Inhalte dann nicht zur Produktverbesserung. Diese Regel betrifft die Nutzung eurer Daten, nicht den Ort der Verarbeitung. Der von Google dokumentierte Weg zur EU-Verarbeitung ist die Agent Platform.
Gemini Enterprise bietet die Multiregion eu mit Datenresidenz und ML-Verarbeitung in der EU für die Editionen Standard, Plus, Pay-as-you-go und Frontline. Eine reine Deutschland-Region gibt es weder dort noch in Workspace. In Workspace lassen sich ruhende Daten ab Business Standard auf Europa festlegen, die Verarbeitung in Europa gibt es nur in Enterprise Plus, Enterprise Essentials Plus und Frontline Plus. Verträge, Training und Datenregionen im Detail stehen im Guide Gemini und DSGVO, die Gegenstücke unter Claude und DSGVO und ChatGPT und DSGVO. Eine Rechtsberatung im Sinne des RDG ist das nicht.
Welche Modelle und Werkzeuge werden abgeschaltet?
Bis Mai 2027 laufen mehrere Gemini-Modelle und Google-Werkzeuge aus; die nächsten Termine sind die Veo-3.1-Previews am 22. Oktober und Opal am 17. November 2026. Google nennt bei Abkündigungen ausdrücklich die frühestmöglichen Termine („the earliest possible dates“). Wer Gemini in Automationen, Apps oder Skripten nutzt, sollte die Liste mit den eigenen Modell-IDs abgleichen.
| Datum | Was | Ersatz |
|---|---|---|
| 18.06.2026 | Gemini CLI und die IDE-Erweiterungen von Gemini Code Assist bedienen keine Nutzer von Google AI Pro und Ultra und der kostenlosen Stufe Gemini Code Assist for individuals mehr | Antigravity CLI; Gemini CLI bleibt mit bezahlten API-Schlüsseln nutzbar |
| 21.07.2026 | Sampling-Parameter temperature, top_p und top_k abgekündigt |
k. A. |
| 17.08.2026 | Imagen 4 in der Gemini API abgeschaltet | Nano Banana 2 |
| 17.09.2026 | Gemini Code Assist nicht mehr in neuen oder online verlängerten Abos von Gemini Enterprise Standard und Plus enthalten | Google Antigravity |
| 18.09.2026 | Gemini 2.5 Pro, Flash und Flash-Lite nur noch für Nutzer, die sie zuvor aktiv genutzt haben | Gemini 3.x |
| 02.10.2026 | Nano Banana (gemini-2.5-flash-image) abgeschaltet |
Nano Banana 2 oder 2 Lite |
| 22.10.2026 | Veo-3.1-Previews in der Gemini API | Gemini Omni 1.1 Flash |
| 17.11.2026 | Opal (Google Labs) und „Gems made by Labs“, ohne automatische Migration | Skills in Gemini bzw. AI Studio |
| 26.11.2026 | Vertex AI Extensions | Gemini Enterprise Agent Platform |
| 22.03.2027 | Firebase Studio wird eingestellt | Google AI Studio oder Google Antigravity |
| 07.05.2027 | Gemini 3.1 Flash-Lite, frühestens | Gemini 3.5 Flash-Lite |
Dazu kommt eine Preisänderung, die für die Planung genauso zählt wie eine Abschaltung: Die Einführungspreise der Flash-Modelle 3.6, 3.7 und 3.8 laufen am 31. Dezember 2026 aus. Außerdem führt Google Skills ein, also wiederverwendbare Anweisungen für bestimmte Aufgaben, die die Gems ablösen. In privaten Konten werden Gems im November 2026 automatisch migriert; in Workspace stehen Gems ab dem 17. November 2026 in den Einstellungen und werden am 1. März 2027 entfernt, mit automatischer Überführung in Skill-Entwürfe. Was Skills können, steht im Guide Gemini-Funktionen.
Welches Gemini-Modell solltest du wählen?
Für die meisten Aufgaben im Unternehmen ist Gemini 3.8 Flash der richtige Start, für einfache Aufgaben mit großem Volumen 3.5 Flash-Lite und für die schwierigsten Analysen ein Vergleich mit 3.1 Pro. Die folgende Zuordnung ist meine Einordnung auf Basis von Googles Angaben, kein Testergebnis. Den Ausschlag geben 20 bis 50 echte Fälle aus eurem Alltag.
| Aufgabe | Startpunkt | Warum |
|---|---|---|
| E-Mails, Zusammenfassungen, Texte im Büroalltag | Gemini in Google Workspace, voller Umfang ab Business Standard | läuft in Gmail, Docs und Meet mit Unternehmensdatenschutz, ohne eigene Integration |
| Klassifizieren, Extrahieren, Übersetzen in großer Menge | 3.5 Flash-Lite | 0,30 $ / 2,50 $ pro Million Tokens, laut Google 350 Output-Tokens pro Sekunde |
| Agenten, Dokumentenauswertung, Coding | 3.8 Flash | laut Google das intelligenteste Flash-Modell, bis Ende 2026 zum Einführungspreis |
| Schwierigste Analysen mit hohem Anspruch | 3.1 Pro, im direkten Vergleich mit 3.8 Flash | Pro-Klasse, aber Preview-Status; keine ML-Verarbeitung in der EU (Gemini Enterprise laut Google, Agent Platform laut Sekundärquelle nur global) |
| Daten müssen in der EU verarbeitet werden | 3.8 Flash über die Agent Platform, EU-Multiregion | ML-Verarbeitung in der EU laut Google belegt |
| Bilder für Marketing und Produktdarstellung | Nano Banana 2, für große Mengen 2 Lite | ab rund 0,034 $ je Bild; Kennzeichnung nach Art. 50 mitdenken |
| Sprachassistenten und Telefonie | 3.8 Live, für Ansagen 3.8 Flash TTS | 97 bzw. über 100 Sprachen; Stimmklonen nicht im EWR, in der Schweiz und im Vereinigten Königreich |
| Protokolle aus Meetings und Gesprächen | 3.5 Transcribe | Sprechertrennung und Zeitstempel je Wort; Information der Beteiligten und Betriebsrat vorher klären |
| Spitzenmodell für alles | Gemini 4 Argon: abwarten | Stand 5. Oktober 2026 nicht verfügbar, kein Datum |
Budget 2027: Die Einführungspreise der Flash-Modelle 3.6, 3.7 und 3.8 laufen am 31. Dezember 2026 aus; ab 1. Januar 2027 verdoppeln sie sich auf 1,50 $ Input und 7,50 $ Output pro Million Tokens. Plant euer Budget 2027 mit dem doppelten Preis. Ein Rechenmuster mit Listenpreisen, ohne Batch, Cache und Steuern: 10 Millionen Input- und 2 Millionen Output-Tokens im Monat kosten mit 3.8 Flash heute 15 $ und ab Januar 2027 30 $, mit 3.5 Flash-Lite 8 $ und mit 3.1 Pro 44 $ (Prompts bis 200.000 Tokens). Wer Argon einplant, rechnet mit 4 $ und 20 $, weil Google das Ende der Einführungsphase nicht nennt.
Zwei Regeln helfen unabhängig vom Modell. Erstens: Legt die Modell-ID als Einstellung an und nicht fest im Code, denn Google hat neue Flash-Versionen zuletzt im Abstand von rund drei Wochen veröffentlicht. Zweitens: Vergleicht Modelle mit euren eigenen Fällen statt mit Benchmarks, gemessen an Ergebnis, Laufzeit und Kosten je brauchbarer Antwort. Wie die Modelle der anderen Anbieter einzuordnen sind, zeigen der Claude-Modell-Vergleich, die ChatGPT-Modelle im ChatGPT-Guide und der Artikel zu GPT-6.1 Sol. Den Plattformvergleich findest du unter Beste KI 2026, Claude vs. Gemini und ChatGPT vs. Gemini, Begriffe wie Token oder Kontextfenster im KI-Glossar.
Was du als Nächstes lesen solltest
Offizielle Quellen und Stand der Recherche
Alle Angaben zu Modellen, Preisen, Regionen und Terminen stammen aus Primärquellen von Google, abgerufen am 05.10.2026. Sekundärquellen sind als solche gekennzeichnet. Oberfläche, Modellauswahl und Freischaltung können je nach Konto, Plan und Region abweichen; Google rollt Änderungen schrittweise aus.
- Google AI for Developers: Gemini-API-Modelle und Modellseite Gemini 3.8 Flash, abgerufen am 05.10.2026
- Google AI for Developers: Preise der Gemini API, abgerufen am 05.10.2026
- Google AI for Developers: Abkündigungen und Changelog, abgerufen am 05.10.2026
- Google DeepMind: Modellkarten, Modellkarte Gemini 3.8 Flash und Gemini Pro, abgerufen am 05.10.2026
- Google: Gemini 3.8 Flash und 3.8 Flash Cyber, Gemini 3.7 Flash und Gemini 3.6 Flash und 3.5 Flash-Lite, abgerufen am 05.10.2026
- Google: Ankündigungen der I/O 2026, abgerufen am 05.10.2026
- Google: Gemini 4 Argon und Fairwind Program, abgerufen am 05.10.2026
- Gemini-Hilfe: Änderungen der Modellverfügbarkeit ab Oktober 2026 und Limits und Kontextfenster je Plan, abgerufen am 05.10.2026
- Gemini: deutsche Abo-Seite und Gemini Release Notes, abgerufen am 05.10.2026
- Google: Suche auf der I/O 2026, Updates für KI-Modus und AI Overviews und KI-Modus startet in DACH, abgerufen am 05.10.2026
- Workspace-Hilfe: Gemini-App je Edition, Gemini-App ein- und ausschalten und Datenregionen, abgerufen am 05.10.2026
- Google Workspace: Privacy Hub zu generativer KI und Gemini-Hilfe: Datenschutz in Gemini Apps, abgerufen am 05.10.2026
- Google Cloud: Gemini Enterprise Release Notes und Standorte, abgerufen am 05.10.2026
- Google Cloud: Gemini 3.8 Flash auf der Agent Platform, Preise der Agent Platform und Data Governance, abgerufen am 05.10.2026
- Google: Nutzungsbedingungen der Gemini API, abgerufen am 05.10.2026
- Google AI for Developers: Bildgenerierung, Gemini Omni 1.1 Flash, Veo, Lyria 3.5, Gemini 3.8 TTS und Gemini 3.8 Live, abgerufen am 05.10.2026
- Gemini-Hilfe: Videos erstellen und SynthID in der Gemini-App, abgerufen am 05.10.2026
- Google Developers Blog: Gemini CLI wird Antigravity CLI, Gemini Code Assist für Einzelpersonen, Opal FAQ, Firebase Studio und Vertex AI Release Notes, abgerufen am 05.10.2026
- Google: Skills in Gemini und Workspace Updates: Skills in Gemini-App und Workspace, abgerufen am 05.10.2026
- Sekundärquelle zur Einordnung von Flash-Lite für Gratisnutzer: 9to5Google, 03.10.2026
- Sekundärquelle zu EU-Regionen auf der Agent Platform: innFactory, Stand 30.09.2026, abgerufen am 05.10.2026
Häufige Fragen zu den Gemini-Modellen
Welches ist das neueste Gemini-Modell?
Das neueste allgemein verfügbare Gemini-Modell ist Gemini 3.8 Flash vom 2. September 2026. Aktuelles Pro-Modell bleibt Gemini 3.1 Pro im Preview-Status, Gemini 3.5 Pro führt Google weiter als ‚coming soon‘. Gemini 4 Argon ist seit dem 30. September 2026 angekündigt, Stand 5. Oktober 2026 aber weder in der API noch in der Gemini-App verfügbar.
Was kostet Gemini 3.8 Flash über die API?
Bis zum 31. Dezember 2026 kostet Gemini 3.8 Flash 0,75 $ Input und 3,75 $ Output pro Million Tokens. Ab dem 1. Januar 2027 verdoppelt sich der Preis auf 1,50 $ und 7,50 $, dasselbe gilt für 3.7 und 3.6 Flash. Über Batch halbieren sich die Preise, und für Tests gibt es ein Free Tier.
Welches Modell bekommen Gratisnutzer der Gemini-App ab dem 9. Oktober 2026?
Nur noch Flash-Lite: Ab dem 9. Oktober 2026 stellt Google die Gemini-App für private Konten um, ohne Abo gibt es nur noch das Modell Flash-Lite. Flash gibt es ab Google AI Plus, das Pro-Modell ab Google AI Pro. Die Fachpresse ordnet Flash-Lite als Gemini 3.5 Flash-Lite ein, Googles Hilfeseite spricht nur von Flash-Lite.
Kann ich Gemini 4 Argon schon nutzen?
Nein, Stand 5. Oktober 2026 ist Argon weder in der API noch in der Gemini-App verfügbar. Zuerst bekommen ausgewählte Sicherheitsteams im Fairwind Program Zugang, danach zahlende API-Kunden und Abonnenten von Google AI Ultra. Ein Datum nennt Google nicht.
Wann kommt Gemini 3.5 Pro?
Das ist offen: Google führt Gemini 3.5 Pro als ‚coming soon‘ und nennt kein Datum. Zur I/O im Mai 2026 war es für den Folgemonat angekündigt, am 21. Juli hieß es, Google teste es mit Partnern. Bis dahin ist Gemini 3.1 Pro im Preview-Status das aktuelle Pro-Modell.
Welche Gemini-Modelle laufen mit Datenverarbeitung in der EU?
Über die Gemini Enterprise Agent Platform (früher Vertex AI) läuft Gemini 3.8 Flash laut Google in der EU-Multiregion mit ML-Verarbeitung in der EU, eine Einzelregion wie Frankfurt nennt Google dafür nicht. Laut einer Sekundärquelle (innFactory) laufen dort auch 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite mit Datenresidenz in der EU-Multiregion, Gemini 3.1 Pro dagegen nur global. Zu Gemini 4 Argon äußert sich Google nicht.
Was ist der Unterschied zwischen Flash-Lite, Flash und Pro?
Flash-Lite ist die Klasse für hohes Volumen zum kleinen Preis, etwa Gemini 3.5 Flash-Lite für 0,30 $ Input und 2,50 $ Output pro Million Tokens. Flash ist das Arbeitsmodell für die meisten Aufgaben, aktuell Gemini 3.8 Flash. Pro ist für die schwierigsten Aufgaben gedacht, aktuell Gemini 3.1 Pro im Preview-Status für 2 $ Input und 12 $ Output.
Welche Gemini-Modelle werden demnächst abgeschaltet?
Am 22. Oktober 2026 enden die Veo-3.1-Previews in der Gemini API, Ersatz ist Gemini Omni 1.1 Flash. Gemini 3.1 Flash-Lite wird frühestens am 7. Mai 2027 abgeschaltet, Gemini 2.5 Pro, Flash und Flash-Lite stehen seit dem 18. September 2026 nur noch Nutzern offen, die sie zuvor aktiv genutzt haben. Das alte Nano Banana ist seit dem 2. Oktober 2026 abgeschaltet.
Private KI-Konten im Team
Ab dem 9. Oktober bekommen Gratisnutzer der Gemini-App nur noch Flash-Lite. Wer im Team privat mit Gemini arbeitet, wechselt dann vielleicht ins eigene Abo oder zu einem anderen Werkzeug, beides oft ohne Regeln. Der Shadow-AI-Check macht sichtbar, wer welche KI mit welchen Daten nutzt, bevor daraus ein Datenschutzproblem wird.
Shadow-AI-Check ansehenWas solltest du jetzt tun?
Teste Gemini 3.8 Flash mit echten Fällen, plane das Budget 2027 mit doppelten Flash-Preisen und warte bei Argon ab, bis Google Verfügbarkeit, Preis nach der Einführungsphase und die EU-Frage klärt. Wer Gemini im Team ohne Workspace nutzt, sollte vor dem 9. Oktober klären, mit welchen Konten gearbeitet wird. Ein neues Modell verbessert eure Abläufe nur, wenn Aufgabe, Daten und Freigaben vorher geklärt sind.
Du willst klären, welches Gemini-Modell eure Abläufe trägt und was es 2027 kostet? Schreib mir über die Kontaktseite oder buch direkt ein Gespräch.
Erstgespräch buchen →