Gemini 3.7 Flash: Benchmarks, Preise, API-Verfügbarkeit und was sich geändert hat

Avatar
Lisa Ernst · 17.08.2026 · Künstliche Intelligenz · 15 Min Lesezeit

Google veröffentlichte Gemini 3.7 Flash am 13. August 2026, nur drei Wochen nach Gemini 3.6 Flash. Das Update richtet sich gezielt an Coding, Agenten-Workflows, Webentwicklung und dokumentenlastige Wissensarbeit, wobei Google erhebliche Gewinne gegenüber 3.6 Flash bei mehreren Benchmarks für Software-Engineering und Automatisierung veröffentlicht.

Das Ungewöhnliche ist der Preis: Gemini 3.7 Flash startet zu 0,75 USD pro Million Eingabetokens und 3,75 USD pro Million Ausgabetokens über die Standard-bezahlte API bis zum 31. Dezember 2026. Diese Preise sind vorübergehend und verdoppeln sich am 1. Januar 2027. Dieser Leitfaden erklärt die Benchmark-Ergebnisse, API-Verfügbarkeit, Modellgrenzen, unterstützte Tools, Preisstufen und die praktischen Unterschiede zu Gemini 3.6 Flash.

Wichtige Erkenntnisse

Gemini 3.7 Flash auf einen Blick

Spezifikation Gemini 3.7 Flash
Veröffentlichungsdatum 13. August 2026
Startphase Allgemein verfügbar (GA)
Stabile API-Modell-ID gemini-3.7-flash
Eingabemodalitäten Text, Bild, Video, Audio und PDF
Ausgabemodalität Text
Eingabe-Token-Limit 1.048.576 Tokens
Maximale Ausgabe 65.536 Tokens
Denklevel Niedrig, mittel und hoch; minimal wird nicht unterstützt
Standard-bezahlte API-Preise bis 31.12.2026 0,75 USD / 1 Mio. Eingabetokens; 3,75 USD / 1 Mio. Ausgabetokens

Was ist Gemini 3.7 Flash?

Gemini 3.7 Flash ist die nächste Iteration von Googles Gemini 3 Flash-Familie. Google DeepMind gibt an, dass es auf Gemini 3.6 Flash basiert und algorithmische Verbesserungen an der Kern-Logikgrundlage des Modells vornimmt. Die Positionierung ist auch expliziter geworden: Google bezeichnet 3.7 Flash als sein primäres "Arbeitstier" für Coding und Agents und nicht als ein Modell, das einfach darauf ausgelegt ist, den rohen Durchsatz zu maximieren.

Dieser Unterschied ist wichtig. Flash-Modelle wurden traditionell ausgewählt, weil sie schneller und günstiger sind als die größten Denkmodelle. Mit 3.7 versucht Google, mehr mehrstufige Arbeit in diese kostengünstige Stufe zu verlagern: Repository-basiertes Coding, Browser- oder Computerinteraktion, Funktionsaufrufe, komplexe Dokumentenverarbeitung und Geschäfts-Workflows, die mehrere Tool-Aufrufe erfordern, bevor eine Antwort vollständig ist.

Wenn Sie vom Vorgänger kommen, bietet Zerlos Gemini 3.6 Flash Übersicht den Startkontext für das frühere Modell. Die wichtige Neuerung ist nun, dass 3.7 Flash das gleiche Million-Token-Kontextfenster und eine breite Palette von Tools beibehält und gleichzeitig die Leistung bei vielen von Google veröffentlichten Agenten- und Coding-Evaluierungen verbessert.

Was hat sich von Gemini 3.6 Flash geändert?

Bereich Gemini 3.7 Flash Änderung Praktische Auswirkung
Coding Höhere FrontierCode-, DeepSWE- und Terminal-Bench-Scores Stärkerer Fall für Repository-Arbeit, Debugging und langlaufende Coding-Agents
Webentwicklung Code Arena steigt von 1538 auf 1588 Elo in der Modellkarte von Google Bessere veröffentlichte Leistung bei funktionalen Layouts und funktionsvollständigen Webaufgaben
Unternehmensautomatisierung AutomationBench steigt von 17,0 % auf 30,4 % Vielversprechender für Workflows, die Denken, Tools und Geschäftssysteme kombinieren
Dokumenten-Denken GDP.pdf steigt von 22,0 % auf 34,0 % Verbessertes veröffentlichtes Ergebnis für schwierige PDF-basierte Wissensarbeit
Langer Kontext GDM-MRCR v2 bei 128k steigt von 91,8 % auf 97,0 % Bessere Abfrage und Denken über lange Eingaben in dieser Auswertung
Entwicklerverhalten Google sagt, das Modell passe sich besser an Hindernisse an, kläre die Absicht und folge Anweisungen treuer Potenziell weniger Wiederholungen und weniger manuelle Aufsicht bei mehrstufigen Workflows
Preise 3.7 startet zu einem temporären Preis von 0,75 USD Eingabe / 3,75 USD Ausgabe pro 1 Mio. Tokens Geringere kurzfristige Kosten als der ursprüngliche Startpreis von 3.6, obwohl 3.6 jetzt zum gleichen temporären Satz ist

Die letzte Zeile ist leicht missverständlich. Google beschreibt Gemini 3.7 Flash als mit der Hälfte der ursprünglichen Kosten von Gemini 3.6 Flash startend. Die aktuelle Modellkarte von Google listet jedoch sowohl 3.6 Flash als auch 3.7 Flash mit 0,75 USD Eingabe und 3,75 USD Ausgabe pro Million Tokens unter der gleichen temporären Aktion. 3.7 ist also derzeit nicht günstiger pro Standard-Token als 3.6; der Vergleich bezieht sich auf die ursprüngliche Startpreisgestaltung von 3.6.

Gemini 3.7 Flash Benchmarks

Die Modellkarte von Google vom August 2026 veröffentlicht eine breite Palette von Benchmarks für Software-Engineering, Agenten-Terminalnutzung, Unternehmensautomatisierung, Wissensarbeit, PDFs, langen Kontext, Computernutzung und wissenschaftliches Denken. Die untenstehenden Zahlen vergleichen Gemini 3.7 Flash mit Gemini 3.6 Flash anhand der Werte in dieser Modellkarte.

Benchmark Was es misst Gemini 3.6 Flash Gemini 3.7 Flash
Künstlicher Analyse-Intelligenz-Index Kombinierte Modellintelligenz 52 56
FrontierCode 1.1 Hauptversion Qualität von Produktionscode 34.4% 43.6%
DeepSWE v1.1 Software-Engineering über lange Zeiträume 48.6% 65.3%
Code-Arena Webentwicklung 1538 Elo 1588 Elo
Terminal-Benchmark 2.1 Agentenbasiertes Terminal-Coding 78.0% 85.8%
AutomationBench Automatisierung von Unternehmensworkflows 17.0% 30.4%
GDP.pdf Experten-PDF-Verständnis 22.0% 34.0%
GDM-MRCR v2 bei 128k Abruf und Schlussfolgerung bei langem Kontext 91.8% 97.0%
OSWorld-2.0 Agentengesteuerte Computernutzung 33.8% 47.9%
Google Benchmark-Tabelle im Vergleich von Gemini 3.7 Flash mit Gemini 3.6 Flash und anderen KI-Modellen

Quelle: blog.google

Googles Bewertungstabelle vom August 2026 zeigt besonders große Gewinne von 3.7 Flash im Bereich Software-Engineering über lange Zeiträume, Automatisierung von Unternehmensworkflows, Dokumentenverständnis und Computernutzung. Die Benchmarks messen verschiedene Arbeitslasten und sollten nicht zu einer einzigen universellen Punktzahl zusammengefasst werden.

Wo die Gewinne am stärksten sind

Die deutlichste Bewegung zeigt sich bei Arbeitslasten, die vom Modell erfordern, dass es eher fortlaufend arbeitet, anstatt nur einmal zu antworten. DeepSWE steigt von 48,6 % auf 65,3 %, während AutomationBench von 17,0 % auf 30,4 % steigt. Das unterstützt Googles Behauptung, dass das Modell für Agenten nützlicher ist, die planen, Tools aufrufen, Ergebnisse prüfen und Hindernisse überwinden müssen.

Die Dokumentenarbeit verbessert sich laut Googles veröffentlichten Daten ebenfalls erheblich. GDP.pdf steigt von 22,0 % auf 34,0 %, und das Unternehmen hebt insbesondere Finanzen, Recht und Biowissenschaften als wissensintensive Domänen hervor, in denen es eine bessere Schlussfolgerung erwartet. Das bedeutet nicht, dass das Modell eine Expertenprüfung in regulierten oder risikoreichen Arbeiten ersetzen kann; es bedeutet, dass das Benchmark-Ergebnis bei den getesteten Aufgaben materiell höher ist als bei 3.6 Flash.

3.7 Flash gewinnt nicht jeden Benchmark

Die Veröffentlichung ist kein klarer Sieg in allen Bereichen. Auf CharXiv ohne Tools erzielt Gemini 3.7 Flash 84,5 % gegenüber 85,2 % für 3.6 Flash; mit Tools erzielt es 88,7 % gegenüber 89,4 %. In Googles plattformübergreifender Tabelle bleibt GPT-5.6 Terra bei einigen Coding- und Terminal-Bewertungen ebenfalls vorn. Deshalb sollte eine Benchmark-Tabelle verwendet werden, um vielversprechende Arbeitslasten zu identifizieren, nicht um einen universellen Gewinner zu verkünden.

Es gibt auch einen kleinen Berichtsunterschied, der erwähnenswert ist: Googles Veröffentlichungsartikel rundet das Gemini 3.6 Flash DeepSWE-Ergebnis auf 49,0 %, während die detaillierte DeepMind-Modellkarte 48,6 % angibt. Dieser Artikel verwendet den präziseren Wert der Modellkarte in der Vergleichstabelle.

Google Kosten-Nutzen-Diagramm für Gemini 3.7 Flash bei DeepSWE v1.1

Quelle: blog.google

Google rahmt die Veröffentlichung auch um die Kosten pro abgeschlossener Software-Engineering-Aufgabe herum ein, nicht nur um den Preis pro Token. Das ist die richtige Produktionsmetrik für Agenten: Wiederholungsversuche, Schlussfolgerungs-Tokens und wiederholte Tool-Aufrufe können wichtiger sein als die Schlagzeilen-Token-Rate.

Gemini 3.7 Flash Preisgestaltung

Gemini 3.7 Flash hat einen zeitlich begrenzten Preisplan. Die aktuellen Einführungspreise gelten bis zum 31. Dezember 2026. Googles Preisdokumentation verdoppelt dann die Token-Preise am 1. Januar 2027.

Verbrauchsoption Eingabe / 1 Mio. Tokens bis 31. Dez. 2026 Ausgabe / 1 Mio. Tokens bis 31. Dez. 2026 Eingabe / Ausgabe ab 1. Jan. 2027
Standard bezahlt $0.75 $3.75 $1.50 / $7.50
Stapelverarbeitung $0.375 $1.875 $0.75 / $3.75
Flexibel $0.375 $1.875 $0.75 / $3.75
Priorität $1.35 $6.75 $2.70 / $13.50

Die Ausgabe-Preise beinhalten Denk-Tokens. Standard-Cache-Speicherung kostet 0,075 $ pro Million gespeicherter Tokens während der Einführungsphase, plus 0,50 $ pro Million Tokens pro Stunde für die Cache-Speicherung; diese Preise verdoppeln sich ebenfalls 2027. Google Search Grounding und Google Maps Grounding können zusätzliche Gebühren nach dem gemeinsamen monatlichen Freibetrag hinzufügen, der in Googles Preisdokumentation beschrieben ist.

Die Standard-API hat auch eine kostenlose Stufe, die als kostenlos aufgeführt ist. Diese sollte nicht als garantierte Produktionskapazität behandelt werden: Ratenbegrenzungen hängen vom Modell, Projekt, Nutzungsebene und Kontostatus ab, und Google gibt ausdrücklich an, dass veröffentlichte Limits nicht garantiert sind. Für bezahlte Produktionsarbeitslasten sind die Modellkosten nur ein Teil des Budgets; Grounding, externe APIs, Speicher und fehlgeschlagene oder wiederholte Agentenschritte können die Gesamtkosten verändern.

Beispielkosten für die Standard-API

Monatliche Token-Nutzung Geschätzte Kosten bis 31. Dez. 2026 Geschätzte Kosten ab 1. Jan. 2027
10 Mio. Eingabe + 2 Mio. Ausgabe $15.00 $30.00
50 Mio. Eingabe + 5 Mio. Ausgabe $56.25 $112.50
100 Mio. Eingabe + 20 Mio. Ausgabe $150.00 $300.00

Diese Beispiele umfassen nur Modell-Ein- und Ausgabetoken. Sie beinhalten keine Grounding-, Cache-Speicher-, externe Dienste oder Anwendungs-Infrastruktur.

Gemini 3.7 Flash API Verfügbarkeit

Gemini 3.7 Flash ist keine reine Vorschau-Ankündigung. Google Cloud listet gemini-3.7-flash als GA mit einem Veröffentlichungsdatum vom 13. August 2026, und die Gemini API-Dokumentation identifiziert dieselbe Zeichenkette als stabile Modellversion.

Benutzergruppe Wo Gemini 3.7 Flash verfügbar ist Wichtige Details
API-Entwickler Gemini API und Google AI Studio Verwenden Sie die stabile Modell-ID gemini-3.7-flash
Android-Entwickler Android Studio Google listet Android Studio als Startplattform für Entwickler
Agentenentwickler Google Antigravity Entwickelt für Agenten-First-Coding und mehrstufige Workflows
Unternehmen Gemini Enterprise Agent Platform und Gemini Enterprise App Unternehmensweite Governance, Abrechnung und regionale Kontrolle gelten
Einzelpersonen Gemini Spark in der Gemini App Google gibt an, dass Spark 3.7 Flash für Google AI Pro und Ultra-Abonnenten in mehr als 160 unterstützten Ländern verwendet

Für Entwickler, die den Zugriff noch nicht eingerichtet haben, enthält Zerlos Anleitung zur Gemini API-Schlüssel die Einrichtung von Google AI Studio. Sobald der Zugriff bereit ist, ist die entscheidende Bereitstellungsänderung der Modellbezeichner; die Produktionsmigration sollte weiterhin Regressionstests für Tools, Schemata, Latenz und den gesamten Token-Verbrauch beinhalten.

Entwickler, der mit Quellcode auf einem Laptop arbeitet

Quelle: pexels.com

Das Wechseln zu einer neuen Modell-ID ist der einfache Teil. Die sicherere Migration besteht darin, repräsentative Coding- und Agentenaufgaben in der Staging-Umgebung zu testen, die Aufgabenerfolgsrate, Latenz, Token-Nutzung, Wiederholungsversuche und Tool-Aufrufe zu protokollieren und erst dann den Produktionsverkehr zu verlagern.

Ratenbegrenzungen sind projektspezifisch

Es gibt keine einzelne Gemini 3.7 Flash RPM- oder TPM-Zahl, die für jedes Konto gilt. Google misst Limits anhand von Anfragen pro Minute, Tokens pro Minute und Anfragen pro Tag, wendet sie pro Projekt und nicht pro API-Schlüssel an und passt sie anhand der Nutzungsebene und des Kontostatus an. Google empfiehlt, die aktiven Limits für das Projekt direkt in AI Studio zu überprüfen. Stapelverarbeitungsverkehr hat separate Limits; beispielsweise erlaubt die dokumentierte Stapelwarteschlange der Stufe 1 3.000.000 enqueued Tokens für Gemini 3.7 Flash.

Kontextfenster, Modalitäten und unterstützte Tools

Das Kern-API-Umfang ist für jeden vertraut, der bereits 3.6 Flash verwendet: ein Eingabekontext von 1.048.576 Tokens und eine maximale Textausgabe von 65.536 Tokens. Das Modell kann Text, Bilder, Video, Audio und PDF-Dokumente verarbeiten, generiert aber selbst keine Bilder oder Audio.

Fähigkeit Status in Gemini 3.7 Flash
Caching Unterstützt
Codeausführung Unterstützt
Computer-Nutzung Unterstützt in Vorschau
Datei-Suche Unterstützt
Funktionsaufruf Unterstützt
Google-Suche-Verankerung Unterstützt
Google Maps-Verankerung Unterstützt
Strukturierte Ausgaben Unterstützt
URL-Kontext Unterstützt
Denklevel Niedrig, mittel und hoch
Live-API Nicht unterstützt
Bilderzeugung Nicht unterstützt
Audiosynthese Nicht unterstützt

Eine Migrationsfalle ist die Denk-Konfiguration. Gemini 3.7 Flash unterstützt niedrig, mittel und hoch. Google Cloud dokumentiert mittel als Standard in seiner Enterprise Agent Platform, während die explizite Festlegung auf minimal einen Validierungsfehler ergibt. Anwendungen, die zuvor eine minimale Einstellung verwendet haben, sollten dieses Verhalten auf eine unterstützte Stufe abbilden und Latenz und Ausgabequalität neu messen.

Büroangestellte, die Dokumente neben einem Laptop prüfen

Quelle: pexels.com

Gemini 3.7 Flash verbessert die veröffentlichten PDF- und Wissensarbeitsergebnisse von Google, was für dokumentenintensive Arbeitsabläufe relevant ist. Ein höherer Benchmark-Wert beseitigt nicht das Risiko von Halluzinationen, daher müssen wichtige extrahierte Fakten und konsequente Entscheidungen weiterhin überprüft werden.

Was die Änderungen in der Praxis bedeuten

Für Coding-Agenten

Gemini 3.7 Flash bietet die stärkste Upgrade-Story, wenn eine Anwendung Long-Horizon-Coding anstelle von isolierten Snippets durchführt. Die Gewinne bei DeepSWE, FrontierCode und Terminal-Bench deuten alle in die gleiche Richtung: Das Modell ist besser in der Lage, mehrstufige Engineering-Aufgaben zu bewältigen. Google gibt außerdem an, dass es disziplinierter darin ist, sich an Hindernisse anzupassen und die Absicht zu klären, was wichtig sein kann, wenn ein Agent die Berechtigung hat, Dateien zu bearbeiten oder wiederholt Tools aufzurufen.

Für Dokumenten- und Wissensworkflows

Das Kontextfenster von einer Million Token ist unverändert, aber die Qualität der Arbeit mit dichten Materialien scheint in den Release-Bewertungen verbessert zu werden. Das macht 3.7 Flash zu einem stärkeren Kandidaten für Jahresberichte, juristische Dokumenten-Pipelines, wissenschaftliche Literatur, interne Wissensdatenbanken und gemischte PDF-Workflows. Ein riesiges Kontextfenster ist jedoch nicht dasselbe wie perfekte Abrufung; Abrufsysteme, Dateisuche und Prompt-Segmentierung können immer noch zuverlässiger und kostengünstiger sein, als alles bei jeder Anfrage zu senden.

Für die Webentwicklung

Google hebt eine höhere Genauigkeit beim erstmaligen Code-Durchlauf, funktionalere Layouts und weniger Prompts zur Erreichung von Feature-Complete-Apps hervor. Der Elo-Score von 1588 im Code Arena ist der klarste veröffentlichte Indikator. Teams sollten die Übereinstimmung mit dem Design, das Browserverhalten, die Zugänglichkeit und Framework-spezifische Konventionen weiterhin auf ihrer eigenen Codebasis bewerten, da ein aggregierter Web-Benchmark nicht jeden Frontend-Stack darstellen kann.

Für einfache Aufgaben mit hohem Volumen

Gehen Sie nicht davon aus, dass 3.7 Flash jedes günstigere Modell ersetzen sollte. Wenn die Arbeitslast Klassifizierung, Extraktion oder templated Transformation mit sehr hohem Volumen ist, kann ein Flash-Lite-Modell bei Kosten und Durchsatz immer noch gewinnen. Der Zweck von 3.7 Flash ist es, stärkere Schlussfolgerungs- und agentische Leistung in die Flash-Schicht zu bringen, nicht die kostengünstigste Option für jede Anfrage zu werden.

Sollten Sie von Gemini 3.6 Flash migrieren?

Arbeitslast Empfohlene Richtung Warum
Repository-Level-Coding-Agent 3.7 Flash intensiv testen Große veröffentlichte Gewinne bei DeepSWE und FrontierCode
Automatisierung von Geschäftsprozessen 3.7 Flash testen AutomationBench verbessert sich von 17,0 % auf 30,4 %
PDF- und Dokumentenanalyse 3.7 Flash testen Höhere GDP.pdf- und Long-Context-Ergebnisse
Bestehende stabile 3.6 Flash-Pipeline Vor dem Wechsel Benchmark erstellen Die aktuellen Einführungspreise pro Token sind gleich, daher sollten Qualität, Latenz und Kosten pro Aufgabe entscheiden
Hochvolumige einfache Extraktion Vergleich mit Flash-Lite Ein leichteres Modell kann immer noch ein besseres Durchsatz-/Kostenprofil aufweisen
Echtzeit-Sprachanwendung Verwenden Sie ein Live-API-kompatibles Modell Gemini 3.7 Flash unterstützt keine Live-API
Bild- oder Audiosynthese Verwenden Sie ein anderes Modell 3.7 Flash erzeugt Textausgabe, keine generierten Bilder oder Audios

Migrationscheckliste für Gemini 3.7 Flash

  1. Ändern Sie das Zielmodell auf gemini-3.7-flash zuerst in einer Staging-Umgebung.
  2. Überprüfen Sie die Denk-Konfiguration. Senden Sie nicht minimal; wählen Sie niedrig, mittel oder hoch.
  3. Führen Sie Funktionstestaufrufe, strukturierte Ausgabenvalidierung und Tool-Berechtigungsprüfungen erneut durch.
  4. Testen Sie Long-Context- und PDF-Workflows mit denselben repräsentativen Dokumenten, die in der Produktion verwendet werden.
  5. Messen Sie erfolgreiche Aufgabenerfüllung, Latenz, Eingabe-Token, Ausgabe- und Denk-Token, Wiederholungsversuche, Runden und Tool-Aufrufe.
  6. Berücksichtigen Sie Verankerungs- und Caching-Gebühren bei der Berechnung der Gesamtkosten pro Aufgabe.
  7. Führen Sie die Einführung schrittweise durch und behalten Sie einen getesteten Rollback-Pfad zum bestehenden Produktionsmodell bei.

Zu beachtende Einschränkungen

Die Modellkarte von Google DeepMind listet die Standardbeschränkungen von Foundation Models auf, einschließlich Halluzinationen, und stellt fest, dass gelegentliche Langsamkeit oder Timeouts auftreten können. Sie gibt Gemini 3.7 Flash einen Wissensstand vom März 2026 an, warnt jedoch, dass einige Domänen effektiv auf Januar 2025 beschränkt sein können. Aktuelle Informationen erfordern daher immer noch eine Verankerung oder Abfrage aus aktuellen Quellen, wenn Aktualität wichtig ist.

Computer-Nutzung ist als Vorschau gekennzeichnet, daher sollten Anwendungen Berechtigungen einschränken, Aktionen validieren und menschliche Bestätigung für folgenschwere Schritte beibehalten. Dem Modell fehlen außerdem Live-API, Bilderzeugung und Audiosynthese. Schließlich ist die attraktive Startpreisgestaltung ausdrücklich zeitlich begrenzt; Anwendungen mit einer sinnvollen Nutzung im Jahr 2027 sollten gegen die Preise nach der Promotion budgetieren, anstatt davon auszugehen, dass die Preise vom August 2026 bestehen bleiben.Technischer Vergleich von Gemini und Claudebietet zusätzlichen Kontext. Da Modellgenerationen und Preise sich schnell ändern, verwenden Sie die aktuellen Anbieterdokumentationen für Beschaffungsentscheidungen und vergleichen Sie die genauen Modelle, die Sie einsetzen möchten.

FAQ

Wann wurde Gemini 3.7 Flash veröffentlicht?

Google kündigte Gemini 3.7 Flash am 13. August 2026 an und veröffentlichte es. Google Cloud listet das stabile Modell als allgemein verfügbar und nicht nur als Vorschau.

Wie lautet der API-Modellname für Gemini 3.7 Flash?

Die stabile Modellkennung ist gemini-3.7-flash. Google listet diese genaue ID sowohl in der Gemini API-Modell-Dokumentation als auch in seiner Enterprise-Modell-Dokumentation auf.

Wie viel kostet Gemini 3.7 Flash?

Bis zum 31. Dezember 2026 betragen die Standardgebühren für bezahlte API-Nutzung 0,75 USD pro Million Eingabe-Token und 3,75 USD pro Million Ausgabe-Token, einschließlich Denk-Token. Ab dem 1. Januar 2027 steigen diese Sätze auf 1,50 USD und 7,50 USD. Batch, Flex und Priority haben separate Tarife.

Ist Gemini 3.7 Flash günstiger als Gemini 3.6 Flash?

Nicht zu den aktuellen Einführungspreisen pro Token. Die Modellkarte von Google vom August 2026 listet sowohl Gemini 3.6 Flash als auch Gemini 3.7 Flash bis zum 31. Dezember 2026 für 0,75 USD pro Million Eingabe-Token und 3,75 USD pro Million Ausgabe-Token auf. Googles Formulierung "halber Preis" beim Start vergleicht 3.7 mit dem ursprünglichen Startpreis von 3.6 Flash.

Ist Gemini 3.7 Flash in der API verfügbar?

Ja. Es ist über die Gemini API und Google AI Studio mit der stabilen Modellkennung gemini-3.7-flash verfügbar. Google vertreibt es auch über Antigravity und Enterprise Gemini Produkte.

Was ist das Kontextfenster von Gemini 3.7 Flash?

Das Limit für Eingabe-Token beträgt 1.048.576 Token und die maximale Ausgabe beträgt 65.536 Token. Eingaben können Text, Bilder, Video, Audio und PDF-Dokumente enthalten; die Ausgabe ist Text.

Unterstützt Gemini 3.7 Flash die Live API?

Nein. Die Modelldokumentation von Google kennzeichnet die Live API als nicht unterstützt. Anwendungen, die native Echtzeit-Sprachinteraktion erfordern, sollten ein Live API-kompatibles Modell wählen.

Ist Gemini 3.7 Flash besser als Gemini 3.6 Flash?

Die von Google veröffentlichten Auswertungen zeigen erhebliche Verbesserungen bei mehreren Benchmarks für Codierung, Automatisierung, PDF, langen Kontext und Computernutzung, aber nicht jeder Benchmark wird verbessert. Die praktische Antwort hängt von der Arbeitslast, dem Latenzziel, dem Tool-Verhalten und den Kosten pro erfolgreicher Aufgabe ab, daher sollten Produktionsteams ihre eigenen repräsentativen Auswertungen durchführen.

Fazit

Gemini 3.7 Flash ist ein bedeutsames Upgrade für den Teil der Flash-Familie, der für Entwickler am wichtigsten ist: mehrstufige Codierung, Agenten, Automatisierung und dokumentenintensive Arbeitsabläufe. Googles stärkste veröffentlichten Verbesserungen sind keine kleinen Ranglisten-Schubser; DeepSWE steigt von 48,6 % auf 65,3 %, AutomationBench von 17,0 % auf 30,4 % und GDP.pdf von 22,0 % auf 34,0 %, während das Modell dasselbe Millionen-Token-Kontextfenster und die breite Gemini-Tool-Unterstützung beibehält.

Die Preisgestaltung ist ebenso wichtig. Die Standard-API-Nutzung kostet vorübergehend 0,75 $ pro Million Eingabe-Tokens und 3,75 $ pro Million Ausgabe-Tokens, aber diese Sätze verdoppeln sich am 1. Januar 2027. Für Teams, die bereits Gemini 3.6 Flash verwenden, ist der beste Grund für die Migration daher eine bessere Aufgabenausführung zum gleichen aktuellen Einführungspreis pro Token und nicht eine dauerhafte Preissenkung. Testen Sie 3.7 Flash mit echten Arbeitslasten, berücksichtigen Sie Tool- und Wiederholungsschleifen-Kosten und treffen Sie die Migrationsentscheidung basierend auf den Kosten und der Zuverlässigkeit pro erfolgreicher Aufgabe und nicht allein auf dem Modellnamen.

Teilen Sie doch unseren Beitrag!
Quellen