Velokey
Analysen & Reviews

Gemini 3.6 Flash vs. GPT-5.6 vs. Claude Haiku (2026)

Gemini 3.6 Flash ist gerade erschienen. Wie es im Vergleich zu GPT-5.6 Luna und Claude Haiku 4.5 bei Preis, Geschwindigkeit, Coding und Kontext abschneidet – mit einer Empfehlung für jede Aufgabe.

Gemini 3.6 Flash vs. GPT-5.6 vs. Claude Haiku (2026)

TL;DR

  • Am schnellsten: Gemini 3.6 Flash, und das mit deutlichem Abstand. Rund 300 tokens pro Sekunde gegenüber 100 bis 150 bei GPT-5.6 Luna.
  • Günstigster leistungsfähiger Coder: GPT-5.6 Luna für $1 / $6 pro Million tokens, und es erzielt bei Coding-Benchmarks bessere Werte als Flash.
  • Größter Kontext und multimodal: Gemini 3.6 Flash, 1M tokens mit nativem Video, Audio und PDF. Claude Haiku 4.5 endet bei 200K.
  • Absoluter Tiefstpreis: Gemini 3.5 Flash-Lite für $0.30 / $2.50, das Geschwistermodell, das am selben Tag für einfache Aufgaben mit hohem Volumen gestartet ist.
  • Kein einzelner Gewinner: Flash für Geschwindigkeit und Kontext, Luna für günstiges Coding, Haiku für Anthropic-nativen Text, Flash-Lite für die günstigsten Massenjobs.

Google hat Gemini 3.6 Flash am July 21, 2026 veröffentlicht, und die naheliegende Frage ist, wie es im Vergleich zu den anderen günstigen, schnellen Arbeitspferden abschneidet, die man tatsächlich in der Produktion einsetzen würde. Hier ist der ehrliche Direktvergleich zu Preis, Geschwindigkeit, Coding und Kontext, mit einer klaren Empfehlung für jede Art von Aufgabe.

Was wurde tatsächlich eingeführt?

Google hat drei Modelle auf einmal veröffentlicht, nicht nur eines. Gemini 3.6 Flash ist die Schlagzeile, ein schnelleres und günstigeres Update von 3.5 Flash. Daneben kamen Gemini 3.5 Flash-Lite, eine extrem günstige Stufe für Arbeiten mit hohem Volumen, und Gemini 3.5 Flash Cyber, ein eingeschränkter Sicherheitsspezialist, den man nicht einfach in der API auswählen kann. Für diesen Vergleich sind Flash und Flash-Lite die beiden relevanten Modelle, da Cyber nicht allgemein verfügbar ist.

Die Modelle, mit denen Flash konkurriert, sind ebenfalls nicht stehen geblieben. OpenAI's GPT-5.6-Familie erschien bereits früher im Juli mit drei eigenen Stufen, und ihre Budget-Stufe, Luna, ist hier der direkte Rivale. Anthropic's Claude Haiku 4.5 vervollständigt die günstige und schnelle Kategorie. Der eigentliche Kampf ist also ein Vierkampf, und er ist interessanter als eine einfache Geschichte nach dem Motto „Ist das neue Google-Modell gut?“.

Gemini 3.6 Flash vs GPT-5.6 Luna vs Claude Haiku 4.5: die Zahlen

Hier ist der direkte Vergleich der Spezifikationen, die eine Produktionsentscheidung bestimmen. Preise gelten pro Million Tokens.

Gemini 3.6 FlashGPT-5.6 LunaClaude Haiku 4.5Gemini 3.5 Flash-Lite
Eingabepreis$1.50$1.00$1.00$0.30
Ausgabepreis$7.50$6.00$5.00$2.50
Kontextfenster1M1M200K1M
Maximale Ausgabe64K128K64K
Geschwindigkeit (Tokens/Sek.)~300100–150mittelschnell
Nativ multimodalJaJaBegrenztJa
WissensstichtagMärz 2026aktuell2025März 2026

Das Muster fällt schnell auf. Gemini 3.6 Flash ist hier nicht am günstigsten. Luna und Haiku unterbieten es beide bei Eingabe und Ausgabe, und Flash-Lite lässt alle drei teuer wirken. Was Flash dir für die zusätzlichen Kosten bietet, ist Geschwindigkeit und der größte Kontext, was für manche Aufgaben wichtiger ist als für andere.

Wähle ein günstiges, schnelles LLM nach Aufgabe: Gemini 3.6 Flash für Geschwindigkeit und Kontext, GPT-5.6 Luna für günstiges Coding, Claude Haiku 4.5 für Anthropic-Text, Gemini 3.5 Flash-Lite für günstigste Massenverarbeitung

Welches ist tatsächlich am günstigsten?

Beim reinen Listenpreis gewinnt Gemini 3.5 Flash-Lite mit großem Abstand: $0.30 Input und $2.50 Output. Aber unter den drei wichtigsten Arbeitspferden schlagen GPT-5.6 Luna und Claude Haiku 4.5 beide Gemini 3.6 Flash. Haiku ist beim Output mit $5 am günstigsten, Luna liegt bei $6, und Flash ist mit $7.50 das teuerste der drei.

Der Output-Preis ist der Punkt, an dem es weh tut. Warum? Die meisten realen Workloads erzeugen weit mehr Output-Tokens, als sie Input-Tokens aufnehmen, und ein Chatbot oder Agent, der lange Antworten schreibt, bekommt die $7.50-Rate von Flash bei jedem einzelnen Aufruf zu spüren. Wenn deine Aufgabe also output-lastig ist und die Geschwindigkeit von Flash nicht braucht, sparen Luna oder Haiku im großen Maßstab echtes Geld.

Noch eine Besonderheit. Luna kommt mit einem 90% Rabatt auf gecachte Input-Lesevorgänge, was die Kosten für Workloads mit wiederholtem Kontext wie RAG weiter senkt. Wenn du denselben System-Prompt oder Dokumentensatz tausende Male verwendest, kann dieser Cache-Rabatt wichtiger sein als der Unterschied beim Listenpreis.

Was kostet jedes Modell im großen Maßstab?

Listenpreise wirken abstrakt, bis man nachrechnet. Nehmen wir eine moderate Arbeitslast von 1M Eingabe- und 1M Ausgabe-Tokens pro Tag; dann verteilen sich die monatlichen Rechnungen schnell:

  • Gemini 3.6 Flash: etwa $270 pro Monat
  • GPT-5.6 Luna: etwa $210 pro Monat
  • Claude Haiku 4.5: etwa $180 pro Monat
  • Gemini 3.5 Flash-Lite: etwa $84 pro Monat

Damit kostet Flash ungefähr 50% mehr als Haiku und über 3x so viel wie Flash-Lite bei genau demselben Token-Volumen. Und der meiste Produktions-Traffic ist output-lastig, daher fällt die tatsächliche Lücke größer aus, als diese gleichmäßige Aufteilung zeigt. Ist die Geschwindigkeit von Flash einen Aufpreis von 50% gegenüber Haiku wert? Für eine Live-Chat-UI, bei der Nutzer jedes Token beim Eintreffen sehen, oft ja. Für einen nächtlichen Batch-Job, auf den niemand starrt, fast nie. Diese eine Frage, latenzsensibel oder nicht, entscheidet mehr über das Kostenargument als die Preistabelle.

Wer ist am schnellsten?

Gemini 3.6 Flash, mit großem Abstand. Es streamt rund 300 Tokens pro Sekunde, etwa doppelt so viel wie GPT-5.6 Lunas 100 bis 150. Bei allem, worauf ein Nutzer wartet, ob Live-Chat, Autocomplete oder ein Agent, der reaktionsschnell wirken muss, macht diese Lücke den Unterschied zwischen flott und träge.

Geschwindigkeit ist Flashs eigentliches Verkaufsargument. Google sagt, dass 3.6 Flash außerdem 17% weniger Output-Tokens als 3.5 Flash verwendet, um dieselbe Aufgabe abzuschließen, und bei mehrstufigen Workflows weniger Reasoning-Schritte benötigt. Weniger Tokens bei einer höheren Rate pro Token können bei manchen Jobs dennoch unterm Strich günstiger sein, daher unterschätzt der Listenpreis allein seinen Wert für latenzempfindliche, durchsatzstarke Nutzung.

Ist die 1M-Kontextlücke relevant?

Nur wenn deine Arbeitslast sie tatsächlich ausfüllt. Gemini 3.6 Flash, Luna und Flash-Lite haben alle ein 1M-Token-Fenster, während Claude Haiku 4.5 bei 200K endet. Ist 5x mehr Kontext ein echter Vorteil? Für die meisten Chats und kurzen Aufgaben eigentlich nicht. Du wirst gar nicht erst in die Nähe von 200K kommen. Das ändert sich jedoch in dem Moment, in dem du ganze Codebasen, lange PDFs oder stundenlange Transkripte in einen einzigen Aufruf gibst. Dann zwingt dich Haiku dazu, deine Eingabe in Stücke aufzuteilen und die Teile wieder zusammenzusetzen, was Latenz und Fehlerquellen erhöht, während die 1M-Modelle alles einfach komplett schlucken. Große Eingaben? Dann kann allein diese Lücke die Wahl entscheiden, noch vor Preis oder Geschwindigkeit.

Wo gewinnt jedes Modell bei der Qualität?

Sie teilen sich die Siege, weshalb es keinen klaren Gesamtsieger gibt. Jedes hat einen Bereich, in dem es deutlich führt:

  • Coding geht an Luna. GPT-5.6 Luna erzielt bei Produktions-Coding-Benchmarks wie SWE-Bench Pro und Terminal-Bench bessere Werte als Gemini 3.6 Flash, und es ist günstiger. Für einen Coding-Agent mit begrenztem Budget ist Luna die preiswerte Wahl, mit Claude Haiku 4.5 dicht dahinter bei textlastigem Coding innerhalb seines 200K-Kontextfensters.
  • Langer Kontext und multimodal gehen an Gemini. Flash gewinnt bei Long-Context-Retrieval und diagrammbasierter Schlussfolgerung mit einem Abstand, den die Benchmarks als deutlich bezeichnen, und es verarbeitet nativ Video, Audio und PDF. Sein 1M-Kontextfenster stellt Haikus 200K in den Schatten.
  • Anspruchsvolle Wissensarbeit tendiert woandershin. Flash verliert Boden gegenüber größeren Modellen wie Claude Sonnet 5 bei tiefgehender Schlussfolgerung. Wenn also Qualität bei den schwierigsten Aufgaben wichtiger ist als Geschwindigkeit oder Preis, ist keine dieser günstigen Stufen die richtige Antwort.

Claude Haiku 4.5 ist hier der schwierige Fall. Es ist für seine Größe stark beim Coding, liegt aber mit $1 / $5 inzwischen hinter Gemini 3.5 Flash-Lite und günstigeren Konkurrenten bei vielen Benchmarks, während es mehr kostet als Flash-Lite. Es ergibt am meisten Sinn, wenn du bereits im Anthropic-Ökosystem bist und ein schnelles Claude möchtest.

Was hat sich gegenüber Gemini 3.5 Flash geändert?

Wenn du bereits 3.5 Flash nutzt, ist das Upgrade leicht zu rechtfertigen. Du bekommst denselben 1M-Kontext, einen niedrigeren Ausgabepreis und ein intelligenteres Modell. Die Ausgabe ist von $9 auf $7.50 pro Million gesunken, eine Senkung um 17%, während das Modell für dieselbe Arbeit 17% weniger Ausgabe-Tokens verwendet. Bei ausgabelastigen Aufgaben ist das eine doppelte Ersparnis.

Du bekommst außerdem einen Wissensstand, der endlich von Januar 2025 auf März 2026 verschoben wurde, integrierte Computer Use für Agentenaufgaben und eine bessere Effizienz beim Tool-Calling. Für die meisten bestehenden 3.5 Flash-Workloads ist der Wechsel zu 3.6 Flash günstiger und besser, ohne echten Nachteil. Diese Kombination ist selten genug, um es einfach zu tun.

Und was ist mit Gemini 3.5 Flash Cyber?

Es ist der Sonderfall, und du kannst es wahrscheinlich nicht nutzen. Gemini 3.5 Flash Cyber ist ein eingeschränkter Sicherheitsspezialist, abgestimmt auf Cyberabwehr- und Bedrohungsanalyse-Arbeiten, und es ist nicht Teil der offenen Gemini API so wie Flash und Flash-Lite. Der Zugriff ist beschränkt. Für die große Mehrheit der Entwickler, die normale Apps bauen, kommt es schlicht nicht infrage, weshalb sich dieser Vergleich auf die beiden öffentlichen Gemini-Modelle beschränkt. Es ist gut zu wissen, dass es existiert, vor allem damit du nicht nach einem API-Endpunkt suchst, der niemals auf deinen Key antworten wird.

Welches sollten Sie verwenden?

Es gibt keine einzig richtige Antwort, und das ist die ehrliche Schlussfolgerung aus dem gesamten Vergleich. Wählen Sie das Modell passend zur Aufgabe vor Ihnen, nicht danach, welches zuletzt veröffentlicht wurde:

  • Wählen Sie Gemini 3.6 Flash für latenzkritische Apps, Long-Context- oder multimodale Arbeit sowie Agenten, die Geschwindigkeit brauchen. Es ist das schnellste und hat den breitesten nutzbaren Kontext.
  • Wählen Sie GPT-5.6 Luna für kostenkritisches Coding und Aufgaben mit hohem Volumen, bei denen sich der Cache-Rabatt und der Coding-Vorteil auszahlen. Es ist der günstigste leistungsfähige Coder der Gruppe.
  • Wählen Sie Claude Haiku 4.5, wenn Sie Anthropic-nativ arbeiten und schnelles Claude für Text und Coding innerhalb eines 200K-Kontexts möchten.
  • Wählen Sie Gemini 3.5 Flash-Lite für die einfachsten Jobs mit dem höchsten Volumen, bei denen der Preis pro Token alles andere schlägt.

Der Haken an einer Multi-Modell-Strategie ist die technische Verkabelung. Drei Anbieter bedeuten drei Konten, drei SDKs und drei Abrechnungs-Setups. Wenn Sie alle über einen OpenAI-kompatiblen Endpoint wie Velokey routen, umgehen Sie das, sodass Sie Coding-Calls an Luna und schnelle multimodale Calls an Flash mit einem einzigen Schlüssel senden können. Für tiefere Einblicke behandelt unser GPT-5.6 Sol vs Terra vs Luna breakdown die OpenAI-Tiers, der GLM vs GPT vs Claude comparison ordnet die Frontier-Tier ein, Claude Sonnet 5 ist der nächste Schritt für Wissensarbeit, und Kimi K3 ist eine weitere günstige Frontier-Option, die einen Blick wert ist.

Häufig gestellte Fragen

Ist Gemini 3.6 Flash günstiger als GPT-5.6?

Nicht günstiger als jede Stufe. Gemini 3.6 Flash kostet $1.50 Input / $7.50 Output pro Million Tokens, was mehr ist als GPT-5.6 Luna ($1 / $6), aber deutlich weniger als GPT-5.6 Terra ($2.50 / $15) oder Sol ($5 / $30). Im direkten Vergleich mit Luna ist Flash die teurere, aber deutlich schnellere Option.

Ist Gemini 3.6 Flash besser als Claude Haiku 4.5?

Das hängt von der Aufgabe ab. Flash hat 5x so viel Kontext (1M vs 200K), stärkere Multimodalität und höhere Geschwindigkeit. Haiku 4.5 ist beim Output günstiger und für seine Größe stark beim Coding. Für Long-Context- oder multimodale Arbeit gewinnt Flash; für Anthropic-native Texte und Coding in einem kleineren Kontext hält Haiku gut mit.

Was ist der Unterschied zwischen Gemini 3.6 Flash und 3.5 Flash-Lite?

Flash ist das schnellere, leistungsfähigere Modell; Flash-Lite ist das mit dem absoluten Niedrigstpreis. Flash kostet $1.50 / $7.50 und liegt bei Geschwindigkeit und Reasoning vorn. Flash-Lite kostet $0.30 / $2.50 und zielt auf einfachere Aufgaben mit hohem Volumen ab, bei denen die Kosten pro Token am wichtigsten sind. Beide behalten das 1M-Kontextfenster.

Welches günstige Modell ist am besten fürs Coding?

GPT-5.6 Luna, nach aktuellen Benchmarks. Es erzielt bei Production-Coding-Tests wie SWE-Bench Pro und Terminal-Bench höhere Werte als Gemini 3.6 Flash und kostet dabei weniger. Claude Haiku 4.5 ist ein solider zweiter Platz für textlastiges Coding innerhalb eines 200K-Kontexts. Gemini 3.6 Flash liegt beim reinen Coding hinter beiden.

Sollte ich von Gemini 3.5 Flash auf 3.6 Flash upgraden?

Ja, für die meisten Workloads. 3.6 Flash senkt den Output-Preis von $9 auf $7.50, verwendet 17% weniger Output-Tokens für dieselbe Aufgabe, verschiebt den Knowledge Cutoff auf März 2026 und fügt integrierte Computer Use hinzu. Derselbe 1M-Kontext, geringere Kosten, bessere Ergebnisse – es gibt also kaum einen Grund, bei 3.5 zu bleiben.

Wo kann ich auf Gemini 3.6 Flash zugreifen?

Es ist in der Gemini API über Google AI Studio und Android Studio sowie in Google Antigravity live. Du kannst außerdem Gemini 3.6 Flash, GPT-5.6 und Claude Haiku über ein einziges OpenAI-kompatibles Gateway erreichen, wenn du lieber nicht drei separate Provider-Konten und Keys für ein Multi-Model-Setup verwalten möchtest.

Unterstützt Gemini 3.6 Flash Tool Use und Computer Use?

Ja. Gemini 3.6 Flash wird mit nativem Tool Calling und integrierter Computer Use ausgeliefert, sodass es Browser- und Desktop-Aktionen für Agent-Workflows direkt out of the box steuern kann. Google berichtet außerdem, dass es weniger Tool Calls und Reasoning-Schritte als 3.5 Flash benötigt, um dieselbe mehrstufige Aufgabe abzuschließen, was bei agentischen Jobs sowohl Latenz als auch Token-Kosten reduziert.