Gemini 3.6 Flash contre GPT-5.6 contre Claude Haiku (2026)
Gemini 3.6 Flash vient tout juste d’être lancé. Comment il se compare à GPT-5.6 Luna et Claude Haiku 4.5 en matière de prix, de vitesse, de codage et de contexte, avec un choix recommandé pour chaque tâche.

TL;DR
- Le plus rapide : Gemini 3.6 Flash, et de loin. Environ 300 tokens par seconde contre 100 à 150 pour GPT-5.6 Luna.
- Codeur compétent le moins cher : GPT-5.6 Luna à $1 / $6 par million de tokens, et il surpasse Flash sur les benchmarks de codage.
- Plus grand contexte et multimodal : Gemini 3.6 Flash, 1M de tokens avec vidéo, audio et PDF natifs. Claude Haiku 4.5 plafonne à 200K.
- Prix plancher : Gemini 3.5 Flash-Lite à $0.30 / $2.50, le modèle frère lancé le même jour pour les tâches simples à fort volume.
- Aucun gagnant unique : Flash pour la vitesse et le contexte, Luna pour le codage bon marché, Haiku pour le texte natif Anthropic, Flash-Lite pour les tâches en masse les moins chères.
Google a lancé Gemini 3.6 Flash le 21 juillet 2026, et la question évidente est de savoir comment il se positionne face aux autres bêtes de somme bon marché et rapides que vous feriez réellement tourner en production. Voici une comparaison honnête, côte à côte, du prix, de la vitesse, du codage et du contexte, avec un choix clair pour chaque type de tâche.
Qu’est-ce qui a réellement été lancé ?
Google a sorti trois modèles à la fois, pas un seul. Gemini 3.6 Flash est la tête d’affiche, une mise à jour plus rapide et moins chère de 3.5 Flash. À ses côtés sont arrivés Gemini 3.5 Flash-Lite, une offre au prix plancher pour les travaux à gros volume, et Gemini 3.5 Flash Cyber, un spécialiste de la sécurité restreint que vous ne pouvez pas simplement choisir dans l’API. Pour cette comparaison, Flash et Flash-Lite sont les deux qui comptent, puisque Cyber n’est pas disponible de manière générale.
Les modèles avec lesquels Flash rivalise ne sont pas restés immobiles non plus. La famille GPT-5.6 d’OpenAI est arrivée plus tôt en juillet avec trois niveaux à elle, et son niveau économique, Luna, est le concurrent direct ici. Claude Haiku 4.5 d’Anthropic complète la catégorie bon marché et rapide. Le vrai combat est donc à quatre, et il est plus intéressant qu’une simple histoire du type « le nouveau modèle Google est-il bon ».
Gemini 3.6 Flash vs GPT-5.6 Luna vs Claude Haiku 4.5 : les chiffres
Voici le face-à-face sur les caractéristiques qui déterminent un choix en production. Les prix sont par million de tokens.
| Gemini 3.6 Flash | GPT-5.6 Luna | Claude Haiku 4.5 | Gemini 3.5 Flash-Lite | |
|---|---|---|---|---|
| Prix en entrée | $1.50 | $1.00 | $1.00 | $0.30 |
| Prix en sortie | $7.50 | $6.00 | $5.00 | $2.50 |
| Fenêtre de contexte | 1M | 1M | 200K | 1M |
| Sortie max | 64K | 128K | — | 64K |
| Vitesse (tokens/s) | ~300 | 100–150 | moyenne | rapide |
| Multimodal natif | Oui | Oui | Limité | Oui |
| Date limite des connaissances | March 2026 | récent | 2025 | March 2026 |
Le schéma saute vite aux yeux. Gemini 3.6 Flash n’est pas le moins cher ici. Luna et Haiku sont tous deux moins chers en entrée et en sortie, et Flash-Lite rend les trois autres onéreux. Ce que Flash vous apporte pour le surcoût, c’est la vitesse et le contexte le plus large, ce qui compte davantage pour certaines tâches que pour d’autres.

Lequel est réellement le moins cher ?
Sur le prix affiché brut, Gemini 3.5 Flash-Lite gagne haut la main avec $0.30 en entrée et $2.50 en sortie. Mais parmi les trois principaux modèles de référence, GPT-5.6 Luna et Claude Haiku 4.5 battent tous deux Gemini 3.6 Flash. Haiku est le moins cher en sortie à $5, Luna se situe à $6, et Flash est le plus cher du trio à $7.50.
Le prix de sortie, c’est là que ça pique. Pourquoi ? La plupart des charges de travail réelles génèrent bien plus de tokens de sortie qu’elles n’en reçoivent en entrée, et un chatbot ou un agent qui rédige de longues réponses ressent le tarif de $7.50 de Flash à chaque appel. Donc si votre tâche produit beaucoup de sortie et n’a pas besoin de la vitesse de Flash, Luna ou Haiku permet de réaliser de vraies économies à grande échelle.
Une nuance supplémentaire. Luna est fourni avec une remise de 90% sur les lectures d’entrée mises en cache, ce qui réduit encore les coûts pour les charges de travail à contexte répété comme RAG. Si vous envoyez le même prompt système ou le même ensemble de documents des milliers de fois, cette remise de cache peut compter davantage que l’écart de prix affiché.
Combien coûte chacun à grande échelle ?
Les prix affichés semblent abstraits jusqu’à ce que vous fassiez le calcul. Prenez une charge de travail modeste de 1M de tokens en entrée et 1M de tokens en sortie par jour, et les factures mensuelles divergent rapidement :
- Gemini 3.6 Flash : environ $270 par mois
- GPT-5.6 Luna : environ $210 par mois
- Claude Haiku 4.5 : environ $180 par mois
- Gemini 3.5 Flash-Lite : environ $84 par mois
Cela revient à Flash coûtant environ 50% de plus que Haiku et plus de 3x Flash-Lite pour exactement le même volume de tokens. Et la plupart du trafic en production penche vers davantage de sortie, donc l’écart réel est plus grand que ne le montre cette répartition équilibrée. La vitesse de Flash vaut-elle une prime de 50% par rapport à Haiku ? Pour une interface de chat en direct où les utilisateurs regardent chaque token arriver, souvent oui. Pour une tâche par lots nocturne que personne ne surveille, presque jamais. Cette seule question, sensible à la latence ou non, décide davantage de l’argument du coût que la grille tarifaire.
Qui est le plus rapide ?
Gemini 3.6 Flash, et de loin. Il diffuse environ 300 jetons par seconde, soit à peu près le double des 100 à 150 de GPT-5.6 Luna. Pour tout ce qu’un utilisateur attend, qu’il s’agisse d’un chat en direct, de l’autocomplétion ou d’un agent qui doit donner une impression de réactivité, cet écart fait la différence entre une expérience vive et une expérience poussive.
La vitesse est le véritable argument de Flash. Google affirme que 3.6 Flash utilise aussi 17% de jetons de sortie en moins que 3.5 Flash pour terminer la même tâche, et nécessite moins d’étapes de raisonnement sur les workflows à plusieurs étapes. Moins de jetons à un débit par jeton plus élevé peut tout de même revenir moins cher sur certaines tâches, de sorte que le prix affiché à lui seul sous-estime son intérêt pour les usages sensibles à la latence et à haut débit.
L’écart de contexte de 1M est-il important ?
Seulement si votre charge de travail l’exploite réellement. Gemini 3.6 Flash, Luna et Flash-Lite disposent tous d’une fenêtre de 1M-token, tandis que Claude Haiku 4.5 s’arrête à 200K. Un contexte 5x plus grand est-il un véritable avantage ? Pour la plupart des échanges de chat et des tâches courtes, pas vraiment. Vous n’approcherez jamais 200K au départ. En revanche, la situation change dès que vous injectez des bases de code entières, de longs PDF ou des heures de transcription dans un seul appel. Là, Haiku vous oblige à découper votre entrée et à réassembler les morceaux, ce qui ajoute de la latence et des points de défaillance, tandis que les modèles 1M avalent simplement le tout. De grosses entrées ? Alors cet écart à lui seul peut déterminer le choix, avant le prix ou la vitesse.
Où chaque modèle l’emporte-t-il en qualité ?
Ils se partagent les victoires, ce qui explique pourquoi il n’y a pas de champion global évident. Chacun a un domaine où il mène clairement :
- Le codage revient à Luna. GPT-5.6 Luna dépasse Gemini 3.6 Flash sur les benchmarks de codage en production comme SWE-Bench Pro et Terminal-Bench, et il est moins cher. Pour un agent de codage avec un budget limité, Luna est le choix offrant le meilleur rapport qualité-prix, avec Claude Haiku 4.5 juste derrière pour le codage très textuel dans sa fenêtre de 200K.
- Le contexte long et le multimodal reviennent à Gemini. Flash l’emporte sur la récupération en contexte long et le raisonnement fondé sur des graphiques avec une marge que les benchmarks qualifient de nette, et il prend en charge nativement la vidéo, l’audio et les PDF. Sa fenêtre de 1M éclipse les 200K de Haiku.
- Le travail de connaissance difficile penche ailleurs. Flash cède du terrain à des modèles plus grands comme Claude Sonnet 5 sur le raisonnement approfondi, donc si la qualité sur les tâches les plus difficiles compte davantage que la vitesse ou le prix, aucun de ces niveaux bon marché n’est la réponse.
Claude Haiku 4.5 est ici le cas délicat. Il est solide en codage pour sa taille, mais à $1 / $5, il est désormais derrière Gemini 3.5 Flash-Lite et des concurrents moins chers sur de nombreux benchmarks, tout en coûtant plus que Flash-Lite. Il est surtout pertinent lorsque vous êtes déjà dans l’écosystème Anthropic et que vous voulez un Claude rapide.
Qu’est-ce qui a changé par rapport à Gemini 3.5 Flash ?
Si vous utilisez déjà 3.5 Flash, la mise à niveau est facile à justifier. Vous obtenez le même contexte de 1M, un prix de sortie plus bas et un modèle plus intelligent. Le coût de sortie est passé de $9 à $7.50 par million, soit une baisse de 17%, tandis que le modèle utilise 17% de tokens de sortie en moins pour le même travail. Sur les tâches à forte sortie, c’est une double économie.
Vous bénéficiez également d’une limite de connaissances qui est enfin passée de janvier 2025 à mars 2026, de Computer Use intégré pour les tâches d’agent, et d’une meilleure efficacité des appels d’outils. Pour la plupart des charges de travail existantes de 3.5 Flash, passer à 3.6 Flash est moins cher et meilleur, sans véritable inconvénient. Cette combinaison est suffisamment rare pour simplement le faire.
Et qu'en est-il de Gemini 3.5 Flash Cyber ?
C'est l'exception, et vous ne pouvez probablement pas l'utiliser. Gemini 3.5 Flash Cyber est un spécialiste de la sécurité à accès restreint, optimisé pour les travaux de cyberdéfense et d'analyse des menaces, et il ne fait pas partie de l'API Gemini ouverte comme le sont Flash et Flash-Lite. L'accès est contrôlé. Pour l'immense majorité des développeurs qui créent des applications classiques, il n'est tout simplement pas envisageable, ce qui explique pourquoi cette comparaison se limite aux deux modèles Gemini publics. Il est utile de savoir qu'il existe, surtout pour éviter de chercher un endpoint d'API qui ne répondra jamais à votre clé.
Lequel devriez-vous utiliser ?
Il n’existe pas de réponse unique, et c’est la conclusion honnête de toute cette comparaison. Faites correspondre le modèle à la tâche qui vous attend, pas à celui qui a été lancé le plus récemment :
- Choisissez Gemini 3.6 Flash pour les apps sensibles à la latence, les travaux à long contexte ou multimodaux, et les agents qui ont besoin de vitesse. C’est le plus rapide et celui qui offre le contexte utilisable le plus large.
- Choisissez GPT-5.6 Luna pour le codage sensible aux coûts et les tâches à fort volume où sa remise de cache et son avantage en codage sont rentables. C’est le codeur performant le moins cher du groupe.
- Choisissez Claude Haiku 4.5 lorsque vous êtes natif Anthropic et que vous voulez Claude rapide pour le texte et le codage dans un contexte de 200K.
- Choisissez Gemini 3.5 Flash-Lite pour les tâches les plus simples et au plus grand volume, où le prix par token l’emporte sur tout le reste.
Le hic avec une stratégie multi-modèles, c’est la plomberie. Trois fournisseurs signifient trois comptes, trois SDK et trois configurations de facturation. Les faire tous passer par un seul endpoint compatible OpenAI comme Velokey évite cela, afin que vous puissiez envoyer les appels de codage à Luna et les appels multimodaux rapides à Flash avec une seule clé. Pour des analyses plus approfondies, notre comparatif GPT-5.6 Sol vs Terra vs Luna couvre les niveaux d’OpenAI, la comparaison GLM vs GPT vs Claude cartographie le niveau frontière, Claude Sonnet 5 est le cran supérieur pour le travail de connaissance, et Kimi K3 est une autre option frontière bon marché qui mérite le détour.
Foire aux questions
Gemini 3.6 Flash est-il moins cher que GPT-5.6 ?
Pas à tous les niveaux. Gemini 3.6 Flash coûte $1.50 en entrée / $7.50 en sortie par million de tokens, ce qui est plus que GPT-5.6 Luna ($1 / $6), mais bien moins que GPT-5.6 Terra ($2.50 / $15) ou Sol ($5 / $30). Face à Luna spécifiquement, Flash est l’option plus coûteuse, mais beaucoup plus rapide.
Gemini 3.6 Flash est-il meilleur que Claude Haiku 4.5 ?
Cela dépend de la tâche. Flash offre un contexte 5x plus grand (1M contre 200K), de meilleures capacités multimodales et une vitesse supérieure. Haiku 4.5 est moins cher en sortie et performant en codage pour sa taille. Pour les travaux à long contexte ou multimodaux, Flash l’emporte ; pour le texte et le codage natifs Anthropic dans un contexte plus réduit, Haiku tient la route.
Quelle est la différence entre Gemini 3.6 Flash et 3.5 Flash-Lite ?
Flash est le modèle le plus rapide et le plus performant ; Flash-Lite est celui au prix le plus bas. Flash coûte $1.50 / $7.50 et domine en vitesse et en raisonnement. Flash-Lite coûte $0.30 / $2.50 et cible les tâches plus simples à grand volume, où le coût par token compte le plus. Tous deux conservent la fenêtre de contexte de 1M.
Quel modèle bon marché est le meilleur pour le codage ?
GPT-5.6 Luna, d’après les benchmarks actuels. Il obtient de meilleurs scores que Gemini 3.6 Flash sur des tests de codage en production comme SWE-Bench Pro et Terminal-Bench tout en coûtant moins cher. Claude Haiku 4.5 est un solide deuxième choix pour le codage très axé texte dans un contexte de 200K. Gemini 3.6 Flash est derrière les deux en codage pur.
Dois-je passer de Gemini 3.5 Flash à 3.6 Flash ?
Oui, pour la plupart des charges de travail. 3.6 Flash réduit le prix de sortie de $9 à $7.50, utilise 17% de tokens de sortie en moins pour la même tâche, fait passer la date limite des connaissances à mars 2026 et ajoute Computer Use intégré. Même contexte de 1M, coût inférieur, meilleurs résultats : il y a donc peu de raisons de rester sur 3.5.
Où puis-je accéder à Gemini 3.6 Flash ?
Il est disponible dans la Gemini API via Google AI Studio et Android Studio, ainsi que dans Google Antigravity. Vous pouvez également y accéder, ainsi qu’à GPT-5.6 et Claude Haiku, via une passerelle unique compatible OpenAI si vous préférez ne pas jongler avec trois comptes et clés de fournisseurs distincts pour une configuration multi-modèles.
Gemini 3.6 Flash prend-il en charge l’utilisation d’outils et Computer Use ?
Oui. Gemini 3.6 Flash est livré avec l’appel d’outils natif et Computer Use intégré, ce qui lui permet de piloter des actions dans le navigateur et sur le bureau pour les workflows d’agents dès le départ. Google indique également qu’il utilise moins d’appels d’outils et d’étapes de raisonnement que 3.5 Flash pour terminer la même tâche en plusieurs étapes, ce qui réduit à la fois la latence et le coût en tokens sur les tâches agentiques.


