Velokey
分析测评

Gemini 3.6 Flash vs GPT-5.6 vs Claude Haiku(2026)

Gemini 3.6 Flash 刚上线。它和 GPT-5.6 Luna、Claude Haiku 4.5 在价格、速度、编码、上下文上怎么比,每种活该选谁,一次讲清。

Gemini 3.6 Flash vs GPT-5.6 vs Claude Haiku(2026)

TL;DR

  • 最快:Gemini 3.6 Flash,而且不是一点点。约 300 tokens/秒,GPT-5.6 Luna 才 100 到 150。
  • 最便宜的能打编码手:GPT-5.6 Luna,$1 / $6 每百万 token,而且编码 benchmark 分数比 Flash 高。
  • 上下文和多模态最强:Gemini 3.6 Flash,1M token,原生视频、音频、PDF。Claude Haiku 4.5 到 200K 就封顶。
  • 价格地板:Gemini 3.5 Flash-Lite,$0.30 / $2.50,同一天上线的兄弟,专治高量简单活。
  • 没有单一赢家:要速度和上下文选 Flash,要便宜编码选 Luna,Anthropic 生态里的文本选 Haiku,最便宜的批量活选 Flash-Lite。

Google 在 2026 年 7 月 21 日上线了 Gemini 3.6 Flash,大家马上要问的是:它跟你真会在生产里跑的那几个"又快又便宜的工作马"比,到底站哪。下面就价格、速度、编码、上下文做个诚实的同台,每类活给个明确的选择。

到底上线了什么?

Google 是一口气发了三个模型,不是一个。Gemini 3.6 Flash 是主角,是对 3.5 Flash 更快更便宜的更新。同来的还有 Gemini 3.5 Flash-Lite,一个价格触底、专攻高量活的档位,以及 Gemini 3.5 Flash Cyber,一个受限的安全专用模型,你没法直接在 API 里拿来用。对这场对比来说,Flash 和 Flash-Lite 才是重点,因为 Cyber 不对普通开发者开放。

Flash 要对打的那几个也没闲着。OpenAI 的 GPT-5.6 家族 7 月初就到了,自带三个档,它的预算档 Luna 是这里的直接对手。Anthropic 的 Claude Haiku 4.5 补齐了"又便宜又快"这一档。所以真正的较量是四方混战,比单纯一句"Google 新模型好不好"有意思多了。

Gemini 3.6 Flash vs GPT-5.6 Luna vs Claude Haiku 4.5:数字说话

下面是决定生产选型的那些规格的头对头。价格按每百万 token 算。

Gemini 3.6 FlashGPT-5.6 LunaClaude Haiku 4.5Gemini 3.5 Flash-Lite
输入价$1.50$1.00$1.00$0.30
输出价$7.50$6.00$5.00$2.50
上下文窗口1M1M200K1M
最大输出64K128K64K
速度(tokens/秒)~300100–150中等
原生多模态有限
知识截止2026 年 3 月较新20252026 年 3 月

规律一眼就看出来。Gemini 3.6 Flash 在这里不是最便宜的。Luna 和 Haiku 在输入和输出上都比它低,而 Flash-Lite 让这三个都显得贵。多花的钱给 Flash 换来的是速度和最宽的上下文,而这对有些活比对另一些活更重要。

按场景挑便宜又快的 LLM:Gemini 3.6 Flash 要速度和上下文,GPT-5.6 Luna 要便宜编码,Claude Haiku 4.5 要 Anthropic 文本,Gemini 3.5 Flash-Lite 要最便宜批量

到底哪个最便宜?

论纯挂牌价,Gemini 3.5 Flash-Lite 以 $0.30 输入、$2.50 输出遥遥领先。但在三个主力工作马里,GPT-5.6 Luna 和 Claude Haiku 4.5 都比 Gemini 3.6 Flash 便宜。Haiku 输出最便宜,$5;Luna 在 $6;Flash 是这仨里最贵的,$7.50。

输出价才是扎心的地方。为什么?因为大多数真实负载产生的输出 token 远多于输入 token,一个写长回复的聊天机器人或 agent,每一次调用都在吃 Flash 那 $7.50 的费率。所以如果你的活输出偏重、又不需要 Flash 的速度,Luna 或 Haiku 在规模上能省下真金白银。

还有一个细节。Luna 自带缓存输入读取 90% 的折扣,对 RAG 这类重复上下文负载能进一步压成本。如果你把同一段 system prompt 或文档集推上几千次,那个缓存折扣可能比挂牌价的差距更要紧。

上规模了各自要花多少?

挂牌价在你算总账前都很抽象。拿一个不算大的负载,每天 1M 输入加 1M 输出 token,月账单立刻拉开:

  • Gemini 3.6 Flash:约 $270 / 月
  • GPT-5.6 Luna:约 $210 / 月
  • Claude Haiku 4.5:约 $180 / 月
  • Gemini 3.5 Flash-Lite:约 $84 / 月

也就是说,同样的 token 量,Flash 比 Haiku 贵约 50%,比 Flash-Lite 贵三倍多。而大多数生产流量偏输出重,所以真实差距比这个对半分的例子还要大。Flash 的速度值不值比 Haiku 贵 50%?对一个用户盯着每个字冒出来的实时聊天 UI,常常值。对一个没人守着的通宵批处理,几乎不值。就"是不是延迟敏感"这一个问题,比价目表更能决定成本这笔账。

谁最快?

Gemini 3.6 Flash,大幅领先。它每秒吐大约 300 个 token,差不多是 GPT-5.6 Luna 那 100 到 150 的两倍。凡是用户要等的东西——实时聊天、自动补全、一个必须显得跟手的 agent——这个差距就是"利落"和"迟钝"的区别。

速度是 Flash 真正的卖点。Google 说 3.6 Flash 完成同样任务比 3.5 Flash 还少用 17% 的输出 token,多步工作流里也少走几步推理。更少的 token 配更高的单价,在有些活上仍可能净算下来更便宜,所以光看挂牌价,会低估它在延迟敏感、高吞吐场景里的价值。

1M 上下文这个差距要紧吗?

只有当你的负载真的填得满时才要紧。Gemini 3.6 Flash、Luna 和 Flash-Lite 都带 1M token 窗口,而 Claude Haiku 4.5 到 200K 就到头了。5 倍上下文是真优势吗?对大多数聊天和短任务,不算,因为你压根碰不到 200K。但你一旦把整个代码库、长 PDF、或几小时的转录喂进一次调用,情况就翻转了。那时候 Haiku 逼着你把输入切块、再把碎片拼回去,这会增加延迟和出错点,而那几个 1M 模型直接整口吞下。输入很大?那这个差距单凭它就能定选择,排在价格和速度前面。

各自在质量上赢在哪?

它们把赢面分掉了,所以没有干净的总冠军。每个都有一条明显领先的赛道:

  • 编码归 Luna。 GPT-5.6 Luna 在 SWE-Bench Pro、Terminal-Bench 这类生产编码 benchmark 上分数高于 Gemini 3.6 Flash,而且更便宜。预算有限的编码 agent,Luna 是性价比之选,Claude Haiku 4.5 在它 200K 窗口内的文本重编码上紧随其后。
  • 长上下文和多模态归 Gemini。 Flash 在长上下文检索和图表推理上赢的幅度,被 benchmark 形容为"根本不接近",而且它吃原生视频、音频、PDF。它的 1M 窗口把 Haiku 的 200K 甩开一大截。
  • 硬核知识工作在别处。 Flash 在深度推理上不敌 Claude Sonnet 5 这类更大的模型,所以如果最难任务上的质量比速度或价格更重要,这几个便宜档都不是你的答案。

Claude Haiku 4.5 在这里最尴尬。它体量之下编码很强,但 $1 / $5 的价格,如今在很多 benchmark 上落后于 Gemini 3.5 Flash-Lite 和更便宜的对手,却又比 Flash-Lite 贵。它最合理的场景,是你已经在 Anthropic 生态里、想要一个快的 Claude。

比 Gemini 3.5 Flash 变了什么?

如果你已经在用 3.5 Flash,升级很好说服自己。你拿到的是同样的 1M 上下文、更低的输出价、以及一个更聪明的模型。输出从每百万 $9 降到 $7.50,砍了 17%,而模型完成同样的活还少用 17% 的输出 token。在输出重的活上,这是双重省。

你还拿到一个终于从 2025 年 1 月推进到 2026 年 3 月的知识截止、给 agent 任务用的内置 Computer Use、以及更高效的工具调用。对大多数现有的 3.5 Flash 负载,换到 3.6 Flash 是更便宜也更好、还没什么真正的坏处。这种组合罕见到直接换就行。

那 Gemini 3.5 Flash Cyber 呢?

它是那个例外,而且你多半用不上。Gemini 3.5 Flash Cyber 是个受限的安全专用模型,为网络防御和威胁分析调过,它不像 Flash 和 Flash-Lite 那样是开放 Gemini API 的一部分。访问是设了门槛的。对绝大多数做普通应用的开发者来说,它压根不在选项里,这也是这篇对比只谈两个公开 Gemini 模型的原因。知道它存在就行,主要是免得你去找一个永远不会应你 key 的 API 端点。

你该用哪个?

没有唯一正确答案,而这正是整篇对比诚实的结论。按你手头这份活去配模型,而不是按谁最近上线:

  • 选 Gemini 3.6 Flash:延迟敏感的应用、长上下文或多模态活、需要速度的 agent。它最快,可用上下文也最宽。
  • 选 GPT-5.6 Luna:成本敏感的编码和高量任务,它的缓存折扣和编码优势在这里能回本。是这组里最便宜的能打编码手。
  • 选 Claude Haiku 4.5:你本就在 Anthropic 生态里、想要个快的 Claude 处理 200K 上下文内的文本和编码。
  • 选 Gemini 3.5 Flash-Lite:最高量、最简单的活,每 token 价格盖过一切。

多模型策略的麻烦在管道:三家供应商意味着三个账号、三套 SDK、三份计费。把它们全走一个 OpenAI 兼容端点(比如 Velokey)就省掉这些,你可以把编码调用发给 Luna、把又快又多模态的发给 Flash,用同一把 key。想深入,我们那篇 GPT-5.6 Sol vs Terra vs Luna 拆解 讲了 OpenAI 的分档,GLM vs GPT vs Claude 对比 画了前沿档的图,Claude Sonnet 5 是知识工作往上走一档的选择,而 Kimi K3 是另一个值得一看的便宜前沿选项。

常见问题

Gemini 3.6 Flash 比 GPT-5.6 便宜吗?

不是比每一档都便宜。Gemini 3.6 Flash 是 $1.50 输入 / $7.50 输出每百万 token,比 GPT-5.6 Luna($1 / $6)贵,但远低于 GPT-5.6 Terra($2.50 / $15)或 Sol($5 / $30)。单跟 Luna 比,Flash 是更贵但快得多的那个。

Gemini 3.6 Flash 比 Claude Haiku 4.5 好吗?

看活。Flash 有 5 倍的上下文(1M vs 200K)、更强的多模态、更高的速度。Haiku 4.5 输出更便宜、体量之下编码强。长上下文或多模态活 Flash 赢;Anthropic 生态内、较小上下文里的文本和编码,Haiku 站得住。

Gemini 3.6 Flash 和 3.5 Flash-Lite 有什么区别?

Flash 是更快、更能打的那个;Flash-Lite 是价格触底的那个。Flash 是 $1.50 / $7.50,在速度和推理上领先。Flash-Lite 是 $0.30 / $2.50,瞄准高量、较简单的活,每 token 成本最要紧的场景。两者都保留 1M 上下文窗口。

便宜模型里编码最好用哪个?

按当前 benchmark,是 GPT-5.6 Luna。它在 SWE-Bench Pro、Terminal-Bench 这类生产编码测试上分数高于 Gemini 3.6 Flash,还更便宜。Claude Haiku 4.5 在 200K 上下文内的文本重编码上是稳的第二。Gemini 3.6 Flash 在纯编码上不敌这两个。

我该从 Gemini 3.5 Flash 升到 3.6 Flash 吗?

大多数负载都该升。3.6 Flash 把输出价从 $9 砍到 $7.50、完成同样任务少用 17% 输出 token、把知识截止推到 2026 年 3 月、并加了内置 Computer Use。同样的 1M 上下文、更低成本、更好结果,几乎没理由留在 3.5。

在哪能用 Gemini 3.6 Flash?

它已经在 Gemini API 里上线,走 Google AI Studio 和 Android Studio,以及 Google Antigravity。如果你不想为一个多模型方案去周旋三个独立的供应商账号和 key,也可以通过一个 OpenAI 兼容网关同时够到它、GPT-5.6 和 Claude Haiku。

Gemini 3.6 Flash 支持工具调用和 Computer Use 吗?

支持。Gemini 3.6 Flash 自带原生工具调用和内置 Computer Use,开箱就能为 agent 工作流驱动浏览器和桌面操作。Google 还称它完成同样的多步任务比 3.5 Flash 用更少的工具调用和推理步数,这在 agent 类活上同时省了延迟和 token 成本。