Gemini 3.6 Flash vs GPT-5.6 vs Claude Haiku (2026)
Gemini 3.6 Flash가 막 출시되었습니다. 가격, 속도, 코딩, 컨텍스트 측면에서 GPT-5.6 Luna와 Claude Haiku 4.5와 어떻게 비교되는지, 그리고 각 작업별 추천 모델을 살펴봅니다.

TL;DR
- 가장 빠름: Gemini 3.6 Flash, 비교가 안 됩니다. 초당 약 300 토큰으로, GPT-5.6 Luna의 100~150과 대비됩니다.
- 가장 저렴한 유능한 코딩 모델: GPT-5.6 Luna는 백만 토큰당 $1 / $6이며, 코딩 벤치마크에서 Flash보다 높은 점수를 냅니다.
- 가장 큰 컨텍스트와 멀티모달: Gemini 3.6 Flash, 네이티브 비디오, 오디오, PDF를 포함한 1M 토큰. Claude Haiku 4.5는 최대 200K입니다.
- 최저가: Gemini 3.5 Flash-Lite는 $0.30 / $2.50이며, 대량의 단순 작업을 위해 같은 날 출시된 형제 모델입니다.
- 단 하나의 승자는 없음: 속도와 컨텍스트는 Flash, 저렴한 코딩은 Luna, Anthropic 네이티브 텍스트는 Haiku, 가장 저렴한 대량 작업은 Flash-Lite.
Google은 2026년 7월 21일 Gemini 3.6 Flash를 출시했으며, 당연한 질문은 실제 프로덕션에서 돌릴 만한 다른 저렴하고 빠른 주력 모델들과 비교해 어떤 위치에 서느냐입니다. 가격, 속도, 코딩, 컨텍스트를 솔직하게 나란히 비교하고, 작업 유형별로 명확한 선택지를 제시합니다.
실제로 무엇이 출시되었나?
Google은 하나가 아니라 세 가지 모델을 한꺼번에 내놓았다. Gemini 3.6 Flash가 핵심으로, 3.5 Flash보다 더 빠르고 저렴해진 업데이트다. 이와 함께 대량 작업을 위한 최저가 티어인 Gemini 3.5 Flash-Lite와, API에서 그냥 선택해 쓸 수는 없는 제한된 보안 전문 모델인 Gemini 3.5 Flash Cyber도 나왔다. 이 비교에서는 Flash와 Flash-Lite 두 가지가 중요하다. Cyber는 일반적으로 이용할 수 없기 때문이다.
Flash가 경쟁하는 모델들도 가만히 있지 않았다. OpenAI의 GPT-5.6 제품군은 7월 초에 자체적으로 세 가지 티어와 함께 등장했고, 그중 예산형 티어인 Luna가 여기서 직접적인 경쟁 상대다. Anthropic의 Claude Haiku 4.5는 저렴하고 빠른 범주를 완성한다. 그래서 진짜 대결은 4자 구도이며, 단순히 "새 Google 모델이 좋은가"라는 이야기보다 훨씬 더 흥미롭다.
Gemini 3.6 Flash vs GPT-5.6 Luna vs Claude Haiku 4.5: 수치 비교
프로덕션 선택을 좌우하는 사양을 정면으로 비교하면 다음과 같습니다. 가격은 1백만 토큰당 기준입니다.
| Gemini 3.6 Flash | GPT-5.6 Luna | Claude Haiku 4.5 | Gemini 3.5 Flash-Lite | |
|---|---|---|---|---|
| 입력 가격 | $1.50 | $1.00 | $1.00 | $0.30 |
| 출력 가격 | $7.50 | $6.00 | $5.00 | $2.50 |
| 컨텍스트 창 | 1M | 1M | 200K | 1M |
| 최대 출력 | 64K | 128K | — | 64K |
| 속도(토큰/초) | ~300 | 100–150 | 중간 | 빠름 |
| 네이티브 멀티모달 | 예 | 예 | 제한적 | 예 |
| 지식 기준일 | March 2026 | 최근 | 2025 | March 2026 |
패턴은 금방 눈에 띕니다. Gemini 3.6 Flash는 여기서 가장 저렴한 선택지는 아닙니다. Luna와 Haiku는 입력과 출력 모두에서 더 낮은 가격을 제시하고, Flash-Lite는 이 세 모델 모두를 비싸 보이게 만듭니다. Flash에 추가 비용을 지불하고 얻는 것은 속도와 가장 넓은 컨텍스트이며, 이는 작업에 따라 중요도가 달라집니다.

실제로 가장 저렴한 것은 무엇일까요?
원시 표시 가격만 보면 Gemini 3.5 Flash-Lite가 입력 $0.30, 출력 $2.50로 압도적으로 이깁니다. 하지만 세 가지 주요 주력 모델 중에서는 GPT-5.6 Luna와 Claude Haiku 4.5가 둘 다 Gemini 3.6 Flash보다 저렴합니다. Haiku는 출력 비용이 $5로 가장 저렴하고, Luna는 $6이며, Flash는 $7.50로 이 셋 중 가장 비쌉니다.
출력 가격이 바로 부담이 되는 지점입니다. 왜일까요? 실제 워크로드 대부분은 입력보다 훨씬 더 많은 출력 토큰을 생성하며, 긴 응답을 작성하는 챗봇이나 에이전트는 매 호출마다 Flash의 $7.50 요율을 체감하게 됩니다. 따라서 작업이 출력 중심이고 Flash의 속도가 필요하지 않다면, Luna나 Haiku가 규모가 커질수록 실질적인 비용을 절감해 줍니다.
한 가지 변수가 더 있습니다. Luna는 캐시된 입력 읽기에 90% 할인을 제공하므로, RAG처럼 반복 컨텍스트가 많은 워크로드에서는 비용이 더 줄어듭니다. 동일한 시스템 프롬프트나 문서 세트를 수천 번 전송한다면, 이 캐시 할인은 표시 가격 차이보다 더 중요해질 수 있습니다.
대규모 사용 시 각각 비용은 얼마인가요?
표시 가격은 직접 계산해 보기 전까지는 추상적으로 느껴집니다. 하루에 1M 입력 토큰과 1M 출력 토큰을 처리하는 적당한 워크로드를 가정하면, 월별 청구액은 금세 차이가 벌어집니다:
- Gemini 3.6 Flash: 월 약 $270
- GPT-5.6 Luna: 월 약 $210
- Claude Haiku 4.5: 월 약 $180
- Gemini 3.5 Flash-Lite: 월 약 $84
이는 동일한 토큰 사용량에서 Flash가 Haiku보다 대략 50% 더 비싸고, Flash-Lite보다 3x 이상 비싸다는 뜻입니다. 그리고 대부분의 프로덕션 트래픽은 출력 비중이 더 높게 치우치기 때문에, 실제 격차는 이 균등 분할 예시가 보여주는 것보다 더 커집니다. Flash의 속도가 Haiku 대비 50% 프리미엄을 지불할 만큼 가치가 있을까요? 사용자가 각 토큰이 도착하는 것을 지켜보는 라이브 채팅 UI라면 대개 그렇습니다. 아무도 지켜보지 않는 야간 배치 작업이라면 거의 그렇지 않습니다. 지연 시간에 민감한지 아닌지라는 이 단 하나의 질문이 가격표보다 비용 논쟁의 더 많은 부분을 결정합니다.
누가 가장 빠른가?
Gemini 3.6 Flash가 큰 차이로 가장 빠릅니다. 초당 약 300 토큰을 스트리밍하며, GPT-5.6 Luna의 100~150 토큰보다 대략 두 배 빠릅니다. 사용자가 기다려야 하는 모든 경우, 즉 라이브 채팅이든, 자동완성이든, 반응성이 좋아야 하는 에이전트든, 이 격차는 경쾌함과 굼뜸을 가르는 차이입니다.
속도는 Flash의 진짜 강점입니다. Google은 3.6 Flash가 동일한 작업을 완료하는 데 3.5 Flash보다 출력 토큰을 17% 더 적게 사용하고, 다단계 워크플로에서 더 적은 추론 단계를 거친다고 말합니다. 더 높은 토큰당 처리 속도에서 더 적은 토큰을 사용하면 일부 작업에서는 결과적으로 더 저렴해질 수도 있으므로, 표시 가격만으로는 지연 시간에 민감하고 처리량이 높은 용도에서의 가치를 과소평가하게 됩니다.
1M 컨텍스트 격차가 중요할까요?
당신의 워크로드가 실제로 그것을 채울 때만 중요합니다. Gemini 3.6 Flash, Luna, Flash-Lite는 모두 1M-token 창을 갖고 있는 반면, Claude Haiku 4.5는 200K에서 멈춥니다. 5x 더 많은 컨텍스트가 실제 장점일까요? 대부분의 채팅과 짧은 작업에서는 사실 그렇지 않습니다. 애초에 200K에 근접할 일도 없을 것입니다. 하지만 전체 코드베이스, 긴 PDF, 또는 몇 시간 분량의 transcript를 단일 호출에 넣는 순간 상황은 달라집니다. 그런 경우 Haiku는 입력을 청크로 나누고 조각들을 다시 이어 붙이도록 강제하므로 지연 시간과 실패 지점이 늘어나는 반면, 1M 모델들은 그것을 통째로 삼켜 버립니다. 큰 입력인가요? 그렇다면 그 격차만으로도 가격이나 속도보다 앞서 선택을 결정할 수 있습니다.
각 모델은 품질 면에서 어디서 우위에 있나요?
승리는 나뉩니다. 그래서 깔끔한 종합 챔피언은 없습니다. 각자 명확히 앞서는 영역이 있습니다:
- 코딩은 Luna가 가져갑니다. GPT-5.6 Luna는 SWE-Bench Pro 및 Terminal-Bench 같은 프로덕션 코딩 벤치마크에서 Gemini 3.6 Flash보다 높은 점수를 내며, 더 저렴합니다. 예산이 제한된 코딩 에이전트라면 Luna가 가성비 선택이고, Claude Haiku 4.5는 200K 컨텍스트 창 안에서 텍스트 비중이 큰 코딩 작업에 근접한 대안입니다.
- 긴 컨텍스트와 멀티모달은 Gemini가 가져갑니다. Flash는 긴 컨텍스트 검색과 차트 기반 추론에서 벤치마크상 격차가 작지 않다고 평가될 만큼 앞서며, 네이티브 비디오, 오디오, PDF를 처리합니다. 1M 컨텍스트 창은 Haiku의 200K를 압도합니다.
- 고난도 지식 작업은 다른 쪽으로 기웁니다. Flash는 심층 추론에서 Claude Sonnet 5 같은 더 큰 모델에 밀리므로, 가장 어려운 작업에서의 품질이 속도나 가격보다 중요하다면, 이 저가 티어들 중 어느 것도 답이 아닙니다.
Claude Haiku 4.5는 여기서 애매한 위치에 있습니다. 크기 대비 코딩 성능은 강하지만, $1 / $5 가격에서는 이제 많은 벤치마크에서 Gemini 3.5 Flash-Lite와 더 저렴한 경쟁 모델에 뒤처지면서도 Flash-Lite보다 비용이 더 듭니다. 이미 Anthropic 생태계에 있고 빠른 Claude를 원할 때 가장 의미가 있습니다.
Gemini 3.5 Flash에서 무엇이 달라졌나요?
이미 3.5 Flash를 사용 중이라면 업그레이드는 쉽게 정당화할 수 있습니다. 동일한 1M 컨텍스트, 더 낮은 출력 가격, 더 똑똑한 모델을 얻을 수 있습니다. 출력 비용은 백만 개당 $9에서 $7.50로 내려가 17% 인하되었고, 동시에 모델은 같은 작업에 대해 출력 토큰을 17% 더 적게 사용합니다. 출력이 많은 작업에서는 이중 절감입니다.
또한 지식 기준일이 마침내 2025년 1월에서 2026년 3월로 이동했고, 에이전트 작업을 위한 내장 Computer Use와 더 나은 도구 호출 효율성도 제공됩니다. 대부분의 기존 3.5 Flash 워크로드에서는 3.6 Flash로 이전하는 것이 실질적인 단점 없이 더 저렴하고 더 좋습니다. 이런 조합은 드물기 때문에 그냥 진행해도 충분합니다.
그렇다면 Gemini 3.5 Flash Cyber는 어떤가요?
이 모델은 예외적인 경우이며, 아마 사용할 수 없을 것입니다. Gemini 3.5 Flash Cyber는 사이버 방어 및 위협 분석 작업에 맞춰 조정된 제한된 보안 전문 모델이며, Flash와 Flash-Lite처럼 공개 Gemini API의 일부가 아닙니다. 접근이 제한되어 있습니다. 일반 앱을 만드는 대다수 개발자에게는 애초에 선택지에 오르지 않기 때문에, 이 비교는 두 개의 공개 Gemini 모델에만 초점을 맞춥니다. 이런 모델이 존재한다는 점은 알아둘 만합니다. 주로, 아무리 찾아도 키에 응답하지 않을 API 엔드포인트를 찾아 헤매지 않기 위해서입니다.
무엇을 사용해야 할까요?
정답은 하나가 아니며, 이것이 전체 비교의 솔직한 결론입니다. 가장 최근에 출시된 모델이 아니라, 눈앞의 작업에 맞는 모델을 선택하세요:
- 지연 시간에 민감한 앱, 긴 컨텍스트 또는 멀티모달 작업, 속도가 필요한 에이전트에는 Gemini 3.6 Flash를 선택하세요. 가장 빠르며 사용 가능한 컨텍스트가 가장 넓습니다.
- 비용에 민감한 코딩과 대량 작업에는 GPT-5.6 Luna를 선택하세요. 캐시 할인과 코딩 강점이 효과를 발휘합니다. 이 그룹에서 가장 저렴한 유능한 코더입니다.
- Anthropic 네이티브 환경에서 200K 컨텍스트 안에서 텍스트와 코딩을 위한 빠른 Claude를 원한다면 Claude Haiku 4.5를 선택하세요.
- 토큰당 가격이 무엇보다 중요한, 가장 대량의 단순 작업에는 Gemini 3.5 Flash-Lite를 선택하세요.
멀티 모델 전략의 함정은 배관 작업입니다. 벤더가 3개면 계정도 3개, SDK도 3개, 과금 설정도 3개가 필요합니다. 이들을 Velokey 같은 하나의 OpenAI 호환 엔드포인트로 라우팅하면 이를 건너뛸 수 있어, 단일 키로 코딩 호출은 Luna에, 빠른 멀티모달 호출은 Flash에 보낼 수 있습니다. 더 깊이 살펴보려면, OpenAI의 티어를 다룬 GPT-5.6 Sol vs Terra vs Luna 분석, 프런티어 티어를 매핑한 GLM vs GPT vs Claude 비교, 지식 작업을 위한 상위 단계인 Claude Sonnet 5, 그리고 살펴볼 만한 또 다른 저렴한 프런티어 옵션인 Kimi K3를 참고하세요.
자주 묻는 질문
Gemini 3.6 Flash는 GPT-5.6보다 저렴한가요?
모든 티어보다 저렴한 것은 아닙니다. Gemini 3.6 Flash는 백만 토큰당 $1.50 입력 / $7.50 출력으로, GPT-5.6 Luna($1 / $6)보다는 비싸지만 GPT-5.6 Terra($2.50 / $15)나 Sol($5 / $30)보다는 훨씬 저렴합니다. Luna와만 비교하면, Flash는 더 비싸지만 훨씬 빠른 옵션입니다.
Gemini 3.6 Flash는 Claude Haiku 4.5보다 더 나은가요?
작업에 따라 다릅니다. Flash는 컨텍스트가 5x 더 크고(1M vs 200K), 멀티모달 성능이 더 강하며, 속도도 더 빠릅니다. Haiku 4.5는 출력 비용이 더 저렴하고, 크기 대비 코딩 성능이 강합니다. 긴 컨텍스트나 멀티모달 작업에서는 Flash가 우세하고, 더 작은 컨텍스트에서 Anthropic 네이티브 텍스트 및 코딩에는 Haiku도 경쟁력이 있습니다.
Gemini 3.6 Flash와 3.5 Flash-Lite의 차이는 무엇인가요?
Flash는 더 빠르고 더 유능한 모델이고, Flash-Lite는 최저가 모델입니다. Flash는 $1.50 / $7.50이며 속도와 추론에서 앞섭니다. Flash-Lite는 $0.30 / $2.50이며 토큰당 비용이 가장 중요한 대량의 단순 작업을 대상으로 합니다. 둘 다 1M 컨텍스트 창을 유지합니다.
코딩에 가장 적합한 저가 모델은 무엇인가요?
현재 벤치마크 기준으로는 GPT-5.6 Luna입니다. SWE-Bench Pro 및 Terminal-Bench 같은 프로덕션 코딩 테스트에서 Gemini 3.6 Flash보다 높은 점수를 내면서 비용은 더 낮습니다. Claude Haiku 4.5는 200K 컨텍스트 내에서 텍스트 중심 코딩에 강력한 2순위입니다. Gemini 3.6 Flash는 순수 코딩에서는 둘 모두보다 뒤처집니다.
Gemini 3.5 Flash에서 3.6 Flash로 업그레이드해야 하나요?
대부분의 워크로드에서는 그렇습니다. 3.6 Flash는 출력 가격을 $9에서 $7.50로 낮추고, 동일 작업에 대해 출력 토큰을 17% 더 적게 사용하며, 지식 컷오프를 March 2026로 이동하고, 내장 Computer Use를 추가합니다. 동일한 1M 컨텍스트에 더 낮은 비용, 더 나은 결과를 제공하므로 3.5에 머물 이유는 거의 없습니다.
Gemini 3.6 Flash는 어디에서 사용할 수 있나요?
Google AI Studio 및 Android Studio를 통해 Gemini API에서 실시간으로 사용할 수 있으며, Google Antigravity에서도 사용할 수 있습니다. 멀티 모델 설정을 위해 3개의 별도 제공업체 계정과 키를 관리하고 싶지 않다면, 단일 OpenAI 호환 게이트웨이를 통해 Gemini 3.6 Flash, GPT-5.6, Claude Haiku에도 접근할 수 있습니다.
Gemini 3.6 Flash는 도구 사용과 Computer Use를 지원하나요?
예. Gemini 3.6 Flash는 네이티브 도구 호출과 내장 Computer Use를 탑재해 제공되므로, 에이전트 워크플로에서 브라우저 및 데스크톱 동작을 즉시 수행할 수 있습니다. Google은 또한 동일한 다단계 작업을 완료하는 데 3.5 Flash보다 더 적은 도구 호출과 추론 단계를 사용한다고 보고하며, 이는 에이전트형 작업에서 지연 시간과 토큰 비용을 모두 줄여줍니다.


