Velokey
모델 인사이트

Kimi K3 API: 1M 컨텍스트가 모델 라우팅을 바꾸는 이유

Kimi K3는 2.8T 파라미터, 1M 컨텍스트, 희소 MoE, API 액세스를 결합합니다. 가격, 캐싱, 라우팅, 배포의 트레이드오프를 정리합니다.

Kimi K3 API: 1M 컨텍스트가 모델 라우팅을 바꾸는 이유

Kimi K3는 헤드라인을 위해 준비된 듯한 두 개의 숫자와 함께 등장했습니다. 2.8조 파라미터와 100만 토큰 컨텍스트 윈도우입니다.

프로덕션 팀에게 더 유용한 숫자는 10입니다.

Moonshot의 공식 Kimi K3 API에서 캐시 미스 입력 토큰은 캐시 히트 입력 토큰보다 10배 비쌉니다. 더 중대한 요구사항은 숫자가 아닙니다. 멀티턴 및 도구 호출 애플리케이션은 추론과 도구 상태를 포함한 완전한 어시스턴트 메시지를 보존해야 합니다.

이 때문에 Kimi K3는 단순한 새 모델 ID 이상입니다. 컨텍스트 레이아웃, 캐시 안정성, 세션 지속성, 작업 경계 라우팅이 프로덕션 아키텍처의 일부가 됩니다.

TL;DR

  • Moonshot은 Kimi K3를 네이티브 비전과 1,048,576 토큰 컨텍스트 윈도우를 갖춘 2.8T 파라미터의 오픈 3T급 모델로 설명합니다.
  • 확인 시점에 K3는 이미 Kimi 제품과 Moonshot API를 통해 사용 가능했지만, 전체 가중치는 2026년 7월 27일까지 공개될 예정이었습니다.
  • 이 모델은 896개 전문가 중 16개를 활성화하므로, 총 파라미터 수가 토큰당 활성 연산량과 같지 않습니다.
  • 공식 API 가격은 캐시 히트 입력 1M 토큰당 $0.30, 캐시 미스 입력 1M 토큰당 $3.00, 출력 1M 토큰당 $15.00입니다.
  • K3는 현재 항상 max 수준으로 추론하며, 멀티턴 및 도구 호출 루프에서 완전한 어시스턴트 메시지를 보존해야 합니다.
  • Moonshot은 thinking 히스토리가 누락되거나 진행 중인 세션을 K3로 전환하면 품질이 불안정해질 수 있다고 경고합니다.
  • 이 글을 확인한 시점에 K3는 Velokey 라이브 카탈로그에 등록되어 있지 않았습니다. 모델 ID를 추측하지 말고 먼저 실제 가용성을 확인하세요.

Kimi K3 상태: 확정, 대기, 미제공

주요 모델 출시를 둘러싼 자료들은 서로 다른 여러 상태를 '출시됨'이라는 한 단어로 뭉뚱그리는 경향이 있습니다.

Kimi K3의 경우 이 상태들을 구분해서 봐야 합니다.

항목2026년 7월 17일 기준 상태
Kimi 앱 및 제품사용 가능
공식 Moonshot API 모델 kimi-k3사용 가능
전체 모델 가중치2026년 7월 27일까지 공개 예정
최종 오픈 웨이트 라이선스검토한 출시 자료에서 아직 확인되지 않음
Kimi K3 전체 기술 보고서대기 중
Velokey를 통한 Kimi K3확인 시점에 미등록

Moonshot의 Kimi K3 출시 페이지는 이를 3T급 최초의 오픈 모델이라고 부릅니다. 이는 제공사의 표현입니다. 현재 실질적인 구분점은, 개발자는 이미 Moonshot API로 K3를 호출할 수 있지만 로컬 배포를 계획하는 팀에는 여전히 실제 가중치, 라이선스, 모델 카드, 기술 보고서가 필요하다는 점입니다.

이 글이 7월 27일 이후에 업데이트된다면 가중치 공개 상태를 다시 확인해야 합니다. 공개 계획과 다운로드 가능하고 라이선스가 확정된 산출물은 같은 것이 아닙니다.

2.8T 파라미터가 실제로 의미하는 것

Kimi K3는 Kimi Delta Attention, Attention Residuals, Stable LatentMoE 아키텍처를 결합합니다. Moonshot에 따르면 이 모델은 요청당 896개 전문가 중 16개를 활성화합니다.

이는 파라미터 헤드라인을 읽는 방식을 바꿉니다.

Kimi K3 핵심 사양: 총 2.8조 파라미터, 896개 전문가 중 16개 실효 활성화, 1,048,576 토큰 컨텍스트 윈도우, 네이티브 비전.

*Moonshot은 총 2.8T 파라미터, 896개 전문가 중 16개 실효 활성화, 1,048,576 토큰 컨텍스트 윈도우, 네이티브 비전을 보고합니다.*

총 2.8T라는 파라미터 수는 모델의 전체 용량을 설명합니다. 모든 토큰에 모든 파라미터가 활성화된다는 뜻이 아닙니다. 희소 전문가 활성화는 초대형 모델이 매 스텝마다 밀집(dense) 모델의 전체 연산 비용을 치르지 않고도 더 큰 용량을 제공할 수 있게 하는 메커니즘입니다.

Moonshot은 또한 Kimi K2 대비 약 2.5배의 전체 스케일링 효율을 보고합니다. 이는 독립적인 프로덕션 측정이 아니라 제공사가 보고한 아키텍처 결과이지만, 실제 엔지니어링 목표가 무엇인지 보여줍니다. 단순히 크게 만드는 것이 아니라, 초대형 모델을 장기 호라이즌 작업에 쓸 수 있게 만드는 것입니다.

K3는 네이티브 시각 이해도 포함하며 코딩, 지식 작업, 추론, 이미지, 비디오를 겨냥해 포지셔닝되어 있습니다. 이러한 역량은 가능한 API 워크로드의 범위를 넓히지만, 어떤 워크로드가 경제적일지는 알려주지 않습니다.

그 답은 컨텍스트, 출력, 지연 시간, 도구 동작에서 나옵니다.

1M 토큰 윈도우가 컨텍스트 엔지니어링을 없애지 못하는 이유

Kimi 공식 가격 페이지는 컨텍스트 윈도우를 1,048,576 토큰으로 명시합니다.

큰 용량입니다. 하지만 모든 요청을 가득 채우라는 지시가 아닙니다.

장시간 실행되는 코딩 또는 리서치 에이전트에는 다음이 누적될 수 있습니다:

  • 시스템 지시사항
  • 권한 및 안전 규칙
  • 도구 정의
  • 저장소 파일과 문서
  • 검색된 근거 자료
  • 사용자 메시지
  • 어시스턴트 추론
  • 도구 호출과 도구 결과
  • 재시도, 수정, 폐기된 브랜치

컨텍스트에는 다 들어가더라도 작업은 여전히 느려지고, 비싸지고, 제어하기 어려워질 수 있습니다.

롱 컨텍스트는 핵심 질문을 "다 들어갈까?"에서 "무엇을 라이브로 유지할 가치가 있는가?"로 바꿉니다.

프로덕션 세션은 네 개의 계층을 분리해야 합니다:

  1. 안정적인 프리픽스: 지속적인 지시사항, 고정 지식, 자주 재사용되는 도구 정의.
  2. 작업 워킹 셋: 현재 목표에 필요한 파일, 근거 자료, 이미지, 도구.
  3. 완전한 세션 상태: 추론과 도구 연속성을 보존하는 데 필요한 메시지.
  4. 재시작 가능한 체크포인트: 실패한 브랜치를 영원히 끌고 가지 않고도 작업을 복구할 수 있게 하는 검증된 요약.
Kimi K3를 위한 4계층 컨텍스트 아키텍처: 안정적인 프리픽스, 작업 워킹 셋, 완전한 세션 상태, 재시작 가능한 체크포인트.

*롱 컨텍스트는 안정적인 지시사항, 활성 워킹 셋, 전체 세션 상태, 재시작 체크포인트를 분리해서 관리할 때 운영상 유용해집니다.*

100만 토큰 윈도우는 팀에게 더 넓은 공간을 줍니다. 검색(retrieval), 압축, 체크포인팅, 토큰 예산을 대체하지는 않습니다.

Kimi K3 가격이 프롬프트 아키텍처를 바꾸는 방식

Moonshot의 공식 K3 가격은 다음과 같습니다:

  • 캐시 히트 입력: 1M 토큰당 $0.30
  • 캐시 미스 입력: 1M 토큰당 $3.00
  • 출력: 1M 토큰당 $15.00

가격은 해당 세금을 제외한 금액이며 변경될 수 있습니다. 도입 전에 공식 페이지의 최신 정보를 확인하세요.

기본 비용 모델은 다음과 같습니다:

input cost = cache-hit MTok x $0.30 + cache-miss MTok x $3.00
output cost = output MTok x $15.00
Kimi K3 공식 API 가격 비교: 캐시 히트 입력 100만 토큰당 $0.30, 캐시 미스 입력 100만 토큰당 $3.00, 출력 100만 토큰당 $15.00.

*2026년 7월 17일에 확인한 가격은 캐시 히트와 캐시 미스 입력 요금 간 10배 격차를 보여주며, 프리픽스 안정성을 비용 통제 메커니즘으로 만듭니다. 이는 Velokey 가격이 아닌 공식 Kimi API 요금이며, 가격은 변경될 수 있습니다.*

10배에 달하는 입력 가격 격차는 프롬프트 구조를 비용 아키텍처의 일부로 만듭니다.

Kimi의 컨텍스트 캐싱은 자동입니다. 수동으로 관리할 캐시 ID나 TTL이 없습니다. API는 시스템 프롬프트, 지식 문서, 도구 정의처럼 반복되는 초기 컨텍스트를 재사용하려고 시도합니다.

자동이라고 해서 보장된다는 뜻은 아닙니다.

애플리케이션이 매 호출마다 프롬프트 시작 부분을 바꾸거나, 도구 순서를 재배열하거나, 프리픽스에 타임스탬프를 삽입하거나, 같은 지식을 다른 순서로 직렬화하면 재사용 가능한 컨텍스트가 캐시 미스로 바뀔 수 있습니다.

Moonshot은 공식 API가 코딩 워크로드에서 90% 이상의 캐시 히트율을 달성했다고 말합니다. 이는 제공사가 보고한 결과로 받아들여야 하며, 다른 애플리케이션에 대한 약속이 아닙니다. 프로덕션 팀이 신뢰해야 할 숫자는 자체 트래픽에서 측정한 값입니다.

최소한 다음을 추적하세요:

  • 캐시 히트 입력 토큰
  • 캐시 미스 입력 토큰
  • 추론 및 최종 답변 출력 토큰
  • 첫 토큰까지의 시간
  • 총 응답 지연 시간
  • 도구 호출 횟수
  • 재시도율
  • 완료된 작업당 비용

에이전트에는 요청 단위 가격만으로는 부족합니다. 사용자 목표 하나가 수십 번의 모델 호출, 도구 호출, 재시도, 검증 단계를 촉발할 수 있습니다.

보존된 thinking이 모델 라우팅을 바꾸는 이유

Kimi K3는 항상 추론합니다. API는 현재 reasoning_effort="max"만 지원하며, 응답에는 최종 content 외에 reasoning_content가 포함될 수 있습니다.

멀티턴 대화와 도구 호출의 경우, Kimi 문서는 완전한 어시스턴트 메시지를 다음 요청에 추가해야 한다고 명시합니다. 개발자는 눈에 보이는 답변만 보관해서는 안 됩니다. 반환된 메시지에는 연속성에 필요한 추론 및 도구 호출 필드도 포함될 수 있습니다.

이는 비용과 라우팅 모두에 영향을 미칩니다.

과거의 추론은 계속 컨텍스트 윈도우를 차지하며 토큰 소비에 기여합니다. 따라서 긴 에이전트 세션은 사용자 메시지와 문서 이상의 것들로 커집니다.

이는 또한 모델 선택이 안전하게 무상태(stateless)일 수 없다는 뜻이기도 합니다.

Moonshot은 하니스가 완전한 thinking 히스토리를 반환하지 못하거나 다른 모델로 진행 중이던 세션을 K3로 전환하면 K3 품질이 매우 불안정해질 수 있다고 경고합니다.

더 안전한 프로덕션 규칙은 간단합니다:

> 작업 또는 세션 경계에서 라우팅하고, 의도적인 체크포인트까지 선택한 모델을 고정하세요.

모델이나 제공사가 작업 도중에 실패하면 검증된 사실, 완료된 액션, 현재 파일, 미결 사항, 남은 목표를 담은 재시작 패키지를 만드세요. 같은 도구 루프 안에서 모델 ID를 조용히 바꾸는 대신, 그 명시적인 상태에서 대체 모델을 시작하세요.

작업 분류와 모델 선택에서 세션 고정, 안정적인 컨텍스트, 완전한 상태 보존, 도구 루프, 텔레메트리, 체크포인트 기반 모델 변경으로 이어지는 세션 인지 모델 라우팅.

*작업 경계에서 모델을 선택하고, 도구 루프 동안 고정하며, 의도적인 체크포인트 이후 또는 새 세션에서만 모델을 변경하세요. 이는 공식 Kimi 라우팅 아키텍처가 아니라 프로덕션 권장 사항입니다.*

이것이 요청 라우팅과 세션 라우팅의 차이입니다.

멀티 모델 스택에서 Kimi K3의 자리

K3의 최대 추론 모드는 첫날부터 워크로드 분리를 중요하게 만듭니다.

워크로드Kimi K3 적합성프로덕션 판단
저장소 규모 코딩강력한 후보안정적인 하니스를 사용하고, 상태를 보존하고, 도구 성공률을 측정하세요.
복잡한 멀티 도구 리서치강력한 후보재시도, 근거 품질, 컨텍스트 증가를 모니터링하세요.
시각적 엔지니어링 작업후보실제 이미지, 비디오, UI, CAD, 디버깅 워크플로로 테스트하세요.
고부가가치 지식 종합후보답변의 가치가 긴 추론과 출력 비용을 정당화할 때 사용하세요.
분류 및 태깅기본값으로는 약함더 저렴한 모델이 대개 더 효율적입니다.
추출 및 단순 재작성기본값으로는 약함최대 추론은 대개 불필요한 오버헤드입니다.
저지연 채팅불확실첫 토큰까지의 시간과 총 지연 시간을 벤치마크하세요.
자율적인 프로덕션 액션조건부좁은 권한, 샌드박스, 승인 게이트, 로그를 추가하세요.

Moonshot은 과도한 능동성을 현재의 한계로 명시합니다. 긴 작업이 모호함이나 사소한 장애물을 만나면 K3가 예상치 못한 결정을 내릴 수 있습니다.

이 때문에 권한 설계는 프롬프트 설계만큼 중요합니다:

  • 읽기 권한과 쓰기 권한을 분리하세요
  • API 키와 프로덕션 자격 증명은 서버 사이드에 보관하세요
  • 파괴적이거나 외부로 향하는 액션에는 승인을 요구하세요
  • 명시적인 중지 조건을 정의하세요
  • 요청된 모든 도구 액션과 결과를 로깅하세요
  • 성공적인 실행뿐 아니라 복구 동작도 평가하세요

가장 유능한 모델이 자동으로 가장 넓은 권한을 받아서는 안 됩니다.

Kimi K3 API vs 자체 호스팅

예정된 오픈 웨이트 공개는 로컬 배포를 논의 대상으로 만듭니다. 그렇다고 로컬 배포가 자동으로 승자가 되는 것은 아닙니다.

Moonshot에 따르면 K3는 MXFP4 가중치와 MXFP8 활성화를 사용하는 양자화 인지 학습을 적용했습니다. 배포에는 64개 이상의 가속기를 갖춘 슈퍼노드 구성을 권장합니다.

이는 공표된 최소 요구 사양이 아니라 권장 사항이지만, 풀스케일 K3 서빙이 클러스터 수준의 인프라 프로젝트임을 보여주기에는 충분합니다.

다음과 같은 경우 관리형 API 액세스가 현실적인 첫 경로입니다:

  • 트래픽이 초기 단계이거나 변동이 클 때
  • 인프라를 구매하기 전에 품질을 검증하고 싶을 때
  • 배포 속도가 중요할 때
  • 대규모 분산 추론 스택을 운영할 수 없을 때
  • 제품이 K3를 다른 여러 모델과 비교해야 할 때

다음과 같은 경우 자체 호스팅이 더 현실성을 갖습니다:

  • 최종 라이선스가 의도한 용도를 허용할 때
  • 데이터 주권 요구사항으로 로컬 통제가 필요할 때
  • 전용 용량을 정당화할 만큼 부하가 지속적일 때
  • 조직이 이미 대형 모델 인프라를 운영하고 있을 때
  • 팀이 활용률, 배칭, 캐싱, 업그레이드, 장애 복구를 관리할 수 있을 때

오픈 웨이트가 하드웨어, 네트워킹, 유휴 용량, 관측 가능성, 엔지니어링 시간을 공짜로 만들어 주지는 않습니다.

가장 안전한 순서는 API 평가가 먼저, 인프라 투자가 그다음입니다.

Kimi K3 에이전트를 위한 프로덕션 체크리스트

K3에 프로덕션 트래픽을 보내기 전에 다음 질문에 답하세요.

워크로드 적합성

  • 작업에 장기 호라이즌 추론, 대용량 컨텍스트, 비전, 복잡한 도구가 필요한가?
  • 결과가 최대 추론과 출력 토큰 비용을 정당화할 만큼 가치 있는가?
  • 1차 분류, 추출, 재작성은 더 저렴한 모델이 처리할 수 있는가?

세션 설계

  • 작업이 지속되는 동안 모델이 고정되어 있는가?
  • 완전한 어시스턴트 메시지가 저장되고 재전송되는가?
  • 실패 후 워크플로가 체크포인트에서 재시작할 수 있는가?
  • 도구 정의는 필요할 때만 로드되는가?

비용과 지연 시간

  • 입력 토큰 중 캐시 히트 비율은 몇 퍼센트인가?
  • 추론 히스토리는 얼마나 빨리 증가하는가?
  • 첫 토큰까지의 시간과 총 작업 소요 시간은 어떠한가?
  • 재시도와 실패한 도구 호출에서 발생하는 지출은 얼마인가?
  • 요청당 비용뿐 아니라 승인된 결과당 비용은 얼마인가?

안전과 운영

  • 어떤 액션에 사람의 승인이 필요한가?
  • 자격 증명은 서버에만 저장되는가?
  • 파괴적인 액션은 기본적으로 차단되는가?
  • 도구 호출, 오류, 토큰 사용량, 지연 시간, 지출을 관측할 수 있는가?

평가

  • K3가 실제 워크로드에서 강력한 기준 모델을 능가하는가?
  • 비용을 정당화할 만큼 더 저렴한 기준 모델을 충분히 능가하는가?
  • 작업을 다른 모델에서 재시작하면 어떻게 되는가?
  • 모델에 사람의 수정이 얼마나 자주 필요한가?

평가 결과는 단일 벤치마크 점수가 아니라 품질-비용-지연 시간의 프론티어여야 합니다.

모델 ID를 지어내지 않고 OpenAI 호환 클라이언트를 준비하는 방법

이 글을 확인한 시점에 Kimi K3는 Velokey 라이브 카탈로그에 없었습니다. 가용성은 바뀔 수 있으므로 통합 코드를 작성하기 전에 라이브 모델 카탈로그를 확인하고 models 엔드포인트를 조회하세요.

블로그 글을 보고 모델 ID를 추측하지 마세요.

다음 예제는 Velokey 계정에서 현재 사용 가능한 모델 ID를 나열합니다. K3가 존재한다고 가정하지 않습니다.

import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["VELOKEY_API_KEY"],
    base_url="https://api.velokey.ai/v1",
)

for model in client.models.list().data:
    print(model.id)

API 키는 서버 사이드 환경 변수에 보관하세요. Kimi K3 모델 ID가 GET /v1/models에 나타나지 않는다면, 해당 계정에서는 아직 Velokey를 통해 사용할 수 없는 것입니다. 등록되지 않은 ID를 하드코딩하는 대신, 사용 가능이 확인된 모델이나 공식 Kimi API를 계속 사용하세요.

새 모델이 사용 가능해지면 OpenAI 호환 클라이언트가 마이그레이션 작업을 줄여 줍니다. 그래도 애플리케이션에는 모델별 평가, 세션 규칙, 텔레메트리가 여전히 필요합니다. 인터페이스 호환성이 동작의 차이를 지워 주지는 않습니다.

Kimi K3에 비용을 쓸 가치가 있는 경우

Kimi K3는 사람이 하기에는 비용이 크고, 쪼개기 어렵고, 긴 추론 흔적을 정당화할 만큼 가치 있는 작업에서 가장 매력적입니다. 대규모 리팩터링, 멀티 도구 리서치 작업, 멀티모달 엔지니어링 워크플로, 지속적인 종합이 필요한 복잡한 문서 세트 같은 경우입니다.

범용 기본값으로서는 매력이 떨어집니다. 분류, 추출, 태깅, 단순 재작성, 일상적인 지원 업무는 멀티 모델 스택이 예산을 지켜야 하는 영역입니다.

프로덕션 결정은 2.8T라는 숫자 하나에서 나와서는 안 됩니다. 캐시 히트율, 완료된 작업당 비용, 세션 안정성, 도구 성공률, 지연 시간, 복구 동작, 사람의 수정 빈도에서 나와야 합니다.

이것이 Kimi K3 API의 진짜 이야기입니다. 모델은 크지만, 유용한지 여부는 그것을 둘러싼 세션 아키텍처가 결정합니다.

Kimi K3 API 자주 묻는 질문

Kimi K3는 지금 완전한 오픈 소스인가요?

2026년 7월 17일 기준, Moonshot은 전체 모델 가중치를 7월 27일까지 공개하겠다고 밝혔습니다. K3는 이미 Kimi 제품과 공식 API를 통해 사용 가능했습니다. 이후 글에서 다운로드 가능하다고 서술하기 전에 저장소, 라이선스, 모델 카드, 기술 보고서를 확인하세요.

Kimi K3 컨텍스트 윈도우는 얼마인가요?

Moonshot은 1,048,576 토큰으로 명시합니다. 큰 윈도우는 용량을 늘리지만 검색, 캐싱, 히스토리 제어, 체크포인트의 필요성을 없애 주지는 않습니다.

공식 Kimi K3 API 가격은 얼마인가요?

Moonshot은 캐시 히트 입력 1M 토큰당 $0.30, 캐시 미스 입력 1M 토큰당 $3.00, 출력 1M 토큰당 $15.00로 명시하며, 해당 세금은 제외한 금액입니다.

Kimi K3는 모든 토큰에 2.8T 파라미터를 전부 사용하나요?

아니요. Moonshot에 따르면 Stable LatentMoE 아키텍처는 896개 전문가 중 16개를 활성화합니다. 총 파라미터 수는 용량을 설명하고, 희소 활성화는 활성 연산량을 제한합니다.

Kimi K3 세션 도중에 모델을 바꿀 수 있나요?

신중하게 하세요. Moonshot은 불완전한 thinking 히스토리, 또는 다른 모델로 진행 중이던 세션을 K3로 전환하는 것이 생성을 불안정하게 만들 수 있다고 경고합니다. 세션 경계에서 라우팅하거나 검증된 체크포인트에서 재시작하세요.

Kimi K3는 Velokey에서 사용할 수 있나요?

2026년 7월 17일에 이 글을 확인한 시점에는 등록되어 있지 않았습니다. 현재 계정 수준의 가용성은 라이브 모델 카탈로그와 GET /v1/models로 확인하세요. 정적인 블로그 주장에 의존하지 마세요.

출처


공개: 이 글은 Velokey가 발행하며, Velokey는 여러 제공사의 모델에 대한 OpenAI 호환 API 액세스 레이어를 제공합니다. 검토 시점에 Kimi K3는 Velokey 라이브 카탈로그에 등록되어 있지 않았습니다.

ID를 지어내지 않고 현재와 미래의 모델 옵션에 대비한 하나의 클라이언트를 준비하고 싶으신가요? [Velokey 퀵스타트](https://docs.velokey.ai/quickstart)를 따라 한 뒤, GET /v1/models가 반환하는 모델만 선택하세요.