Velokey

Qwen3.6 Flash

阿里巴巴채팅입력 60 · 출력 60 크레딧 / 1M tokens≈$60 / $60사용 가능

Qwen3.6 Flash는 262K 컨텍스트를 제공하며 에이전트형 코딩에 뛰어난 Alibaba Cloud의 오픈 가중치 희소 MoE(총 35B / 활성 3B)입니다. 정가보다 낮은 가격으로 Velokey의 통합 엔드포인트를 통해 이용하세요.

SWE-bench Verified 73.4%효율적인 희소 MoE네이티브 262K (YaRN 사용 시 1M)에이전트 전반에서 사고 과정 보존

활용 사례

에이전트형 코딩 및 다중 파일 개발 · 터미널 및 도구 기반 자동화

입력

텍스트

출력

텍스트

청구 방식

토큰당 과금

모델 유형:
0.7
02
2048
2568192
qwen3.6-flash

대화 시작하기

아래에 메시지를 입력해 시작하세요

가입하면 $0.5 무료 크레딧 — 이미지 약 20장을 무료로 생성

요금 상세

사용량 기반의 투명한 가격 정책으로 숨은 비용이 없습니다.

요금 상세

구간별 요금

사용량 기반 요금 내역

<= 256K tokens컨텍스트 길이 ≤ 256K
사양가격공식 가격절감
Input/1M tokens0.2 크레딧≈$0.20.25 크레딧-20%
Output/1M tokens1.2 크레딧≈$1.21.5 크레딧-20%
Cache Read/1M tokens0.02 크레딧≈$0.020.025 크레딧-20%
Cache Write/1M tokens0.25 크레딧≈$0.250.3125 크레딧-20%
> 256K tokens컨텍스트 길이 > 256K
사양가격공식 가격절감
Input/1M tokens0.8 크레딧≈$0.81 크레딧-20%
Output/1M tokens3.2 크레딧≈$3.24 크레딧-20%
Cache Read/1M tokens0.08 크레딧≈$0.080.1 크레딧-20%
Cache Write/1M tokens1 크레딧≈$11.25 크레딧-20%

청구 규칙

  • 출력 가격은 모델, 해상도, 품질, 길이 또는 토큰 사용량에 따라 달라집니다.
  • 업로드한 참조 파일은 지원되는 경우 별도로 과금될 수 있습니다.
  • 웹 검색, 이미지 검색 등 부가 기능은 요청당 과금될 수 있습니다.
  • 토큰 기반 모델은 입력 및 출력 토큰 기준으로 과금됩니다.
  • 기본 경로를 사용할 수 없는 경우 Velokey가 가능한 범위에서 안정적인 대체 경로로 자동 전환할 수 있습니다.
  • 사용량 기반 결제이며 크레딧이 투명하게 차감됩니다.

* 최종 비용은 생성된 결과에 따라 달라집니다.

합리적인 가격의 Qwen3.6 Flash API

Velokey에서 Alibaba Cloud의 Qwen3.6 Flash를 이용하세요 — 효율적인 희소 MoE, 탁월한 에이전트형 코딩, 네이티브 262K 컨텍스트, 흐름 전반의 사고 과정 보존을 제공하며, 프로덕션 앱을 위한 통합 엔드포인트와 정가보다 낮은 가격을 제공합니다.

Qwen3.6 Flash 및 API 액세스 소개

Qwen3.6 Flash(Qwen3.6-35B-A3B)는 2026년 4월 14일에 출시된 Alibaba Cloud의 오픈 모델로, 희소 Mixture-of-Experts 아키텍처를 사용합니다. 총 35B 파라미터 중 3B만 활성화됩니다. Gated DeltaNet 선형 어텐션과 표준 Gated Attention, 희소 MoE(256 전문가, 8 라우팅 + 1 공유 활성)를 결합하여 에이전트형 코딩에서 Qwen3.5-35B-A3B를 큰 차이로 능가하고 훨씬 더 큰 dense 모델에 필적합니다. 가중치는 Hugging Face와 ModelScope에서 Apache 2.0에 따라 공개되어 있으며, 네이티브 262K 컨텍스트는 YaRN을 사용해 1M 토큰까지 확장할 수 있습니다. Velokey는 합리적인 가격으로 쉽게 통합할 수 있는 Qwen3.6 Flash API를 제공합니다. 통합 채팅 엔드포인트, 명확한 요청 흐름, 프로덕션 시스템, 에이전트 파이프라인, 자동화 도구를 위한 정가보다 낮은 가격을 제공합니다.

탁월한 에이전트형 코딩

에이전트형 코딩에서 Qwen3.5-35B-A3B를 큰 차이로 능가하고 훨씬 더 큰 dense 모델에 필적합니다 — SWE-bench Verified 73.4% 및 Terminal-Bench 2.0 51.5% — 다중 파일 에이전트형 개발에 적합합니다.

문서 보기
탁월한 에이전트형 코딩

효율적인 35B/3B 희소 MoE

총 35B 파라미터 중 3B만 활성화되며, Gated DeltaNet 선형 어텐션과 256-전문가 희소 MoE(8 라우팅 + 1 공유 활성)를 결합하여 품질을 유지하면서 효율적이고 저비용의 추론을 제공합니다.

문서 보기
효율적인 35B/3B 희소 MoE

네이티브 262K 긴 컨텍스트

네이티브 262K 컨텍스트를 제공하며 YaRN으로 1M 토큰까지 확장할 수 있습니다 — 전체 코드베이스, 매우 긴 문서, 장기 에이전트형 워크플로에 적합합니다.

문서 보기
네이티브 262K 긴 컨텍스트

에이전트 흐름 전반에서 사고 과정 보존

Thinking-mode 보존은 확장된 에이전트형 워크플로 전반에서 전체 추론 컨텍스트를 유지하므로, 여러 도구 단계 사이에서도 추론 체인이 끊기지 않고 일관성과 안정성을 유지합니다.

문서 보기
에이전트 흐름 전반에서 사고 과정 보존

Velokey에서 Qwen3.6 Flash API를 배포하는 방법

몇 가지 단계만으로 시작하세요.

1

가입하고 API 키 받기

Velokey 콘솔에 로그인하여 Qwen3.6 Flash로 전송되는 모든 요청을 인증하는 API 키를 생성하세요.

2

요청 파라미터 구성

모델을 qwen-3-6-flash로 설정하고 메시지를 제출하세요. 매우 긴 입력의 경우 YaRN을 활성화해 컨텍스트를 1M까지 확장하고, 긴 에이전트형 흐름 전반에서 전체 추론을 보존하려면 thinking mode를 켜세요.

3

통합하고 호출 시작

Velokey의 통합 /v1/chat/completions 엔드포인트로 요청을 보내 어시스턴트, 에이전트, 자동화를 구동하고, 사용량을 하나의 콘솔에서 관리하세요.

Qwen3.6 Flash의 실제 사용 사례

에이전트형 코딩부터 긴 문서 추론까지, 다양한 고자율 시나리오를 포괄합니다.

에이전트형 코딩 및 다중 파일 개발

SWE-bench Verified 73.4%와 선형 어텐션 효율성을 바탕으로, 다중 파일 에이전트형 개발, 리팩터링, 버그 수정에 적합합니다.

터미널 및 도구 기반 자동화

Terminal-Bench 2.0에서 51.5% — 터미널 작업, 도구 호출, 장기 자동화 작업에 적합합니다.

전체 저장소 및 긴 문서 추론

네이티브 262K(YaRN 사용 시 1M) 컨텍스트 — 전체 코드베이스와 긴 문서 전반의 검색, 종합, QA에 적합합니다.

효율적이고 저비용의 배포

35B/3B 희소 MoE는 3B 파라미터만 활성화합니다 — 대규모의 비용 및 처리량 민감 배포에 적합합니다.

장기 에이전트 워크플로

Thinking-mode 보존은 전체 추론 컨텍스트를 유지합니다 — 여러 도구 단계에 걸친 장기 에이전트 오케스트레이션에 적합합니다.

오픈 가중치 셀프 호스팅 및 커스터마이징

Apache 2.0 오픈 가중치(Hugging Face / ModelScope) — 셀프 호스팅, 파인튜닝, 다운스트림 커스터마이징에 적합합니다.

Qwen3.6 Flash에 Velokey를 선택해야 하는 이유

정가 대비 할인

Velokey에서 더 낮은 가격으로 Qwen3.6 Flash를 호출하세요 — 강제 구독 없이 사용한 만큼 지불하여 초기 비용을 줄입니다.

통합 API 인터페이스

하나의 API 키로 Qwen3.6 Flash와 다른 모델에 액세스할 수 있습니다 — 여러 계정과 키를 번갈아 관리할 필요가 없어 통합이 간소화됩니다.

완전한 문서와 마이그레이션 가이드

엔드포인트 참조, 파라미터 세부 정보, 마이그레이션 예제가 빠른 통합과 긴 컨텍스트 및 thinking mode 도입을 돕습니다.

안정적이고 높은 가용성

자동 장애 조치와 안정적인 폴백 경로가 기본 경로가 중단될 때도 가용성을 유지하여 프로덕션의 신뢰성을 보장합니다.

API 레퍼런스

완전한 API 호출 예시와 파라미터 설명

Endpoint

https://api.velokey.ai/v1/chat/completions

Authentication

Bearer YOUR_API_KEY

Request Example

curl https://api.velokey.ai/v1/chat/completions \
  -X POST \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-flash",
    "messages": [{"role": "user", "content": "Hello!"}],
    "temperature": 0.7
  }'

Response Example

{
  "id": "req_abc123",
  "model": "qwen3.6-flash",
  "created": 1234567890,
  "data": { ... }
}

Qwen3.6 Flash API FAQ

Qwen3.6 Flash란 무엇인가요?

2026년 4월 14일에 출시된 Alibaba Cloud의 오픈 모델 Qwen3.6-35B-A3B입니다(Model Studio API를 통해 qwen3.6-flash로 제공). 총 35B 및 활성 3B 파라미터를 갖춘 희소 MoE 아키텍처를 사용하며, 가중치는 Hugging Face와 ModelScope에서 Apache 2.0에 따라 공개되어 있습니다.

아키텍처의 특별한 점은 무엇인가요?

Gated DeltaNet 선형 어텐션과 표준 Gated Attention, 희소 MoE(256 전문가, 8 라우팅 + 1 공유 활성)를 결합한 새로운 아키텍처를 사용하여, 품질을 유지하면서도 활성 파라미터 3B만으로 효율적인 추론을 달성합니다.

컨텍스트 창은 얼마나 큰가요?

네이티브 컨텍스트는 262K이며 YaRN으로 1M 토큰까지 확장할 수 있습니다 — 전체 코드베이스, 매우 긴 문서, 장기 에이전트형 워크플로에 적합합니다.

에이전트형 코딩 성능은 얼마나 좋은가요?

에이전트형 코딩에서 Qwen3.5-35B-A3B를 큰 차이로 능가하고 훨씬 더 큰 dense 모델에 필적하며, SWE-bench Verified에서 73.4%, Terminal-Bench 2.0에서 51.5%를 기록합니다. 또한 긴 흐름 전반에서 전체 사고 컨텍스트를 보존합니다.

Velokey에서는 어떻게 과금되나요?

이 페이지의 가격 영역에는 현재 Velokey 가격이 표시되며, 입력 및 출력 토큰 기준으로 과금되고 정가 대비 할인이 적용되며 강제 구독은 없습니다.

Qwen3.6 Flash 지금 시작하기

하나의 API 키로 Velokey를 통해 저렴하고 안정적인 AI 모델을 이용하세요.