Velokey

Qwen3.6 Flash

阿里巴巴Чатвход 60 · выход 60 кредитов / 1M токенов≈$60 / $60Доступно

Qwen3.6 Flash — открытая модель Alibaba Cloud с разреженной MoE-архитектурой (35B всего / 3B активных параметров), превосходная в агентном программировании, с контекстом 262K. Получите доступ через единый endpoint Velokey по цене ниже прайс-листа.

SWE-bench Verified 73.4%Эффективная разреженная MoEНативный 262K (1M с YaRN)Мышление сохраняется между агентами

Сценарии использования

Агентное программирование и многофайловая разработка · Терминальная и инструментальная автоматизация

Ввод

Текст

Вывод

Текст

Тарификация

За токены

Тип модели:
0.7
02
2048
2568192
qwen3.6-flash

Начать разговор

Введите сообщение ниже, чтобы начать

Зарегистрируйтесь и получите $0.5 бесплатных кредитов — около 20 бесплатных изображений

Детали цены

Прозрачные цены по факту использования, без скрытых платежей.

Подробные цены

Ступенчатые цены

Детализация цен по использованию

<= 256K tokensДлина контекста ≤ 256K
СпецификацияЦенаОфициальнаяЭкономия
Input/1M tokens0.2 кредитов≈$0.20.25 кредитов-20%
Output/1M tokens1.2 кредитов≈$1.21.5 кредитов-20%
Cache Read/1M tokens0.02 кредитов≈$0.020.025 кредитов-20%
Cache Write/1M tokens0.25 кредитов≈$0.250.3125 кредитов-20%
> 256K tokensДлина контекста > 256K
СпецификацияЦенаОфициальнаяЭкономия
Input/1M tokens0.8 кредитов≈$0.81 кредитов-20%
Output/1M tokens3.2 кредитов≈$3.24 кредитов-20%
Cache Read/1M tokens0.08 кредитов≈$0.080.1 кредитов-20%
Cache Write/1M tokens1 кредитов≈$11.25 кредитов-20%

Правила тарификации

  • Цена вывода зависит от модели, разрешения, качества, длительности или расхода токенов.
  • Загруженные референс-файлы могут тарифицироваться отдельно, если модель их поддерживает.
  • Дополнительные возможности, такие как веб-поиск или поиск по изображениям, могут тарифицироваться за запрос.
  • Токеновые модели тарифицируются по входным и выходным токенам.
  • Если основной маршрут недоступен, Velokey может автоматически переключиться на стабильный резервный маршрут, когда это возможно.
  • Оплата по мере использования с прозрачным списанием кредитов.

* Итоговая стоимость зависит от сгенерированного результата.

Доступный Qwen3.6 Flash API

Получите доступ к Qwen3.6 Flash от Alibaba Cloud на Velokey — эффективная разреженная MoE, выдающееся агентное программирование, нативный контекст 262K и сохранение мышления между потоками, с единым endpoint и ценой ниже прайс-листа для production-приложений.

Знакомство с Qwen3.6 Flash и доступом к ее API

Qwen3.6 Flash (Qwen3.6-35B-A3B) — открытая модель Alibaba Cloud, выпущенная 14 апреля 2026 года, использующая разреженную архитектуру Mixture-of-Experts: 35B параметров всего и только 3B активных. Она сочетает линейное внимание Gated DeltaNet со стандартным Gated Attention и разреженной MoE (256 экспертов, 8 маршрутизируемых + 1 общий активный), значительно превосходя Qwen3.5-35B-A3B в агентном программировании и конкурируя с гораздо более крупными плотными моделями. Веса открыты под Apache 2.0 на Hugging Face и ModelScope, с нативным контекстом 262K, расширяемым до 1M токенов с помощью YaRN. Velokey предоставляет доступный и простой для интеграции Qwen3.6 Flash API: единый chat endpoint, понятный поток запросов и цены ниже прайс-листа для production-систем, агентных конвейеров и инструментов автоматизации.

Выдающееся агентное программирование

Значительно превосходит Qwen3.5-35B-A3B в агентном программировании и конкурирует с гораздо более крупными плотными моделями — 73.4% SWE-bench Verified и 51.5% Terminal-Bench 2.0 — подходит для многофайловой агентной разработки.

Посмотреть документацию
Выдающееся агентное программирование

Эффективная разреженная MoE 35B/3B

35B параметров всего и только 3B активных, сочетая линейное внимание Gated DeltaNet с разреженной MoE с 256 экспертами (8 маршрутизируемых + 1 общий активный) для эффективного и недорогого инференса при сохранении качества.

Посмотреть документацию
Эффективная разреженная MoE 35B/3B

Нативный длинный контекст 262K

Нативный контекст 262K, расширяемый до 1M токенов с YaRN — подходит для целых кодовых баз, очень длинных документов и долгосрочных агентных рабочих процессов.

Посмотреть документацию
Нативный длинный контекст 262K

Мышление сохраняется в агентных потоках

Сохранение в режиме мышления поддерживает полный контекст рассуждений в расширенных агентных рабочих процессах, поэтому цепочка рассуждений не теряется между несколькими шагами с инструментами, оставаясь связной и стабильной.

Посмотреть документацию
Мышление сохраняется в агентных потоках

Как развернуть Qwen3.6 Flash API на Velokey

Начните всего за несколько шагов.

1

Зарегистрируйтесь и получите API-ключ

Войдите в консоль Velokey, чтобы сгенерировать API-ключ, который аутентифицирует каждый запрос, отправленный в Qwen3.6 Flash.

2

Настройте параметры запроса

Установите model в qwen-3-6-flash и отправьте messages. Включите YaRN, чтобы расширить контекст до 1M для очень длинных входных данных; включите режим мышления, чтобы сохранять полное рассуждение в длинных агентных потоках.

3

Интегрируйте и начните вызывать

Отправляйте запросы на единый endpoint Velokey /v1/chat/completions для работы ассистентов, агентов и автоматизации, с управлением использованием в одной консоли.

Реальные сценарии использования Qwen3.6 Flash

От агентного программирования до рассуждений по длинным документам, охватывая множество сценариев с высокой автономностью.

Агентное программирование и многофайловая разработка

С 73.4% SWE-bench Verified и эффективностью линейного внимания подходит для многофайловой агентной разработки, рефакторинга и исправления ошибок.

Терминальная и инструментальная автоматизация

51.5% на Terminal-Bench 2.0 — подходит для операций в терминале, вызова инструментов и долгосрочных задач автоматизации.

Рассуждение по всему репозиторию и длинным документам

Нативный контекст 262K (1M с YaRN) — подходит для поиска, синтеза и QA по целым кодовым базам и длинным документам.

Эффективное и недорогое развертывание

Разреженная MoE 35B/3B активирует только 3B параметров — подходит для развертываний в масштабе, чувствительных к стоимости и пропускной способности.

Долгосрочные агентные рабочие процессы

Сохранение в режиме мышления удерживает полный контекст рассуждений — подходит для долгосрочной агентной оркестрации через множество шагов с инструментами.

Самостоятельный хостинг и кастомизация открытых весов

Открытые веса Apache 2.0 (Hugging Face / ModelScope) — подходят для самостоятельного хостинга, дообучения и последующей кастомизации.

Почему стоит выбрать Velokey для Qwen3.6 Flash

Скидка от прайс-листа

Вызывайте Qwen3.6 Flash по более низкой цене на Velokey — pay-as-you-go без обязательной подписки, снижая первоначальные расходы.

Единый интерфейс API

Один API-ключ дает доступ к Qwen3.6 Flash и другим моделям — не нужно управлять несколькими аккаунтами и ключами, что упрощает интеграцию.

Полная документация и руководство по миграции

Справочники по endpoint, детали параметров и примеры миграции помогают быстро интегрироваться и использовать длинный контекст и режим мышления.

Стабильность и высокая доступность

Автоматическое переключение при сбоях и стабильные резервные маршруты поддерживают доступность, когда основной маршрут недоступен, сохраняя надежность production.

Справочник API

Полные примеры вызовов API и описание параметров

Endpoint

https://api.velokey.ai/v1/chat/completions

Authentication

Bearer YOUR_API_KEY

Request Example

curl https://api.velokey.ai/v1/chat/completions \
  -X POST \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-flash",
    "messages": [{"role": "user", "content": "Hello!"}],
    "temperature": 0.7
  }'

Response Example

{
  "id": "req_abc123",
  "model": "qwen3.6-flash",
  "created": 1234567890,
  "data": { ... }
}

FAQ по Qwen3.6 Flash API

Что такое Qwen3.6 Flash?

Это открытая модель Alibaba Cloud Qwen3.6-35B-A3B, выпущенная 14 апреля 2026 года (предоставляется через Model Studio API как qwen3.6-flash). Она использует разреженную MoE-архитектуру с 35B параметров всего и 3B активных параметров, а веса открыты под Apache 2.0 на Hugging Face и ModelScope.

Что особенного в ее архитектуре?

Она использует новую архитектуру, сочетающую линейное внимание Gated DeltaNet со стандартным Gated Attention и разреженной MoE (256 экспертов, 8 маршрутизируемых + 1 общий активный), достигая эффективного инференса всего на 3B активных параметров при сохранении качества.

Насколько велико контекстное окно?

Нативный контекст составляет 262K и расширяется до 1M токенов с YaRN — подходит для целых кодовых баз, очень длинных документов и долгосрочных агентных рабочих процессов.

Насколько она хороша в агентном программировании?

Она значительно превосходит Qwen3.5-35B-A3B в агентном программировании и конкурирует с гораздо более крупными плотными моделями, набирая 73.4% на SWE-bench Verified и 51.5% на Terminal-Bench 2.0, при этом сохраняя полный контекст мышления в длинных потоках.

Как она тарифицируется на Velokey?

Раздел цен на этой странице показывает текущую цену Velokey, тарифицируемую по входным и выходным токенам, со скидкой от прайс-листа и без обязательной подписки.

Начните работать с Qwen3.6 Flash уже сегодня

Один API-ключ — доступ к недорогим и стабильным ИИ-моделям через Velokey.