Velokey

Qwen3.6 Flash

阿里巴巴Chatin 60 · out 60 Créditos / 1M tokens≈$60 / $60Disponible

Qwen3.6 Flash es el MoE disperso abierto de Alibaba Cloud (35B/3B activos), fuerte en programación agéntica y contexto de 262K. Accede a través del endpoint unificado de Velokey con precios por debajo de lista.

SWE-bench Verified 73.4%MoE disperso eficiente262K nativo (1M con YaRN)Razonamiento preservado entre agentes

Casos de uso

Programación con agentes y desarrollo multiarchivo · Automatización por terminal y herramientas

Entrada

Texto

Salida

Texto

Facturación

Por token

Tipo de modelo:
0.7
02
2048
2568192
qwen3.6-flash

Inicia una conversación

Escribe un mensaje abajo para comenzar

Regístrate y recibe $0.5 en créditos gratis — unas 20 imágenes gratis

Detalles de precio

Precios transparentes por uso, sin costes ocultos.

Precios detallados

Precios escalonados

Desglose de precios por uso

<= 256K tokensLongitud de contexto ≤ 256K
EspecificaciónPrecioOficialAhorro
Input/1M tokens0.2 Créditos≈$0.20.25 Créditos-20%
Output/1M tokens1.2 Créditos≈$1.21.5 Créditos-20%
Cache Read/1M tokens0.02 Créditos≈$0.020.025 Créditos-20%
Cache Write/1M tokens0.25 Créditos≈$0.250.3125 Créditos-20%
> 256K tokensLongitud de contexto > 256K
EspecificaciónPrecioOficialAhorro
Input/1M tokens0.8 Créditos≈$0.81 Créditos-20%
Output/1M tokens3.2 Créditos≈$3.24 Créditos-20%
Cache Read/1M tokens0.08 Créditos≈$0.080.1 Créditos-20%
Cache Write/1M tokens1 Créditos≈$11.25 Créditos-20%

Reglas de facturacion

  • El precio de salida varia por modelo, resolucion, calidad, duracion o uso de tokens.
  • Los archivos de referencia subidos pueden cobrarse por separado cuando el modelo los admite.
  • Capacidades adicionales como busqueda web o busqueda de imagenes pueden cobrarse por solicitud.
  • Los modelos basados en tokens se cobran por tokens de entrada y salida.
  • Si la ruta principal no esta disponible, Velokey puede cambiar automaticamente a una ruta estable de respaldo cuando sea posible.
  • El uso es de pago por consumo con deduccion transparente de creditos.

* El coste final depende del resultado generado.

API de Qwen3.6 Flash asequible

Accede a Qwen3.6 Flash de Alibaba Cloud en Velokey: MoE disperso eficiente, programación con agentes sobresaliente, contexto nativo de 262K y razonamiento preservado entre flujos, con un endpoint unificado y precios por debajo de lista para apps de producción.

Conoce Qwen3.6 Flash y su acceso por API

Qwen3.6 Flash (Qwen3.6-35B-A3B) es el modelo abierto de Alibaba Cloud lanzado el 14 de abril de 2026, con una arquitectura Mixture-of-Experts dispersa: 35B de parámetros totales y solo 3B activos. Combina atención lineal Gated DeltaNet con Gated Attention estándar y un MoE disperso (256 expertos, 8 enrutados + 1 compartido activo), superando a Qwen3.5-35B-A3B en programación con agentes por un amplio margen y rivalizando con modelos densos mucho mayores. Los pesos son abiertos bajo Apache 2.0 en Hugging Face y ModelScope, con un contexto nativo de 262K ampliable a 1M de tokens usando YaRN. Velokey ofrece una API de Qwen3.6 Flash asequible y fácil de integrar: un endpoint de chat unificado, un flujo claro y precios por debajo de lista para sistemas de producción, pipelines de agentes y herramientas de automatización.

Programación con agentes sobresaliente

Supera a Qwen3.5-35B-A3B en programación con agentes por un amplio margen y rivaliza con modelos densos mucho mayores: 73.4% SWE-bench Verified y 51.5% Terminal-Bench 2.0, apto para desarrollo con agentes multiarchivo.

Ver documentación
Programación con agentes sobresaliente

MoE disperso eficiente de 35B/3B

35B de parámetros totales con solo 3B activos, combinando atención lineal Gated DeltaNet con un MoE disperso de 256 expertos (8 enrutados + 1 compartido activo) para inferencia eficiente y de bajo coste sin perder calidad.

Ver documentación
MoE disperso eficiente de 35B/3B

Contexto largo nativo de 262K

Contexto nativo de 262K, ampliable a 1M de tokens con YaRN, apto para bases de código enteras, documentos muy largos y flujos de agente de largo horizonte.

Ver documentación
Contexto largo nativo de 262K

Razonamiento preservado entre flujos de agente

La preservación del modo thinking mantiene el contexto de razonamiento completo en flujos con agentes extensos, de modo que la cadena de razonamiento no se pierde entre varios pasos de herramientas, manteniéndose coherente y estable.

Ver documentación
Razonamiento preservado entre flujos de agente

Cómo desplegar la API de Qwen3.6 Flash en Velokey

Empieza en solo unos pasos.

1

Regístrate y obtén una API Key

Inicia sesión en la consola de Velokey para generar una API Key que autentica todas las solicitudes enviadas a Qwen3.6 Flash.

2

Configura los parámetros de la solicitud

Establece model en qwen-3-6-flash y envía messages. Activa YaRN para ampliar el contexto a 1M en entradas muy largas; activa el modo thinking para preservar el razonamiento completo en flujos con agentes largos.

3

Integra y empieza a llamar

Envía solicitudes al endpoint unificado /v1/chat/completions de Velokey para impulsar asistentes, agentes y automatización, con el uso gestionado en una sola consola.

Casos de uso reales de Qwen3.6 Flash

De la programación con agentes al razonamiento sobre documentos largos, cubriendo muchos escenarios de alta autonomía.

Programación con agentes y desarrollo multiarchivo

Con 73.4% en SWE-bench Verified y la eficiencia de la atención lineal, apto para desarrollo con agentes multiarchivo, refactorización y corrección de bugs.

Automatización por terminal y herramientas

51.5% en Terminal-Bench 2.0, apto para operaciones de terminal, llamada a herramientas y tareas de automatización de largo horizonte.

Razonamiento sobre repos y documentos largos

Contexto nativo de 262K (1M con YaRN), apto para recuperación, síntesis y preguntas en bases de código enteras y documentos largos.

Despliegue eficiente y de bajo coste

El MoE disperso 35B/3B activa solo 3B de parámetros, apto para despliegues a escala sensibles al coste y al rendimiento.

Flujos de agente de largo horizonte

La preservación del modo thinking mantiene el contexto de razonamiento completo, apto para orquestación de agentes de largo horizonte a través de muchos pasos de herramientas.

Autohospedaje de pesos abiertos y personalización

Pesos abiertos Apache 2.0 (Hugging Face / ModelScope), apto para autohospedaje, ajuste fino y personalización posterior.

Por qué elegir Velokey para Qwen3.6 Flash

Descuento sobre el precio de lista

Llama a Qwen3.6 Flash a un precio más bajo en Velokey: pago por uso sin suscripción obligatoria, reduciendo el coste inicial.

Interfaz de API unificada

Una sola API Key accede a Qwen3.6 Flash y a otros modelos, sin gestionar varias cuentas y claves, simplificando la integración.

Documentación completa y guía de migración

Referencias de endpoints, detalles de parámetros y ejemplos de migración te ayudan a integrar rápido y adoptar el contexto largo y el modo thinking.

Estable y de alta disponibilidad

La conmutación por error automática y las rutas de respaldo estables mantienen la disponibilidad cuando la ruta principal falla, manteniendo la producción fiable.

Referencia API

Ejemplos completos de llamada API y descripcion de parametros

Endpoint

https://api.velokey.ai/v1/chat/completions

Authentication

Bearer YOUR_API_KEY

Request Example

curl https://api.velokey.ai/v1/chat/completions \
  -X POST \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-flash",
    "messages": [{"role": "user", "content": "Hello!"}],
    "temperature": 0.7
  }'

Response Example

{
  "id": "req_abc123",
  "model": "qwen3.6-flash",
  "created": 1234567890,
  "data": { ... }
}

Preguntas frecuentes de la API de Qwen3.6 Flash

¿Qué es Qwen3.6 Flash?

Es el modelo abierto de Alibaba Cloud Qwen3.6-35B-A3B lanzado el 14 de abril de 2026 (servido en la API de Model Studio como qwen3.6-flash). Usa una arquitectura MoE dispersa con 35B totales y 3B activos, con pesos abiertos bajo Apache 2.0 en Hugging Face y ModelScope.

¿Qué tiene de especial su arquitectura?

Usa una arquitectura novedosa que combina atención lineal Gated DeltaNet con Gated Attention estándar y un MoE disperso (256 expertos, 8 enrutados + 1 compartido activo), logrando inferencia eficiente con solo 3B de parámetros activos sin perder calidad.

¿Qué tan grande es la ventana de contexto?

El contexto nativo es de 262K, ampliable a 1M de tokens con YaRN, apto para bases de código enteras, documentos muy largos y flujos de agente de largo horizonte.

¿Qué tan buena es su programación con agentes?

Supera a Qwen3.5-35B-A3B en programación con agentes por un amplio margen y rivaliza con modelos densos mucho mayores, con 73.4% en SWE-bench Verified y 51.5% en Terminal-Bench 2.0, preservando el contexto de razonamiento completo en flujos largos.

¿Cómo se factura en Velokey?

El área de precios de esta página muestra el precio actual de Velokey, facturado por tokens de entrada y salida con un descuento sobre el precio de lista y sin suscripción obligatoria.

Empieza a construir con Qwen3.6 Flash

Usa una sola API key para acceder a modelos de IA estables y de bajo coste mediante Velokey.