Qwen3.6 Flash
Qwen3.6 Flash es el MoE disperso abierto de Alibaba Cloud (35B/3B activos), fuerte en programación agéntica y contexto de 262K. Accede a través del endpoint unificado de Velokey con precios por debajo de lista.
Casos de uso
Programación con agentes y desarrollo multiarchivo · Automatización por terminal y herramientas
Entrada
Texto
Salida
Texto
Facturación
Por token
Inicia una conversación
Escribe un mensaje abajo para comenzar
Regístrate y recibe $0.5 en créditos gratis — unas 20 imágenes gratis
Detalles de precio
Precios transparentes por uso, sin costes ocultos.
Precios detallados
Precios escalonadosDesglose de precios por uso
| Especificación | Precio | Oficial | Ahorro |
|---|---|---|---|
| Input/1M tokens | 0.2 Créditos≈$0.2 | 0.25 Créditos | -20% |
| Output/1M tokens | 1.2 Créditos≈$1.2 | 1.5 Créditos | -20% |
| Cache Read/1M tokens | 0.02 Créditos≈$0.02 | 0.025 Créditos | -20% |
| Cache Write/1M tokens | 0.25 Créditos≈$0.25 | 0.3125 Créditos | -20% |
| Especificación | Precio | Oficial | Ahorro |
|---|---|---|---|
| Input/1M tokens | 0.8 Créditos≈$0.8 | 1 Créditos | -20% |
| Output/1M tokens | 3.2 Créditos≈$3.2 | 4 Créditos | -20% |
| Cache Read/1M tokens | 0.08 Créditos≈$0.08 | 0.1 Créditos | -20% |
| Cache Write/1M tokens | 1 Créditos≈$1 | 1.25 Créditos | -20% |
Reglas de facturacion
- El precio de salida varia por modelo, resolucion, calidad, duracion o uso de tokens.
- Los archivos de referencia subidos pueden cobrarse por separado cuando el modelo los admite.
- Capacidades adicionales como busqueda web o busqueda de imagenes pueden cobrarse por solicitud.
- Los modelos basados en tokens se cobran por tokens de entrada y salida.
- Si la ruta principal no esta disponible, Velokey puede cambiar automaticamente a una ruta estable de respaldo cuando sea posible.
- El uso es de pago por consumo con deduccion transparente de creditos.
* El coste final depende del resultado generado.
Modelos relacionados
Explora otros modelos de la misma familia.
- AlibabaAhorra 20%
Qwen3.6 Plus
Alibaba's Qwen3.6 Plus, a balanced flagship-tier model with strong reasoning, long context, multimodal input, and agentic tool use.
- AlibabaAhorra 20%
Qwen3.7 Plus
Qwen3.7-Plus is Alibaba's multimodal agent model with screen perception and GUI grounding, a 1M-token context, preserve_thinking, and low-cost pricing.
- AlibabaAhorra 20%
Qwen3.7 Max
Qwen3.7-Max is Alibaba's flagship agent model for long-horizon coding and MCP tool orchestration, sustaining hours-long autonomous runs over a 1M-token context.
- OpenAIAhorra 20%
GPT 5.4 Mini
OpenAI's fast, cost-efficient GPT-5.4 Mini for high-volume production, with vision, long context, and strong tool use at low latency.
API de Qwen3.6 Flash asequible
Accede a Qwen3.6 Flash de Alibaba Cloud en Velokey: MoE disperso eficiente, programación con agentes sobresaliente, contexto nativo de 262K y razonamiento preservado entre flujos, con un endpoint unificado y precios por debajo de lista para apps de producción.
Conoce Qwen3.6 Flash y su acceso por API
Qwen3.6 Flash (Qwen3.6-35B-A3B) es el modelo abierto de Alibaba Cloud lanzado el 14 de abril de 2026, con una arquitectura Mixture-of-Experts dispersa: 35B de parámetros totales y solo 3B activos. Combina atención lineal Gated DeltaNet con Gated Attention estándar y un MoE disperso (256 expertos, 8 enrutados + 1 compartido activo), superando a Qwen3.5-35B-A3B en programación con agentes por un amplio margen y rivalizando con modelos densos mucho mayores. Los pesos son abiertos bajo Apache 2.0 en Hugging Face y ModelScope, con un contexto nativo de 262K ampliable a 1M de tokens usando YaRN. Velokey ofrece una API de Qwen3.6 Flash asequible y fácil de integrar: un endpoint de chat unificado, un flujo claro y precios por debajo de lista para sistemas de producción, pipelines de agentes y herramientas de automatización.
Programación con agentes sobresaliente
Supera a Qwen3.5-35B-A3B en programación con agentes por un amplio margen y rivaliza con modelos densos mucho mayores: 73.4% SWE-bench Verified y 51.5% Terminal-Bench 2.0, apto para desarrollo con agentes multiarchivo.
Ver documentación →
MoE disperso eficiente de 35B/3B
35B de parámetros totales con solo 3B activos, combinando atención lineal Gated DeltaNet con un MoE disperso de 256 expertos (8 enrutados + 1 compartido activo) para inferencia eficiente y de bajo coste sin perder calidad.
Ver documentación →
Contexto largo nativo de 262K
Contexto nativo de 262K, ampliable a 1M de tokens con YaRN, apto para bases de código enteras, documentos muy largos y flujos de agente de largo horizonte.
Ver documentación →
Razonamiento preservado entre flujos de agente
La preservación del modo thinking mantiene el contexto de razonamiento completo en flujos con agentes extensos, de modo que la cadena de razonamiento no se pierde entre varios pasos de herramientas, manteniéndose coherente y estable.
Ver documentación →
Cómo desplegar la API de Qwen3.6 Flash en Velokey
Empieza en solo unos pasos.
Regístrate y obtén una API Key
Inicia sesión en la consola de Velokey para generar una API Key que autentica todas las solicitudes enviadas a Qwen3.6 Flash.
Configura los parámetros de la solicitud
Establece model en qwen-3-6-flash y envía messages. Activa YaRN para ampliar el contexto a 1M en entradas muy largas; activa el modo thinking para preservar el razonamiento completo en flujos con agentes largos.
Integra y empieza a llamar
Envía solicitudes al endpoint unificado /v1/chat/completions de Velokey para impulsar asistentes, agentes y automatización, con el uso gestionado en una sola consola.
Casos de uso reales de Qwen3.6 Flash
De la programación con agentes al razonamiento sobre documentos largos, cubriendo muchos escenarios de alta autonomía.
Programación con agentes y desarrollo multiarchivo
Con 73.4% en SWE-bench Verified y la eficiencia de la atención lineal, apto para desarrollo con agentes multiarchivo, refactorización y corrección de bugs.
Automatización por terminal y herramientas
51.5% en Terminal-Bench 2.0, apto para operaciones de terminal, llamada a herramientas y tareas de automatización de largo horizonte.
Razonamiento sobre repos y documentos largos
Contexto nativo de 262K (1M con YaRN), apto para recuperación, síntesis y preguntas en bases de código enteras y documentos largos.
Despliegue eficiente y de bajo coste
El MoE disperso 35B/3B activa solo 3B de parámetros, apto para despliegues a escala sensibles al coste y al rendimiento.
Flujos de agente de largo horizonte
La preservación del modo thinking mantiene el contexto de razonamiento completo, apto para orquestación de agentes de largo horizonte a través de muchos pasos de herramientas.
Autohospedaje de pesos abiertos y personalización
Pesos abiertos Apache 2.0 (Hugging Face / ModelScope), apto para autohospedaje, ajuste fino y personalización posterior.
Por qué elegir Velokey para Qwen3.6 Flash
Descuento sobre el precio de lista
Llama a Qwen3.6 Flash a un precio más bajo en Velokey: pago por uso sin suscripción obligatoria, reduciendo el coste inicial.
Interfaz de API unificada
Una sola API Key accede a Qwen3.6 Flash y a otros modelos, sin gestionar varias cuentas y claves, simplificando la integración.
Documentación completa y guía de migración
Referencias de endpoints, detalles de parámetros y ejemplos de migración te ayudan a integrar rápido y adoptar el contexto largo y el modo thinking.
Estable y de alta disponibilidad
La conmutación por error automática y las rutas de respaldo estables mantienen la disponibilidad cuando la ruta principal falla, manteniendo la producción fiable.
Referencia API
Ejemplos completos de llamada API y descripcion de parametros
Endpoint
https://api.velokey.ai/v1/chat/completionsAuthentication
Bearer YOUR_API_KEYRequest Example
curl https://api.velokey.ai/v1/chat/completions \
-X POST \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-flash",
"messages": [{"role": "user", "content": "Hello!"}],
"temperature": 0.7
}'Response Example
{
"id": "req_abc123",
"model": "qwen3.6-flash",
"created": 1234567890,
"data": { ... }
}Preguntas frecuentes de la API de Qwen3.6 Flash
¿Qué es Qwen3.6 Flash?
Es el modelo abierto de Alibaba Cloud Qwen3.6-35B-A3B lanzado el 14 de abril de 2026 (servido en la API de Model Studio como qwen3.6-flash). Usa una arquitectura MoE dispersa con 35B totales y 3B activos, con pesos abiertos bajo Apache 2.0 en Hugging Face y ModelScope.
¿Qué tiene de especial su arquitectura?
Usa una arquitectura novedosa que combina atención lineal Gated DeltaNet con Gated Attention estándar y un MoE disperso (256 expertos, 8 enrutados + 1 compartido activo), logrando inferencia eficiente con solo 3B de parámetros activos sin perder calidad.
¿Qué tan grande es la ventana de contexto?
El contexto nativo es de 262K, ampliable a 1M de tokens con YaRN, apto para bases de código enteras, documentos muy largos y flujos de agente de largo horizonte.
¿Qué tan buena es su programación con agentes?
Supera a Qwen3.5-35B-A3B en programación con agentes por un amplio margen y rivaliza con modelos densos mucho mayores, con 73.4% en SWE-bench Verified y 51.5% en Terminal-Bench 2.0, preservando el contexto de razonamiento completo en flujos largos.
¿Cómo se factura en Velokey?
El área de precios de esta página muestra el precio actual de Velokey, facturado por tokens de entrada y salida con un descuento sobre el precio de lista y sin suscripción obligatoria.
Empieza a construir con Qwen3.6 Flash
Usa una sola API key para acceder a modelos de IA estables y de bajo coste mediante Velokey.