Qwen3.6 Flash
Qwen3.6 Flash est le modèle MoE clairsemé à poids ouverts d'Alibaba Cloud (35B au total / 3B actifs) qui excelle dans le codage agentique, avec un contexte de 262K. Accédez-y via le point de terminaison unifié de Velokey avec des tarifs inférieurs au prix catalogue.
Cas d'usage
Codage agentique et développement multi-fichiers · Automatisation pilotée par terminal et outils
Entrée
Texte
Sortie
Texte
Facturation
Par token
Démarrer une conversation
Saisissez un message ci-dessous pour commencer
Inscrivez-vous et recevez $0.5 de crédits gratuits — environ 20 images gratuites
Détails des tarifs
Tarification transparente à l'usage, sans frais cachés.
Tarifs détaillés
Tarification par paliersDétail des tarifs à l'usage
| Spécification | Prix | Officiel | Économie |
|---|---|---|---|
| Input/1M tokens | 0.2 crédits≈$0.2 | 0.25 crédits | -20% |
| Output/1M tokens | 1.2 crédits≈$1.2 | 1.5 crédits | -20% |
| Cache Read/1M tokens | 0.02 crédits≈$0.02 | 0.025 crédits | -20% |
| Cache Write/1M tokens | 0.25 crédits≈$0.25 | 0.3125 crédits | -20% |
| Spécification | Prix | Officiel | Économie |
|---|---|---|---|
| Input/1M tokens | 0.8 crédits≈$0.8 | 1 crédits | -20% |
| Output/1M tokens | 3.2 crédits≈$3.2 | 4 crédits | -20% |
| Cache Read/1M tokens | 0.08 crédits≈$0.08 | 0.1 crédits | -20% |
| Cache Write/1M tokens | 1 crédits≈$1 | 1.25 crédits | -20% |
Règles de facturation
- Le prix de sortie varie selon le modèle, la résolution, la qualité, la durée ou l'usage de tokens.
- Les fichiers de référence téléversés peuvent être facturés séparément lorsqu'ils sont pris en charge.
- Les capacités additionnelles comme la recherche web ou d'images peuvent être facturées par requête.
- Les modèles à base de tokens sont facturés selon les tokens d'entrée et de sortie.
- Si la route principale est indisponible, Velokey peut basculer automatiquement vers une route de secours stable lorsque c'est possible.
- L'utilisation est à la demande, avec une déduction transparente des crédits.
* Le coût final dépend du résultat généré.
Modèles associés
Découvrez d'autres modèles de la même famille.
- AlibabaÉconomisez 20%
Qwen3.6 Plus
Alibaba's Qwen3.6 Plus, a balanced flagship-tier model with strong reasoning, long context, multimodal input, and agentic tool use.
- AlibabaÉconomisez 20%
Qwen3.7 Plus
Qwen3.7-Plus is Alibaba's multimodal agent model with screen perception and GUI grounding, a 1M-token context, preserve_thinking, and low-cost pricing.
- AlibabaÉconomisez 20%
Qwen3.7 Max
Qwen3.7-Max is Alibaba's flagship agent model for long-horizon coding and MCP tool orchestration, sustaining hours-long autonomous runs over a 1M-token context.
- OpenAIÉconomisez 20%
GPT 5.4 Mini
OpenAI's fast, cost-efficient GPT-5.4 Mini for high-volume production, with vision, long context, and strong tool use at low latency.
API Qwen3.6 Flash abordable
Accédez à Qwen3.6 Flash d'Alibaba Cloud sur Velokey — MoE clairsemé efficace, codage agentique exceptionnel, contexte natif de 262K et réflexion préservée à travers les flux, avec un point de terminaison unifié et des tarifs inférieurs au prix catalogue pour les applications de production.
Découvrez Qwen3.6 Flash et son accès API
Qwen3.6 Flash (Qwen3.6-35B-A3B) est le modèle ouvert d'Alibaba Cloud publié le 14 avril 2026, utilisant une architecture Mixture-of-Experts clairsemée : 35B de paramètres au total avec seulement 3B actifs. Il combine l'attention linéaire Gated DeltaNet avec la Gated Attention standard et un MoE clairsemé (256 experts, 8 acheminés + 1 partagé actif), surpassant largement Qwen3.5-35B-A3B en codage agentique et rivalisant avec des modèles denses beaucoup plus grands. Les poids sont ouverts sous Apache 2.0 sur Hugging Face et ModelScope, avec un contexte natif de 262K extensible à 1M tokens avec YaRN. Velokey fournit une API Qwen3.6 Flash abordable et facile à intégrer : un point de terminaison de chat unifié, un flux de requête clair et des tarifs inférieurs au prix catalogue pour les systèmes de production, les pipelines d'agents et les outils d'automatisation.
Codage agentique exceptionnel
Surpasse largement Qwen3.5-35B-A3B en codage agentique et rivalise avec des modèles denses beaucoup plus grands — 73.4% sur SWE-bench Verified et 51.5% sur Terminal-Bench 2.0 — adapté au développement agentique multi-fichiers.
Voir la documentation →
MoE clairsemé 35B/3B efficace
35B de paramètres au total avec seulement 3B actifs, combinant l'attention linéaire Gated DeltaNet avec un MoE clairsemé à 256 experts (8 acheminés + 1 partagé actif) pour une inférence efficace et peu coûteuse tout en préservant la qualité.
Voir la documentation →
Contexte long natif de 262K
Contexte natif de 262K, extensible à 1M tokens avec YaRN — adapté aux bases de code complètes, aux très longs documents et aux flux de travail agentiques à long horizon.
Voir la documentation →
Réflexion préservée à travers les flux d'agents
La préservation en mode réflexion maintient le contexte complet de raisonnement à travers des flux de travail agentiques étendus, afin que la chaîne de raisonnement ne soit pas perdue entre plusieurs étapes d'outils et reste cohérente et stable.
Voir la documentation →
Comment déployer l'API Qwen3.6 Flash sur Velokey
Démarrez en seulement quelques étapes.
Inscrivez-vous et obtenez une clé API
Connectez-vous à la console Velokey pour générer une clé API qui authentifie chaque requête envoyée à Qwen3.6 Flash.
Configurez les paramètres de requête
Définissez le modèle sur qwen-3-6-flash et soumettez des messages. Activez YaRN pour étendre le contexte à 1M pour les entrées très longues ; activez le mode réflexion pour préserver le raisonnement complet à travers de longs flux agentiques.
Intégrez et commencez les appels
Envoyez des requêtes au point de terminaison unifié /v1/chat/completions de Velokey pour alimenter des assistants, des agents et l'automatisation, avec l'utilisation gérée dans une seule console.
Cas d'utilisation réels pour Qwen3.6 Flash
Du codage agentique au raisonnement sur de longs documents, couvrant de nombreux scénarios à haute autonomie.
Codage agentique et développement multi-fichiers
Avec 73.4% sur SWE-bench Verified et l'efficacité de l'attention linéaire, il convient au développement agentique multi-fichiers, à la refactorisation et à la correction de bugs.
Automatisation pilotée par terminal et outils
51.5% sur Terminal-Bench 2.0 — adapté aux opérations de terminal, à l'appel d'outils et aux tâches d'automatisation à long horizon.
Raisonnement sur dépôt complet et longs documents
Contexte natif de 262K (1M avec YaRN) — adapté à la recherche, à la synthèse et aux questions-réponses sur des bases de code complètes et de longs documents.
Déploiement efficace et peu coûteux
Le MoE clairsemé 35B/3B n'active que 3B de paramètres — adapté aux déploiements à grande échelle sensibles aux coûts et au débit.
Flux de travail d'agents à long horizon
La préservation en mode réflexion conserve le contexte complet de raisonnement — adapté à l'orchestration d'agents à long horizon sur de nombreuses étapes d'outils.
Auto-hébergement et personnalisation à poids ouverts
Poids ouverts Apache 2.0 (Hugging Face / ModelScope) — adaptés à l'auto-hébergement, au fine-tuning et à la personnalisation en aval.
Pourquoi choisir Velokey pour Qwen3.6 Flash
Remise sur le prix catalogue
Appelez Qwen3.6 Flash à un prix inférieur sur Velokey — paiement à l'utilisation sans abonnement imposé, réduisant le coût initial.
Interface API unifiée
Une seule clé API donne accès à Qwen3.6 Flash et à d'autres modèles — plus besoin de jongler avec plusieurs comptes et clés, ce qui simplifie l'intégration.
Documentation complète et conseils de migration
Les références de points de terminaison, les détails des paramètres et les exemples de migration vous aident à intégrer rapidement et à adopter le contexte long et le mode réflexion.
Stable et hautement disponible
Le basculement automatique et les routes de repli stables maintiennent la disponibilité lorsque la route principale est indisponible, assurant la fiabilité en production.
Référence API
Exemples complets d'appels API et description des paramètres
Endpoint
https://api.velokey.ai/v1/chat/completionsAuthentication
Bearer YOUR_API_KEYRequest Example
curl https://api.velokey.ai/v1/chat/completions \
-X POST \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-flash",
"messages": [{"role": "user", "content": "Hello!"}],
"temperature": 0.7
}'Response Example
{
"id": "req_abc123",
"model": "qwen3.6-flash",
"created": 1234567890,
"data": { ... }
}FAQ de l'API Qwen3.6 Flash
Qu'est-ce que Qwen3.6 Flash ?
Il s'agit du modèle ouvert Qwen3.6-35B-A3B d'Alibaba Cloud publié le 14 avril 2026 (servi via l'API Model Studio sous le nom qwen3.6-flash). Il utilise une architecture MoE clairsemée avec 35B de paramètres au total et 3B actifs, avec des poids ouverts sous Apache 2.0 sur Hugging Face et ModelScope.
Qu'est-ce qui rend son architecture spéciale ?
Il utilise une architecture innovante combinant l'attention linéaire Gated DeltaNet avec la Gated Attention standard et un MoE clairsemé (256 experts, 8 acheminés + 1 partagé actif), permettant une inférence efficace avec seulement 3B de paramètres actifs tout en préservant la qualité.
Quelle est la taille de la fenêtre de contexte ?
Le contexte natif est de 262K, extensible à 1M tokens avec YaRN — adapté aux bases de code complètes, aux très longs documents et aux flux de travail agentiques à long horizon.
Quelle est sa performance en codage agentique ?
Il surpasse largement Qwen3.5-35B-A3B en codage agentique et rivalise avec des modèles denses beaucoup plus grands, avec un score de 73.4% sur SWE-bench Verified et de 51.5% sur Terminal-Bench 2.0, tout en préservant le contexte complet de réflexion à travers de longs flux.
Comment est-il facturé sur Velokey ?
La zone tarifaire de cette page affiche le prix actuel de Velokey, facturé en fonction des tokens d'entrée et de sortie, avec une remise sur le prix catalogue et sans abonnement imposé.
Commencez avec Qwen3.6 Flash dès aujourd'hui
Accédez à des modèles d'IA stables et économiques via Velokey avec une seule clé API.