Velokey

Qwen3.6 Flash

阿里巴巴Chatin 60 · out 60 Crédits / 1M tokens≈$60 / $60Disponible

Qwen3.6 Flash est le modèle MoE clairsemé à poids ouverts d'Alibaba Cloud (35B au total / 3B actifs) qui excelle dans le codage agentique, avec un contexte de 262K. Accédez-y via le point de terminaison unifié de Velokey avec des tarifs inférieurs au prix catalogue.

SWE-bench Verified 73.4%MoE clairsemé efficace262K natif (1M avec YaRN)Réflexion préservée entre les agents

Cas d'usage

Codage agentique et développement multi-fichiers · Automatisation pilotée par terminal et outils

Entrée

Texte

Sortie

Texte

Facturation

Par token

Type de modèle :
0.7
02
2048
2568192
qwen3.6-flash

Démarrer une conversation

Saisissez un message ci-dessous pour commencer

Inscrivez-vous et recevez $0.5 de crédits gratuits — environ 20 images gratuites

Détails des tarifs

Tarification transparente à l'usage, sans frais cachés.

Tarifs détaillés

Tarification par paliers

Détail des tarifs à l'usage

<= 256K tokensLongueur de contexte ≤ 256K
SpécificationPrixOfficielÉconomie
Input/1M tokens0.2 crédits≈$0.20.25 crédits-20%
Output/1M tokens1.2 crédits≈$1.21.5 crédits-20%
Cache Read/1M tokens0.02 crédits≈$0.020.025 crédits-20%
Cache Write/1M tokens0.25 crédits≈$0.250.3125 crédits-20%
> 256K tokensLongueur de contexte > 256K
SpécificationPrixOfficielÉconomie
Input/1M tokens0.8 crédits≈$0.81 crédits-20%
Output/1M tokens3.2 crédits≈$3.24 crédits-20%
Cache Read/1M tokens0.08 crédits≈$0.080.1 crédits-20%
Cache Write/1M tokens1 crédits≈$11.25 crédits-20%

Règles de facturation

  • Le prix de sortie varie selon le modèle, la résolution, la qualité, la durée ou l'usage de tokens.
  • Les fichiers de référence téléversés peuvent être facturés séparément lorsqu'ils sont pris en charge.
  • Les capacités additionnelles comme la recherche web ou d'images peuvent être facturées par requête.
  • Les modèles à base de tokens sont facturés selon les tokens d'entrée et de sortie.
  • Si la route principale est indisponible, Velokey peut basculer automatiquement vers une route de secours stable lorsque c'est possible.
  • L'utilisation est à la demande, avec une déduction transparente des crédits.

* Le coût final dépend du résultat généré.

API Qwen3.6 Flash abordable

Accédez à Qwen3.6 Flash d'Alibaba Cloud sur Velokey — MoE clairsemé efficace, codage agentique exceptionnel, contexte natif de 262K et réflexion préservée à travers les flux, avec un point de terminaison unifié et des tarifs inférieurs au prix catalogue pour les applications de production.

Découvrez Qwen3.6 Flash et son accès API

Qwen3.6 Flash (Qwen3.6-35B-A3B) est le modèle ouvert d'Alibaba Cloud publié le 14 avril 2026, utilisant une architecture Mixture-of-Experts clairsemée : 35B de paramètres au total avec seulement 3B actifs. Il combine l'attention linéaire Gated DeltaNet avec la Gated Attention standard et un MoE clairsemé (256 experts, 8 acheminés + 1 partagé actif), surpassant largement Qwen3.5-35B-A3B en codage agentique et rivalisant avec des modèles denses beaucoup plus grands. Les poids sont ouverts sous Apache 2.0 sur Hugging Face et ModelScope, avec un contexte natif de 262K extensible à 1M tokens avec YaRN. Velokey fournit une API Qwen3.6 Flash abordable et facile à intégrer : un point de terminaison de chat unifié, un flux de requête clair et des tarifs inférieurs au prix catalogue pour les systèmes de production, les pipelines d'agents et les outils d'automatisation.

Codage agentique exceptionnel

Surpasse largement Qwen3.5-35B-A3B en codage agentique et rivalise avec des modèles denses beaucoup plus grands — 73.4% sur SWE-bench Verified et 51.5% sur Terminal-Bench 2.0 — adapté au développement agentique multi-fichiers.

Voir la documentation
Codage agentique exceptionnel

MoE clairsemé 35B/3B efficace

35B de paramètres au total avec seulement 3B actifs, combinant l'attention linéaire Gated DeltaNet avec un MoE clairsemé à 256 experts (8 acheminés + 1 partagé actif) pour une inférence efficace et peu coûteuse tout en préservant la qualité.

Voir la documentation
MoE clairsemé 35B/3B efficace

Contexte long natif de 262K

Contexte natif de 262K, extensible à 1M tokens avec YaRN — adapté aux bases de code complètes, aux très longs documents et aux flux de travail agentiques à long horizon.

Voir la documentation
Contexte long natif de 262K

Réflexion préservée à travers les flux d'agents

La préservation en mode réflexion maintient le contexte complet de raisonnement à travers des flux de travail agentiques étendus, afin que la chaîne de raisonnement ne soit pas perdue entre plusieurs étapes d'outils et reste cohérente et stable.

Voir la documentation
Réflexion préservée à travers les flux d'agents

Comment déployer l'API Qwen3.6 Flash sur Velokey

Démarrez en seulement quelques étapes.

1

Inscrivez-vous et obtenez une clé API

Connectez-vous à la console Velokey pour générer une clé API qui authentifie chaque requête envoyée à Qwen3.6 Flash.

2

Configurez les paramètres de requête

Définissez le modèle sur qwen-3-6-flash et soumettez des messages. Activez YaRN pour étendre le contexte à 1M pour les entrées très longues ; activez le mode réflexion pour préserver le raisonnement complet à travers de longs flux agentiques.

3

Intégrez et commencez les appels

Envoyez des requêtes au point de terminaison unifié /v1/chat/completions de Velokey pour alimenter des assistants, des agents et l'automatisation, avec l'utilisation gérée dans une seule console.

Cas d'utilisation réels pour Qwen3.6 Flash

Du codage agentique au raisonnement sur de longs documents, couvrant de nombreux scénarios à haute autonomie.

Codage agentique et développement multi-fichiers

Avec 73.4% sur SWE-bench Verified et l'efficacité de l'attention linéaire, il convient au développement agentique multi-fichiers, à la refactorisation et à la correction de bugs.

Automatisation pilotée par terminal et outils

51.5% sur Terminal-Bench 2.0 — adapté aux opérations de terminal, à l'appel d'outils et aux tâches d'automatisation à long horizon.

Raisonnement sur dépôt complet et longs documents

Contexte natif de 262K (1M avec YaRN) — adapté à la recherche, à la synthèse et aux questions-réponses sur des bases de code complètes et de longs documents.

Déploiement efficace et peu coûteux

Le MoE clairsemé 35B/3B n'active que 3B de paramètres — adapté aux déploiements à grande échelle sensibles aux coûts et au débit.

Flux de travail d'agents à long horizon

La préservation en mode réflexion conserve le contexte complet de raisonnement — adapté à l'orchestration d'agents à long horizon sur de nombreuses étapes d'outils.

Auto-hébergement et personnalisation à poids ouverts

Poids ouverts Apache 2.0 (Hugging Face / ModelScope) — adaptés à l'auto-hébergement, au fine-tuning et à la personnalisation en aval.

Pourquoi choisir Velokey pour Qwen3.6 Flash

Remise sur le prix catalogue

Appelez Qwen3.6 Flash à un prix inférieur sur Velokey — paiement à l'utilisation sans abonnement imposé, réduisant le coût initial.

Interface API unifiée

Une seule clé API donne accès à Qwen3.6 Flash et à d'autres modèles — plus besoin de jongler avec plusieurs comptes et clés, ce qui simplifie l'intégration.

Documentation complète et conseils de migration

Les références de points de terminaison, les détails des paramètres et les exemples de migration vous aident à intégrer rapidement et à adopter le contexte long et le mode réflexion.

Stable et hautement disponible

Le basculement automatique et les routes de repli stables maintiennent la disponibilité lorsque la route principale est indisponible, assurant la fiabilité en production.

Référence API

Exemples complets d'appels API et description des paramètres

Endpoint

https://api.velokey.ai/v1/chat/completions

Authentication

Bearer YOUR_API_KEY

Request Example

curl https://api.velokey.ai/v1/chat/completions \
  -X POST \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-flash",
    "messages": [{"role": "user", "content": "Hello!"}],
    "temperature": 0.7
  }'

Response Example

{
  "id": "req_abc123",
  "model": "qwen3.6-flash",
  "created": 1234567890,
  "data": { ... }
}

FAQ de l'API Qwen3.6 Flash

Qu'est-ce que Qwen3.6 Flash ?

Il s'agit du modèle ouvert Qwen3.6-35B-A3B d'Alibaba Cloud publié le 14 avril 2026 (servi via l'API Model Studio sous le nom qwen3.6-flash). Il utilise une architecture MoE clairsemée avec 35B de paramètres au total et 3B actifs, avec des poids ouverts sous Apache 2.0 sur Hugging Face et ModelScope.

Qu'est-ce qui rend son architecture spéciale ?

Il utilise une architecture innovante combinant l'attention linéaire Gated DeltaNet avec la Gated Attention standard et un MoE clairsemé (256 experts, 8 acheminés + 1 partagé actif), permettant une inférence efficace avec seulement 3B de paramètres actifs tout en préservant la qualité.

Quelle est la taille de la fenêtre de contexte ?

Le contexte natif est de 262K, extensible à 1M tokens avec YaRN — adapté aux bases de code complètes, aux très longs documents et aux flux de travail agentiques à long horizon.

Quelle est sa performance en codage agentique ?

Il surpasse largement Qwen3.5-35B-A3B en codage agentique et rivalise avec des modèles denses beaucoup plus grands, avec un score de 73.4% sur SWE-bench Verified et de 51.5% sur Terminal-Bench 2.0, tout en préservant le contexte complet de réflexion à travers de longs flux.

Comment est-il facturé sur Velokey ?

La zone tarifaire de cette page affiche le prix actuel de Velokey, facturé en fonction des tokens d'entrée et de sortie, avec une remise sur le prix catalogue et sans abonnement imposé.

Commencez avec Qwen3.6 Flash dès aujourd'hui

Accédez à des modèles d'IA stables et économiques via Velokey avec une seule clé API.