Qwen3.6 Flash
Qwen3.6 Flash ist Alibaba Clouds Open-Weight Sparse-MoE (35B gesamt / 3B aktiv), das sich beim agentischen Coding auszeichnet, mit 262K Kontext. Zugriff über Velokeys einheitlichen Endpoint mit Preisen unter Listenpreis.
Anwendungsfälle
Agentisches Coding & Multi-File-Entwicklung · Terminal- & toolgesteuerte Automatisierung
Eingabe
Text
Ausgabe
Text
Abrechnung
Pro Token
Starten Sie eine Unterhaltung
Geben Sie unten eine Nachricht ein, um zu beginnen
Registrieren und $0.5 Startguthaben erhalten — rund 20 Gratis-Bilder
Preisdetails
Transparente nutzungsbasierte Preise ohne versteckte Gebühren.
Detaillierte Preise
StaffelpreiseNutzungsbasierte Preisübersicht
| Spezifikation | Preis | Offiziell | Ersparnis |
|---|---|---|---|
| Input/1M tokens | 0.2 Credits≈$0.2 | 0.25 Credits | -20% |
| Output/1M tokens | 1.2 Credits≈$1.2 | 1.5 Credits | -20% |
| Cache Read/1M tokens | 0.02 Credits≈$0.02 | 0.025 Credits | -20% |
| Cache Write/1M tokens | 0.25 Credits≈$0.25 | 0.3125 Credits | -20% |
| Spezifikation | Preis | Offiziell | Ersparnis |
|---|---|---|---|
| Input/1M tokens | 0.8 Credits≈$0.8 | 1 Credits | -20% |
| Output/1M tokens | 3.2 Credits≈$3.2 | 4 Credits | -20% |
| Cache Read/1M tokens | 0.08 Credits≈$0.08 | 0.1 Credits | -20% |
| Cache Write/1M tokens | 1 Credits≈$1 | 1.25 Credits | -20% |
Abrechnungsregeln
- Der Ausgabepreis variiert je nach Modell, Auflösung, Qualität, Dauer oder Token-Verbrauch.
- Hochgeladene Referenzdateien können bei unterstützten Modellen separat berechnet werden.
- Zusatzfunktionen wie Web- oder Bildsuche können pro Anfrage berechnet werden.
- Tokenbasierte Modelle werden nach Eingabe- und Ausgabe-Tokens abgerechnet.
- Ist die primäre Route nicht verfügbar, kann Velokey nach Möglichkeit automatisch auf eine stabile Ausweichroute umschalten.
- Die Nutzung ist Pay-as-you-go mit transparentem Credit-Abzug.
* Die endgültigen Kosten hängen vom generierten Ergebnis ab.
Verwandte Modelle
Entdecken Sie weitere Modelle derselben Familie.
- Alibaba20% sparen
Qwen3.6 Plus
Alibaba's Qwen3.6 Plus, a balanced flagship-tier model with strong reasoning, long context, multimodal input, and agentic tool use.
- Alibaba20% sparen
Qwen3.7 Plus
Qwen3.7-Plus is Alibaba's multimodal agent model with screen perception and GUI grounding, a 1M-token context, preserve_thinking, and low-cost pricing.
- Alibaba20% sparen
Qwen3.7 Max
Qwen3.7-Max is Alibaba's flagship agent model for long-horizon coding and MCP tool orchestration, sustaining hours-long autonomous runs over a 1M-token context.
- OpenAI20% sparen
GPT 5.4 Mini
OpenAI's fast, cost-efficient GPT-5.4 Mini for high-volume production, with vision, long context, and strong tool use at low latency.
Erschwingliche Qwen3.6 Flash API
Greifen Sie auf Alibaba Clouds Qwen3.6 Flash auf Velokey zu — effizientes Sparse-MoE, herausragendes agentisches Coding, ein nativer 262K-Kontext und über Flows hinweg erhaltenes Thinking, mit einem einheitlichen Endpoint und Preisen unter Listenpreis für Produktions-Apps.
Lernen Sie Qwen3.6 Flash und seinen API-Zugriff kennen
Qwen3.6 Flash (Qwen3.6-35B-A3B) ist Alibaba Clouds offenes Modell, veröffentlicht am April 14, 2026, das eine Sparse-Mixture-of-Experts-Architektur verwendet: 35B Gesamtparameter mit nur 3B aktiven. Es kombiniert Gated DeltaNet Linear Attention mit standardmäßiger Gated Attention und einem Sparse-MoE (256 Experten, 8 geroutet + 1 gemeinsam aktiv), übertrifft Qwen3.5-35B-A3B beim agentischen Coding mit großem Abstand und konkurriert mit deutlich größeren dichten Modellen. Die Gewichte sind unter Apache 2.0 auf Hugging Face und ModelScope offen, mit einem nativen 262K-Kontext, der mit YaRN auf 1M Tokens erweiterbar ist. Velokey bietet eine erschwingliche, einfach zu integrierende Qwen3.6 Flash API: einen einheitlichen Chat-Endpoint, einen klaren Request-Flow und Preise unter Listenpreis für Produktionssysteme, Agenten-Pipelines und Automatisierungstools.
Herausragendes agentisches Coding
Übertrifft Qwen3.5-35B-A3B beim agentischen Coding mit großem Abstand und konkurriert mit deutlich größeren dichten Modellen — 73.4% SWE-bench Verified und 51.5% Terminal-Bench 2.0 — geeignet für agentische Multi-File-Entwicklung.
Dokumentation ansehen →
Effizientes 35B/3B Sparse-MoE
35B Gesamtparameter mit nur 3B aktiven, kombiniert Gated DeltaNet Linear Attention mit einem Sparse-MoE mit 256 Experten (8 geroutet + 1 gemeinsam aktiv) für effiziente, kostengünstige Inferenz bei gleichzeitigem Qualitätserhalt.
Dokumentation ansehen →
Nativer langer Kontext von 262K
Nativer Kontext von 262K, mit YaRN auf 1M Tokens erweiterbar — geeignet für ganze Codebasen, sehr lange Dokumente und langfristige agentische Workflows.
Dokumentation ansehen →
Thinking über Agenten-Flows hinweg erhalten
Thinking-Mode-Erhaltung bewahrt den vollständigen Reasoning-Kontext über erweiterte agentische Workflows hinweg, sodass die Reasoning-Kette zwischen mehreren Tool-Schritten nicht verloren geht und kohärent sowie stabil bleibt.
Dokumentation ansehen →
So deployen Sie die Qwen3.6 Flash API auf Velokey
Starten Sie mit nur wenigen Schritten.
Registrieren und API Key erhalten
Melden Sie sich in der Velokey-Konsole an, um einen API Key zu generieren, der jede an Qwen3.6 Flash gesendete Anfrage authentifiziert.
Request-Parameter konfigurieren
Setzen Sie model auf qwen-3-6-flash und senden Sie messages. Aktivieren Sie YaRN, um den Kontext für sehr lange Eingaben auf 1M zu erweitern; schalten Sie den Thinking-Modus ein, um vollständiges Reasoning über lange agentische Abläufe hinweg zu erhalten.
Integrieren und Aufrufe starten
Senden Sie Anfragen an Velokeys einheitlichen /v1/chat/completions Endpoint, um Assistenten, Agenten und Automatisierung zu betreiben, wobei die Nutzung in einer Konsole verwaltet wird.
Praxisnahe Anwendungsfälle für Qwen3.6 Flash
Von agentischem Coding bis Long-Document-Reasoning, für viele Szenarien mit hoher Autonomie.
Agentisches Coding & Multi-File-Entwicklung
Mit 73.4% SWE-bench Verified und Linear-Attention-Effizienz geeignet für agentische Multi-File-Entwicklung, Refactoring und Fehlerbehebung.
Terminal- & toolgesteuerte Automatisierung
51.5% bei Terminal-Bench 2.0 — geeignet für Terminal-Operationen, Tool Calling und langfristige Automatisierungsaufgaben.
Whole-Repo- & Long-Doc-Reasoning
Nativer 262K-Kontext (1M mit YaRN) — geeignet für Retrieval, Synthese und QA über ganze Codebasen und lange Dokumente hinweg.
Effizientes, kostengünstiges Deployment
Das 35B/3B Sparse-MoE aktiviert nur 3B Parameter — geeignet für kosten- und durchsatzsensible Deployments im großen Maßstab.
Langfristige Agenten-Workflows
Thinking-Mode-Erhaltung bewahrt den vollständigen Reasoning-Kontext — geeignet für langfristige Agenten-Orchestrierung über viele Tool-Schritte hinweg.
Open-Weight-Self-Hosting & Anpassung
Offene Gewichte unter Apache 2.0 (Hugging Face / ModelScope) — geeignet für Self-Hosting, Fine-Tuning und nachgelagerte Anpassung.
Warum Velokey für Qwen3.6 Flash wählen
Rabatt auf den Listenpreis
Nutzen Sie Qwen3.6 Flash zu einem niedrigeren Preis auf Velokey — Pay-as-you-go ohne erzwungenes Abonnement, wodurch Vorabkosten reduziert werden.
Einheitliche API-Schnittstelle
Ein API Key greift auf Qwen3.6 Flash und andere Modelle zu — kein Hantieren mit mehreren Konten und Schlüsseln, was die Integration vereinfacht.
Vollständige Dokumentation und Migrationsleitfäden
Endpoint-Referenzen, Parameterdetails und Migrationsbeispiele helfen Ihnen, schnell zu integrieren und langen Kontext sowie Thinking-Modus einzuführen.
Stabil und hochverfügbar
Automatisches Failover und stabile Fallback-Routen erhalten die Verfügbarkeit, wenn die primäre Route ausfällt, und sorgen für zuverlässige Produktion.
API-Referenz
Vollständige API-Aufrufbeispiele und Parameterbeschreibungen
Endpoint
https://api.velokey.ai/v1/chat/completionsAuthentication
Bearer YOUR_API_KEYRequest Example
curl https://api.velokey.ai/v1/chat/completions \
-X POST \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-flash",
"messages": [{"role": "user", "content": "Hello!"}],
"temperature": 0.7
}'Response Example
{
"id": "req_abc123",
"model": "qwen3.6-flash",
"created": 1234567890,
"data": { ... }
}Qwen3.6 Flash API FAQ
Was ist Qwen3.6 Flash?
Es ist Alibaba Clouds offenes Modell Qwen3.6-35B-A3B, veröffentlicht am April 14, 2026 (über die Model Studio API als qwen3.6-flash bereitgestellt). Es verwendet eine Sparse-MoE-Architektur mit 35B Gesamt- und 3B aktiven Parametern, mit offenen Gewichten unter Apache 2.0 auf Hugging Face und ModelScope.
Was ist das Besondere an seiner Architektur?
Es verwendet eine neuartige Architektur, die Gated DeltaNet Linear Attention mit standardmäßiger Gated Attention und einem Sparse-MoE (256 Experten, 8 geroutet + 1 gemeinsam aktiv) kombiniert und damit effiziente Inferenz mit nur 3B aktiven Parametern erzielt, während die Qualität erhalten bleibt.
Wie groß ist das Kontextfenster?
Der native Kontext beträgt 262K und ist mit YaRN auf 1M Tokens erweiterbar — geeignet für ganze Codebasen, sehr lange Dokumente und langfristige agentische Workflows.
Wie gut ist sein agentisches Coding?
Es übertrifft Qwen3.5-35B-A3B beim agentischen Coding mit großem Abstand und konkurriert mit deutlich größeren dichten Modellen, mit 73.4% bei SWE-bench Verified und 51.5% bei Terminal-Bench 2.0, während es den vollständigen Thinking-Kontext über lange Abläufe hinweg bewahrt.
Wie wird es auf Velokey abgerechnet?
Der Preisbereich dieser Seite zeigt den aktuellen Velokey-Preis, abgerechnet nach Eingabe- und Ausgabe-Tokens mit einem Rabatt auf den Listenpreis und ohne erzwungenes Abonnement.
Starten Sie noch heute mit Qwen3.6 Flash
Greifen Sie mit einem einzigen API-Schlüssel über Velokey auf günstige, stabile KI-Modelle zu.