Velokey

Qwen3.6 Flash

阿里巴巴Chatin 60 · out 60 Credits / 1M Tokens≈$60 / $60Verfügbar

Qwen3.6 Flash ist Alibaba Clouds Open-Weight Sparse-MoE (35B gesamt / 3B aktiv), das sich beim agentischen Coding auszeichnet, mit 262K Kontext. Zugriff über Velokeys einheitlichen Endpoint mit Preisen unter Listenpreis.

SWE-bench Verified 73.4%Effizientes Sparse-MoENativ 262K (1M mit YaRN)Thinking über Agenten hinweg erhalten

Anwendungsfälle

Agentisches Coding & Multi-File-Entwicklung · Terminal- & toolgesteuerte Automatisierung

Eingabe

Text

Ausgabe

Text

Abrechnung

Pro Token

Modelltyp:
0.7
02
2048
2568192
qwen3.6-flash

Starten Sie eine Unterhaltung

Geben Sie unten eine Nachricht ein, um zu beginnen

Registrieren und $0.5 Startguthaben erhalten — rund 20 Gratis-Bilder

Preisdetails

Transparente nutzungsbasierte Preise ohne versteckte Gebühren.

Detaillierte Preise

Staffelpreise

Nutzungsbasierte Preisübersicht

<= 256K tokensKontextlänge ≤ 256K
SpezifikationPreisOffiziellErsparnis
Input/1M tokens0.2 Credits≈$0.20.25 Credits-20%
Output/1M tokens1.2 Credits≈$1.21.5 Credits-20%
Cache Read/1M tokens0.02 Credits≈$0.020.025 Credits-20%
Cache Write/1M tokens0.25 Credits≈$0.250.3125 Credits-20%
> 256K tokensKontextlänge > 256K
SpezifikationPreisOffiziellErsparnis
Input/1M tokens0.8 Credits≈$0.81 Credits-20%
Output/1M tokens3.2 Credits≈$3.24 Credits-20%
Cache Read/1M tokens0.08 Credits≈$0.080.1 Credits-20%
Cache Write/1M tokens1 Credits≈$11.25 Credits-20%

Abrechnungsregeln

  • Der Ausgabepreis variiert je nach Modell, Auflösung, Qualität, Dauer oder Token-Verbrauch.
  • Hochgeladene Referenzdateien können bei unterstützten Modellen separat berechnet werden.
  • Zusatzfunktionen wie Web- oder Bildsuche können pro Anfrage berechnet werden.
  • Tokenbasierte Modelle werden nach Eingabe- und Ausgabe-Tokens abgerechnet.
  • Ist die primäre Route nicht verfügbar, kann Velokey nach Möglichkeit automatisch auf eine stabile Ausweichroute umschalten.
  • Die Nutzung ist Pay-as-you-go mit transparentem Credit-Abzug.

* Die endgültigen Kosten hängen vom generierten Ergebnis ab.

Erschwingliche Qwen3.6 Flash API

Greifen Sie auf Alibaba Clouds Qwen3.6 Flash auf Velokey zu — effizientes Sparse-MoE, herausragendes agentisches Coding, ein nativer 262K-Kontext und über Flows hinweg erhaltenes Thinking, mit einem einheitlichen Endpoint und Preisen unter Listenpreis für Produktions-Apps.

Lernen Sie Qwen3.6 Flash und seinen API-Zugriff kennen

Qwen3.6 Flash (Qwen3.6-35B-A3B) ist Alibaba Clouds offenes Modell, veröffentlicht am April 14, 2026, das eine Sparse-Mixture-of-Experts-Architektur verwendet: 35B Gesamtparameter mit nur 3B aktiven. Es kombiniert Gated DeltaNet Linear Attention mit standardmäßiger Gated Attention und einem Sparse-MoE (256 Experten, 8 geroutet + 1 gemeinsam aktiv), übertrifft Qwen3.5-35B-A3B beim agentischen Coding mit großem Abstand und konkurriert mit deutlich größeren dichten Modellen. Die Gewichte sind unter Apache 2.0 auf Hugging Face und ModelScope offen, mit einem nativen 262K-Kontext, der mit YaRN auf 1M Tokens erweiterbar ist. Velokey bietet eine erschwingliche, einfach zu integrierende Qwen3.6 Flash API: einen einheitlichen Chat-Endpoint, einen klaren Request-Flow und Preise unter Listenpreis für Produktionssysteme, Agenten-Pipelines und Automatisierungstools.

Herausragendes agentisches Coding

Übertrifft Qwen3.5-35B-A3B beim agentischen Coding mit großem Abstand und konkurriert mit deutlich größeren dichten Modellen — 73.4% SWE-bench Verified und 51.5% Terminal-Bench 2.0 — geeignet für agentische Multi-File-Entwicklung.

Dokumentation ansehen
Herausragendes agentisches Coding

Effizientes 35B/3B Sparse-MoE

35B Gesamtparameter mit nur 3B aktiven, kombiniert Gated DeltaNet Linear Attention mit einem Sparse-MoE mit 256 Experten (8 geroutet + 1 gemeinsam aktiv) für effiziente, kostengünstige Inferenz bei gleichzeitigem Qualitätserhalt.

Dokumentation ansehen
Effizientes 35B/3B Sparse-MoE

Nativer langer Kontext von 262K

Nativer Kontext von 262K, mit YaRN auf 1M Tokens erweiterbar — geeignet für ganze Codebasen, sehr lange Dokumente und langfristige agentische Workflows.

Dokumentation ansehen
Nativer langer Kontext von 262K

Thinking über Agenten-Flows hinweg erhalten

Thinking-Mode-Erhaltung bewahrt den vollständigen Reasoning-Kontext über erweiterte agentische Workflows hinweg, sodass die Reasoning-Kette zwischen mehreren Tool-Schritten nicht verloren geht und kohärent sowie stabil bleibt.

Dokumentation ansehen
Thinking über Agenten-Flows hinweg erhalten

So deployen Sie die Qwen3.6 Flash API auf Velokey

Starten Sie mit nur wenigen Schritten.

1

Registrieren und API Key erhalten

Melden Sie sich in der Velokey-Konsole an, um einen API Key zu generieren, der jede an Qwen3.6 Flash gesendete Anfrage authentifiziert.

2

Request-Parameter konfigurieren

Setzen Sie model auf qwen-3-6-flash und senden Sie messages. Aktivieren Sie YaRN, um den Kontext für sehr lange Eingaben auf 1M zu erweitern; schalten Sie den Thinking-Modus ein, um vollständiges Reasoning über lange agentische Abläufe hinweg zu erhalten.

3

Integrieren und Aufrufe starten

Senden Sie Anfragen an Velokeys einheitlichen /v1/chat/completions Endpoint, um Assistenten, Agenten und Automatisierung zu betreiben, wobei die Nutzung in einer Konsole verwaltet wird.

Praxisnahe Anwendungsfälle für Qwen3.6 Flash

Von agentischem Coding bis Long-Document-Reasoning, für viele Szenarien mit hoher Autonomie.

Agentisches Coding & Multi-File-Entwicklung

Mit 73.4% SWE-bench Verified und Linear-Attention-Effizienz geeignet für agentische Multi-File-Entwicklung, Refactoring und Fehlerbehebung.

Terminal- & toolgesteuerte Automatisierung

51.5% bei Terminal-Bench 2.0 — geeignet für Terminal-Operationen, Tool Calling und langfristige Automatisierungsaufgaben.

Whole-Repo- & Long-Doc-Reasoning

Nativer 262K-Kontext (1M mit YaRN) — geeignet für Retrieval, Synthese und QA über ganze Codebasen und lange Dokumente hinweg.

Effizientes, kostengünstiges Deployment

Das 35B/3B Sparse-MoE aktiviert nur 3B Parameter — geeignet für kosten- und durchsatzsensible Deployments im großen Maßstab.

Langfristige Agenten-Workflows

Thinking-Mode-Erhaltung bewahrt den vollständigen Reasoning-Kontext — geeignet für langfristige Agenten-Orchestrierung über viele Tool-Schritte hinweg.

Open-Weight-Self-Hosting & Anpassung

Offene Gewichte unter Apache 2.0 (Hugging Face / ModelScope) — geeignet für Self-Hosting, Fine-Tuning und nachgelagerte Anpassung.

Warum Velokey für Qwen3.6 Flash wählen

Rabatt auf den Listenpreis

Nutzen Sie Qwen3.6 Flash zu einem niedrigeren Preis auf Velokey — Pay-as-you-go ohne erzwungenes Abonnement, wodurch Vorabkosten reduziert werden.

Einheitliche API-Schnittstelle

Ein API Key greift auf Qwen3.6 Flash und andere Modelle zu — kein Hantieren mit mehreren Konten und Schlüsseln, was die Integration vereinfacht.

Vollständige Dokumentation und Migrationsleitfäden

Endpoint-Referenzen, Parameterdetails und Migrationsbeispiele helfen Ihnen, schnell zu integrieren und langen Kontext sowie Thinking-Modus einzuführen.

Stabil und hochverfügbar

Automatisches Failover und stabile Fallback-Routen erhalten die Verfügbarkeit, wenn die primäre Route ausfällt, und sorgen für zuverlässige Produktion.

API-Referenz

Vollständige API-Aufrufbeispiele und Parameterbeschreibungen

Endpoint

https://api.velokey.ai/v1/chat/completions

Authentication

Bearer YOUR_API_KEY

Request Example

curl https://api.velokey.ai/v1/chat/completions \
  -X POST \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-flash",
    "messages": [{"role": "user", "content": "Hello!"}],
    "temperature": 0.7
  }'

Response Example

{
  "id": "req_abc123",
  "model": "qwen3.6-flash",
  "created": 1234567890,
  "data": { ... }
}

Qwen3.6 Flash API FAQ

Was ist Qwen3.6 Flash?

Es ist Alibaba Clouds offenes Modell Qwen3.6-35B-A3B, veröffentlicht am April 14, 2026 (über die Model Studio API als qwen3.6-flash bereitgestellt). Es verwendet eine Sparse-MoE-Architektur mit 35B Gesamt- und 3B aktiven Parametern, mit offenen Gewichten unter Apache 2.0 auf Hugging Face und ModelScope.

Was ist das Besondere an seiner Architektur?

Es verwendet eine neuartige Architektur, die Gated DeltaNet Linear Attention mit standardmäßiger Gated Attention und einem Sparse-MoE (256 Experten, 8 geroutet + 1 gemeinsam aktiv) kombiniert und damit effiziente Inferenz mit nur 3B aktiven Parametern erzielt, während die Qualität erhalten bleibt.

Wie groß ist das Kontextfenster?

Der native Kontext beträgt 262K und ist mit YaRN auf 1M Tokens erweiterbar — geeignet für ganze Codebasen, sehr lange Dokumente und langfristige agentische Workflows.

Wie gut ist sein agentisches Coding?

Es übertrifft Qwen3.5-35B-A3B beim agentischen Coding mit großem Abstand und konkurriert mit deutlich größeren dichten Modellen, mit 73.4% bei SWE-bench Verified und 51.5% bei Terminal-Bench 2.0, während es den vollständigen Thinking-Kontext über lange Abläufe hinweg bewahrt.

Wie wird es auf Velokey abgerechnet?

Der Preisbereich dieser Seite zeigt den aktuellen Velokey-Preis, abgerechnet nach Eingabe- und Ausgabe-Tokens mit einem Rabatt auf den Listenpreis und ohne erzwungenes Abonnement.

Starten Sie noch heute mit Qwen3.6 Flash

Greifen Sie mit einem einzigen API-Schlüssel über Velokey auf günstige, stabile KI-Modelle zu.