GLM 5
GLM-5 ist Zhipus (Z.ai) Flaggschiff-Modell, ein spärliches 744B-MoE-Modell, das nur 40B Parameter pro Token aktiviert und beim Coding auf Augenhöhe mit Claude Opus 4.5 liegt. Greifen Sie über Velokeys einheitlichen Endpoint zu Preisen unter Listenpreis darauf zu.
Anwendungsfälle
Full-Stack-Codegenerierung · Autonome Agenten & Tool-Nutzung
Eingabe
Text
Ausgabe
Text
Abrechnung
Pro Token
Starten Sie eine Unterhaltung
Geben Sie unten eine Nachricht ein, um zu beginnen
Registrieren und $0.5 Startguthaben erhalten — rund 20 Gratis-Bilder
Preisdetails
Transparente nutzungsbasierte Preise ohne versteckte Gebühren.
Detaillierte Preise
Nutzungsbasierte Preisübersicht
| Spezifikation | Preis | Offiziell | Ersparnis |
|---|---|---|---|
| Input/1M tokens | 0.8 Credits≈$0.8 | 1 Credits | -20% |
| Output/1M tokens | 2.56 Credits≈$2.56 | 3.2 Credits | -20% |
| Cache Read/1M tokens | 0.16 Credits≈$0.16 | 0.2 Credits | -20% |
Abrechnungsregeln
- Der Ausgabepreis variiert je nach Modell, Auflösung, Qualität, Dauer oder Token-Verbrauch.
- Hochgeladene Referenzdateien können bei unterstützten Modellen separat berechnet werden.
- Zusatzfunktionen wie Web- oder Bildsuche können pro Anfrage berechnet werden.
- Tokenbasierte Modelle werden nach Eingabe- und Ausgabe-Tokens abgerechnet.
- Ist die primäre Route nicht verfügbar, kann Velokey nach Möglichkeit automatisch auf eine stabile Ausweichroute umschalten.
- Die Nutzung ist Pay-as-you-go mit transparentem Credit-Abzug.
* Die endgültigen Kosten hängen vom generierten Ergebnis ab.
Verwandte Modelle
Entdecken Sie weitere Modelle derselben Familie.
- Zhipu20% sparen
GLM 5.2
GLM-5.2 is Z.ai's flagship model with a 1M-token context, strong project-level coding, stable multi-step execution, and adjustable thinking for long-horizon engineering.
- Zhipu20% sparen
GLM 5.1
GLM-5.1 is Zhipu's flagship AI model, excelling in programming, complex reasoning, and long-chain tasks.
- OpenAI20% sparen
GPT 5.4 Mini
OpenAI's fast, cost-efficient GPT-5.4 Mini for high-volume production, with vision, long context, and strong tool use at low latency.
- Alibaba20% sparen
Qwen3.6 Plus
Alibaba's Qwen3.6 Plus, a balanced flagship-tier model with strong reasoning, long context, multimodal input, and agentic tool use.
Erschwingliche GLM-5 API
Greifen Sie auf Zhipus GLM-5 auf Velokey zu — Coding auf Opus-4.5-Niveau, agentische SOTA-Open-Weight-Tool-Nutzung und eine effiziente spärliche 744B/40B-Architektur, mit einheitlichem Endpoint und Preisen unter Listenpreis für Produktions-Apps.
Lernen Sie GLM-5 und seinen API-Zugriff kennen
GLM-5 ist Zhipus (Z.ai) Flaggschiff-Modell, aufgebaut auf einer spärlichen Mixture-of-Experts-Architektur mit 744B Parametern, die nur 40B Parameter pro Token aktiviert und DeepSeek Sparse Attention für Effizienz im großen Maßstab integriert. Vortrainiert auf 28.5T Tokens und verfeinert mit dem asynchronen "Slime"-Reinforcement-Learning-Framework, codet es auf Augenhöhe mit Claude Opus 4.5, belegt den ersten Platz unter Open-Weight-Modellen bei agentischen Benchmarks und unterstützt mehrere Denkmodi. Velokey bietet eine erschwingliche, einfach zu integrierende GLM-5 API: einen einheitlichen Chat-Endpoint, einen klaren Request-Flow und Preise unter Listenpreis für Produktionssysteme, Agent-Pipelines und Automatisierungstools.
Coding auf Opus-4.5-Niveau
Generiert ausführbaren Code aus natürlicher Sprache für Frontend, Backend und Datenverarbeitung und erreicht bei Software Engineering Leistungsgleichstand mit Claude Opus 4.5 — 77.8 auf SWE-bench Verified und 56.2 auf Terminal Bench 2.0.
Dokumentation anzeigen →
Agentische SOTA-Open-Weight-Tool-Nutzung
Autonome Entscheidungsfindung und Tool-Aufrufe verwandeln einen einzigen Satz durch mehrstufige Ausführung in ein vollständiges Ergebnis und belegen den ersten Platz unter Open-Weight-Modellen auf BrowseComp, MCP-Atlas und τ²-Bench.
Dokumentation anzeigen →
Effiziente spärliche 744B/40B-Architektur
744B Gesamtparameter aktivieren nur 40B pro Token, kombiniert mit DeepSeek Sparse Attention (DSA) und Vortraining auf 28.5T Tokens für Frontier-Qualität bei geringeren Bereitstellungskosten.
Dokumentation anzeigen →
Denkmodi und umfangreiches Tooling
Mehrere Denkmodi, trainiert mit dem asynchronen "Slime"-RL-Framework, plus Function Calling, strukturierte JSON-Ausgabe, Kontext-Caching und Streaming für zuverlässige Produktionsintegration.
Dokumentation anzeigen →
So deployen Sie die GLM-5 API auf Velokey
Starten Sie mit nur wenigen Schritten.
Registrieren und API Key erhalten
Melden Sie sich in der Velokey-Konsole an, um einen API Key zu generieren, der jede an GLM-5 gesendete Anfrage authentifiziert.
Request-Parameter konfigurieren
Setzen Sie model auf glm-5 und senden Sie messages. Wählen Sie einen Denkmodus für tieferes Reasoning aus und aktivieren Sie Function Calling, strukturierte JSON-Ausgabe und Kontext-Caching.
Integrieren und Aufrufe starten
Senden Sie Anfragen an Velokeys einheitlichen /v1/chat/completions Endpoint, um Assistenten, Agenten und Automatisierung zu betreiben, wobei die Nutzung in einer Konsole verwaltet wird.
Praxisnahe Anwendungsfälle für GLM-5
Von Full-Stack-Engineering bis zu autonomen Agenten, für viele Szenarien mit hoher Autonomie.
Full-Stack-Codegenerierung
Mit Coding auf Opus-4.5-Niveau, geeignet zur Generierung ausführbaren Frontend-, Backend- und Datenverarbeitungscodes aus natürlicher Sprache über den gesamten Stack hinweg.
Autonome Agenten & Tool-Nutzung
Belegt den ersten Platz unter Open-Weight-Modellen bei agentischen Benchmarks — geeignet für Browsing, MCP-Tool-Orchestrierung und mehrstufige Aufgabenautomatisierung.
Komplexes Reasoning & Forschung
Mehrere Denkmodi, trainiert mit asynchronem RL — geeignet für tiefes Reasoning, Analysen und langfristige Forschungsworkflows.
Datenverarbeitungspipelines
Generiert ausführbaren Datenverarbeitungscode aus natürlicher Sprache — geeignet für ETL, Transformation und Analytics-Automatisierung.
Strukturierte Ausgabe & Integration
Function Calling und strukturierte JSON-Ausgabe — geeignet, um das Modell in Backend-Services und typisierte Datenflüsse einzubinden.
Long-Context-Analyse
Ein Kontext von 200K Tokens und bis zu 128K Ausgabe — geeignet zur Analyse großer Dokumente, Codebasen und langer Gespräche.
Warum Velokey für GLM-5 wählen
Rabatt auf den Listenpreis
Rufen Sie GLM-5 zu einem niedrigeren Preis auf Velokey auf — Pay-as-you-go ohne erzwungenes Abonnement, wodurch Vorabkosten reduziert werden.
Einheitliche API-Schnittstelle
Ein API Key ermöglicht Zugriff auf GLM-5 und andere Modelle — kein Jonglieren mit mehreren Konten und Keys, was die Integration vereinfacht.
Vollständige Dokumentation und Integrationsanleitung
Endpoint-Referenzen, Parameterdetails und Beispiele helfen Ihnen, Denkmodi, Function Calling und strukturierte Ausgabe reibungslos zu übernehmen.
Stabil und hochverfügbar
Automatisches Failover und stabile Fallback-Routen erhalten die Verfügbarkeit, wenn die primäre Route ausfällt, und halten die Produktion zuverlässig.
API-Referenz
Vollständige API-Aufrufbeispiele und Parameterbeschreibungen
Endpoint
https://api.velokey.ai/v1/chat/completionsAuthentication
Bearer YOUR_API_KEYRequest Example
curl https://api.velokey.ai/v1/chat/completions \
-X POST \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5",
"messages": [{"role": "user", "content": "Hello!"}],
"temperature": 0.7
}'Response Example
{
"id": "req_abc123",
"model": "glm-5",
"created": 1234567890,
"data": { ... }
}GLM-5 API FAQ
Welche Architektur hat GLM-5?
GLM-5 verwendet eine spärliche Mixture-of-Experts-Architektur mit 744B Parametern, die nur 40B Parameter pro Token aktiviert, DeepSeek Sparse Attention für Effizienz integriert und auf 28.5T Tokens vortrainiert wurde, anschließend verfeinert mit dem asynchronen "Slime"-RL-Framework.
Wie gut ist GLM-5 beim Coding?
Es generiert ausführbaren Code aus natürlicher Sprache für Frontend, Backend und Datenverarbeitung, erreicht bei Software Engineering Leistungsgleichstand mit Claude Opus 4.5 und erzielt 77.8 auf SWE-bench Verified sowie 56.2 auf Terminal Bench 2.0.
Wie stark sind seine agentischen Fähigkeiten?
GLM-5 führt autonome Entscheidungsfindung und Tool-Aufrufe aus und verwandelt einen einzigen Satz durch mehrstufige Ausführung in ein vollständiges Ergebnis. Es belegt den ersten Platz unter Open-Weight-Modellen auf BrowseComp, MCP-Atlas und τ²-Bench.
Welche Kontext- und Ausgabelimits unterstützt es?
GLM-5 unterstützt ein Kontextfenster von 200K Tokens und bis zu 128K Tokens Ausgabe. Es verarbeitet Text-zu-Text-Aufgaben mit mehreren Denkmodi, Function Calling, strukturierter JSON-Ausgabe, Kontext-Caching und Streaming.
Wie wird es auf Velokey abgerechnet?
Velokey leitet GLM-5 über einen einheitlichen Endpoint mit einem API Key zu Preisen unter Listenpreis weiter, abgerechnet nach Input- und Output-Tokens. Der Preisbereich dieser Seite zeigt den aktuellen Velokey-Preis im Dashboard.
Starten Sie noch heute mit GLM 5
Greifen Sie mit einem einzigen API-Schlüssel über Velokey auf günstige, stabile KI-Modelle zu.