GLM 5
GLM-5 est le modèle phare MoE creux 744B de Zhipu (Z.ai), n’activant que 40B paramètres par jeton, avec des capacités de codage au niveau de Claude Opus 4.5. Accédez-y via le point de terminaison unifié de Velokey avec des tarifs inférieurs au prix catalogue.
Cas d'usage
Génération de code full-stack · Agents autonomes et utilisation d’outils
Entrée
Texte
Sortie
Texte
Facturation
Par token
Démarrer une conversation
Saisissez un message ci-dessous pour commencer
Inscrivez-vous et recevez $0.5 de crédits gratuits — environ 20 images gratuites
Détails des tarifs
Tarification transparente à l'usage, sans frais cachés.
Tarifs détaillés
Détail des tarifs à l'usage
| Spécification | Prix | Officiel | Économie |
|---|---|---|---|
| Input/1M tokens | 0.8 crédits≈$0.8 | 1 crédits | -20% |
| Output/1M tokens | 2.56 crédits≈$2.56 | 3.2 crédits | -20% |
| Cache Read/1M tokens | 0.16 crédits≈$0.16 | 0.2 crédits | -20% |
Règles de facturation
- Le prix de sortie varie selon le modèle, la résolution, la qualité, la durée ou l'usage de tokens.
- Les fichiers de référence téléversés peuvent être facturés séparément lorsqu'ils sont pris en charge.
- Les capacités additionnelles comme la recherche web ou d'images peuvent être facturées par requête.
- Les modèles à base de tokens sont facturés selon les tokens d'entrée et de sortie.
- Si la route principale est indisponible, Velokey peut basculer automatiquement vers une route de secours stable lorsque c'est possible.
- L'utilisation est à la demande, avec une déduction transparente des crédits.
* Le coût final dépend du résultat généré.
Modèles associés
Découvrez d'autres modèles de la même famille.
- ZhipuÉconomisez 20%
GLM 5.2
GLM-5.2 is Z.ai's flagship model with a 1M-token context, strong project-level coding, stable multi-step execution, and adjustable thinking for long-horizon engineering.
- ZhipuÉconomisez 20%
GLM 5.1
GLM-5.1 is Zhipu's flagship AI model, excelling in programming, complex reasoning, and long-chain tasks.
- OpenAIÉconomisez 20%
GPT 5.4 Mini
OpenAI's fast, cost-efficient GPT-5.4 Mini for high-volume production, with vision, long context, and strong tool use at low latency.
- AlibabaÉconomisez 20%
Qwen3.6 Plus
Alibaba's Qwen3.6 Plus, a balanced flagship-tier model with strong reasoning, long context, multimodal input, and agentic tool use.
API GLM-5 abordable
Accédez au GLM-5 de Zhipu sur Velokey — codage au niveau d’Opus-4.5, utilisation d’outils agentiques à poids ouverts de pointe et architecture creuse efficace 744B/40B, avec un point de terminaison unifié et des tarifs inférieurs au prix catalogue pour les applications de production.
Découvrez GLM-5 et son accès API
GLM-5 est le modèle phare de Zhipu (Z.ai), construit sur une architecture de mélange d’experts creuse à 744B paramètres qui n’active que 40B paramètres par jeton et intègre DeepSeek Sparse Attention pour une efficacité à grande échelle. Pré-entraîné sur 28.5T jetons et affiné avec le framework d’apprentissage par renforcement asynchrone "Slime", il code au niveau de Claude Opus 4.5, se classe premier parmi les modèles à poids ouverts sur les benchmarks agentiques et prend en charge plusieurs modes de réflexion. Velokey fournit une API GLM-5 abordable et facile à intégrer : un point de terminaison de chat unifié, un flux de requêtes clair et des tarifs inférieurs au prix catalogue pour les systèmes de production, les pipelines d’agents et les outils d’automatisation.
Codage au niveau d’Opus-4.5
Génère du code exécutable à partir du langage naturel pour le frontend, le backend et le traitement des données, atteignant une parité de performance avec Claude Opus 4.5 en ingénierie logicielle — 77.8 sur SWE-bench Verified et 56.2 sur Terminal Bench 2.0.
Voir la documentation →
Utilisation d’outils agentiques à poids ouverts de pointe
La prise de décision autonome et l’invocation d’outils transforment une seule phrase en livrable complet grâce à une exécution en plusieurs étapes, avec un classement en tête parmi les modèles à poids ouverts sur BrowseComp, MCP-Atlas et τ²-Bench.
Voir la documentation →
Architecture creuse efficace 744B/40B
744B paramètres au total n’activent que 40B par jeton, combinés à DeepSeek Sparse Attention (DSA) et à un pré-entraînement sur 28.5T jetons pour une qualité de pointe à un coût de service réduit.
Voir la documentation →
Modes de réflexion et outillage riche
Multiples modes de réflexion entraînés avec le framework RL asynchrone "Slime", plus l’appel de fonctions, la sortie JSON structurée, la mise en cache du contexte et le streaming pour une intégration de production fiable.
Voir la documentation →
Comment déployer l’API GLM-5 sur Velokey
Démarrez en quelques étapes seulement.
Inscrivez-vous et obtenez une clé API
Connectez-vous à la console Velokey pour générer une clé API qui authentifie chaque requête envoyée à GLM-5.
Configurez les paramètres de requête
Définissez le modèle sur glm-5 et envoyez des messages. Sélectionnez un mode de réflexion pour un raisonnement plus approfondi, et activez l’appel de fonctions, la sortie JSON structurée et la mise en cache du contexte.
Intégrez et commencez à appeler
Envoyez des requêtes au point de terminaison unifié /v1/chat/completions de Velokey pour alimenter assistants, agents et automatisations, avec l’utilisation gérée dans une seule console.
Cas d’utilisation concrets de GLM-5
De l’ingénierie full-stack aux agents autonomes, couvrant de nombreux scénarios à forte autonomie.
Génération de code full-stack
Avec un codage au niveau d’Opus-4.5, adapté à la génération de code frontend, backend et de traitement des données exécutable à partir du langage naturel sur toute la pile.
Agents autonomes et utilisation d’outils
Se classe premier parmi les modèles à poids ouverts sur les benchmarks agentiques — adapté à la navigation, à l’orchestration d’outils MCP et à l’automatisation de tâches en plusieurs étapes.
Raisonnement complexe et recherche
Multiples modes de réflexion entraînés avec un RL asynchrone — adaptés au raisonnement approfondi, à l’analyse et aux workflows de recherche à long horizon.
Pipelines de traitement des données
Génère du code de traitement des données exécutable à partir du langage naturel — adapté à l’ETL, à la transformation et à l’automatisation analytique.
Sortie structurée et intégration
Appel de fonctions et sortie JSON structurée — adaptés au raccordement du modèle à des services backend et à des flux de données typés.
Analyse à long contexte
Un contexte de 200K jetons et jusqu’à 128K en sortie — adaptés à l’analyse de grands documents, de bases de code et de longues conversations.
Pourquoi choisir Velokey pour GLM-5
Remise sur le prix catalogue
Appelez GLM-5 à un prix inférieur sur Velokey — paiement à l’usage sans abonnement imposé, réduisant le coût initial.
Interface API unifiée
Une seule clé API donne accès à GLM-5 et à d’autres modèles — plus besoin de jongler avec plusieurs comptes et clés, ce qui simplifie l’intégration.
Documentation complète et conseils d’intégration
Les références de points de terminaison, les détails des paramètres et les exemples vous aident à adopter facilement les modes de réflexion, l’appel de fonctions et la sortie structurée.
Stable et hautement disponible
Le basculement automatique et les routes de secours stables maintiennent la disponibilité lorsque la route principale est indisponible, garantissant la fiabilité en production.
Référence API
Exemples complets d'appels API et description des paramètres
Endpoint
https://api.velokey.ai/v1/chat/completionsAuthentication
Bearer YOUR_API_KEYRequest Example
curl https://api.velokey.ai/v1/chat/completions \
-X POST \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5",
"messages": [{"role": "user", "content": "Hello!"}],
"temperature": 0.7
}'Response Example
{
"id": "req_abc123",
"model": "glm-5",
"created": 1234567890,
"data": { ... }
}FAQ de l’API GLM-5
Quelle est l’architecture de GLM-5 ?
GLM-5 utilise une architecture de mélange d’experts creuse à 744B paramètres qui n’active que 40B paramètres par jeton, intègre DeepSeek Sparse Attention pour l’efficacité, et a été pré-entraîné sur 28.5T jetons, puis affiné avec le framework RL asynchrone "Slime".
Quelle est la qualité de GLM-5 en codage ?
Il génère du code exécutable à partir du langage naturel pour le frontend, le backend et le traitement des données, atteignant une parité de performance avec Claude Opus 4.5 en ingénierie logicielle, avec un score de 77.8 sur SWE-bench Verified et de 56.2 sur Terminal Bench 2.0.
Quelle est la puissance de ses capacités agentiques ?
GLM-5 effectue une prise de décision autonome et l’invocation d’outils, transformant une seule phrase en livrable complet grâce à une exécution en plusieurs étapes. Il se classe premier parmi les modèles à poids ouverts sur BrowseComp, MCP-Atlas et τ²-Bench.
Quelles limites de contexte et de sortie prend-il en charge ?
GLM-5 prend en charge une fenêtre de contexte de 200K jetons et jusqu’à 128K jetons de sortie. Il gère les tâches texte-à-texte avec plusieurs modes de réflexion, l’appel de fonctions, la sortie JSON structurée, la mise en cache du contexte et le streaming.
Comment est-il facturé sur Velokey ?
Velokey achemine GLM-5 via un point de terminaison unifié avec une seule clé API à des tarifs inférieurs au prix catalogue, facturés selon les jetons d’entrée et de sortie. La zone de tarification de cette page affiche le prix Velokey actuel dans le tableau de bord.
Commencez avec GLM 5 dès aujourd'hui
Accédez à des modèles d'IA stables et économiques via Velokey avec une seule clé API.