GLM 5
GLM-5 es el modelo insignia de Zhipu (Z.ai), una MoE sparse de 744B que activa solo 40B por token y programa a la par de Claude Opus 4.5. Accede a través del endpoint unificado de Velokey con precios por debajo de lista.
Casos de uso
Generación de código full-stack · Agentes autónomos y uso de herramientas
Entrada
Texto
Salida
Texto
Facturación
Por token
Inicia una conversación
Escribe un mensaje abajo para comenzar
Regístrate y recibe $0.5 en créditos gratis — unas 20 imágenes gratis
Detalles de precio
Precios transparentes por uso, sin costes ocultos.
Precios detallados
Desglose de precios por uso
| Especificación | Precio | Oficial | Ahorro |
|---|---|---|---|
| Input/1M tokens | 0.8 Créditos≈$0.8 | 1 Créditos | -20% |
| Output/1M tokens | 2.56 Créditos≈$2.56 | 3.2 Créditos | -20% |
| Cache Read/1M tokens | 0.16 Créditos≈$0.16 | 0.2 Créditos | -20% |
Reglas de facturacion
- El precio de salida varia por modelo, resolucion, calidad, duracion o uso de tokens.
- Los archivos de referencia subidos pueden cobrarse por separado cuando el modelo los admite.
- Capacidades adicionales como busqueda web o busqueda de imagenes pueden cobrarse por solicitud.
- Los modelos basados en tokens se cobran por tokens de entrada y salida.
- Si la ruta principal no esta disponible, Velokey puede cambiar automaticamente a una ruta estable de respaldo cuando sea posible.
- El uso es de pago por consumo con deduccion transparente de creditos.
* El coste final depende del resultado generado.
Modelos relacionados
Explora otros modelos de la misma familia.
- ZhipuAhorra 20%
GLM 5.2
GLM-5.2 is Z.ai's flagship model with a 1M-token context, strong project-level coding, stable multi-step execution, and adjustable thinking for long-horizon engineering.
- ZhipuAhorra 20%
GLM 5.1
GLM-5.1 is Zhipu's flagship AI model, excelling in programming, complex reasoning, and long-chain tasks.
- OpenAIAhorra 20%
GPT 5.4 Mini
OpenAI's fast, cost-efficient GPT-5.4 Mini for high-volume production, with vision, long context, and strong tool use at low latency.
- AlibabaAhorra 20%
Qwen3.6 Plus
Alibaba's Qwen3.6 Plus, a balanced flagship-tier model with strong reasoning, long context, multimodal input, and agentic tool use.
API de GLM-5 asequible
Accede a GLM-5 de Zhipu en Velokey: codificación nivel Opus 4.5, uso de herramientas agéntico de pesos abiertos SOTA y una arquitectura sparse eficiente de 744B/40B, con un endpoint unificado y precios por debajo de lista para aplicaciones en producción.
Conoce GLM-5 y su acceso por API
GLM-5 es el modelo insignia de Zhipu (Z.ai), construido sobre una arquitectura sparse de mezcla de expertos de 744B parámetros que activa solo 40B por token e integra DeepSeek Sparse Attention para lograr eficiencia a gran escala. Preentrenado con 28,5T tokens y refinado con el framework de aprendizaje por refuerzo asíncrono «Slime», programa a la par de Claude Opus 4.5, ocupa el primer lugar entre los modelos de pesos abiertos en benchmarks agénticos y admite múltiples modos de pensamiento. Velokey ofrece una API de GLM-5 asequible y fácil de integrar: un endpoint de chat unificado, un flujo de solicitudes claro y precios por debajo de lista para sistemas en producción, pipelines de agentes y herramientas de automatización.
Codificación nivel Opus 4.5
Genera código ejecutable a partir de lenguaje natural en frontend, backend y procesamiento de datos, alcanzando paridad con Claude Opus 4.5 en ingeniería de software: 77,8 en SWE-bench Verified y 56,2 en Terminal Bench 2.0.
Ver documentación →
Uso de herramientas agéntico de pesos abiertos SOTA
La toma de decisiones autónoma y la invocación de herramientas convierten una sola frase en un entregable completo mediante ejecución de varios pasos, ocupando el primer lugar entre los modelos de pesos abiertos en BrowseComp, MCP-Atlas y τ²-Bench.
Ver documentación →
Arquitectura sparse eficiente de 744B/40B
744B parámetros totales activan solo 40B por token, combinados con DeepSeek Sparse Attention (DSA) y preentrenamiento con 28,5T tokens para calidad de frontera a menor costo de servicio.
Ver documentación →
Modos de pensamiento y herramientas completas
Múltiples modos de pensamiento entrenados con el framework de RL asíncrono «Slime», además de function calling, salida JSON estructurada, caché de contexto y streaming para una integración fiable en producción.
Ver documentación →
Cómo desplegar la API de GLM-5 en Velokey
Comienza con solo unos pasos.
Regístrate y obtén una API Key
Inicia sesión en la consola de Velokey para generar una API Key que autentique cada solicitud enviada a GLM-5.
Configura los parámetros de la solicitud
Establece model en glm-5 y envía messages. Selecciona un modo de pensamiento para un razonamiento más profundo y habilita function calling, salida JSON estructurada y caché de contexto.
Integra y empieza a llamar
Envía solicitudes al endpoint unificado /v1/chat/completions de Velokey para impulsar asistentes, agentes y automatización, con el uso gestionado en una sola consola.
Casos de uso reales de GLM-5
Desde ingeniería full-stack hasta agentes autónomos, cubriendo muchos escenarios de alta autonomía.
Generación de código full-stack
Con codificación nivel Opus 4.5, apto para generar código ejecutable de frontend, backend y procesamiento de datos a partir de lenguaje natural en toda la pila.
Agentes autónomos y uso de herramientas
Ocupa el primer lugar entre los modelos de pesos abiertos en benchmarks agénticos: apto para navegación, orquestación de herramientas MCP y automatización de tareas de varios pasos.
Razonamiento complejo e investigación
Múltiples modos de pensamiento entrenados con RL asíncrono: apto para razonamiento profundo, análisis y flujos de investigación de largo alcance.
Pipelines de procesamiento de datos
Genera código de procesamiento de datos ejecutable a partir de lenguaje natural: apto para ETL, transformación y automatización de análisis.
Salida estructurada e integración
Function calling y salida JSON estructurada: apto para integrar el modelo en servicios de backend y flujos de datos tipados.
Análisis de contexto largo
Contexto de 200K tokens y hasta 128K de salida: apto para analizar documentos grandes, bases de código y conversaciones largas.
Por qué elegir Velokey para GLM-5
Descuento sobre el precio de lista
Llama a GLM-5 a un precio más bajo en Velokey: pago por uso sin suscripción obligatoria, reduciendo el costo inicial.
Interfaz de API unificada
Una sola API Key accede a GLM-5 y a otros modelos: sin gestionar múltiples cuentas y claves, simplificando la integración.
Documentación completa y guía de integración
Referencias de endpoints, detalles de parámetros y ejemplos te ayudan a adoptar modos de pensamiento, function calling y salida estructurada sin fricción.
Estable y de alta disponibilidad
La conmutación por error automática y las rutas de respaldo estables mantienen la disponibilidad cuando la ruta principal falla, manteniendo la producción fiable.
Referencia API
Ejemplos completos de llamada API y descripcion de parametros
Endpoint
https://api.velokey.ai/v1/chat/completionsAuthentication
Bearer YOUR_API_KEYRequest Example
curl https://api.velokey.ai/v1/chat/completions \
-X POST \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5",
"messages": [{"role": "user", "content": "Hello!"}],
"temperature": 0.7
}'Response Example
{
"id": "req_abc123",
"model": "glm-5",
"created": 1234567890,
"data": { ... }
}Preguntas frecuentes sobre la API de GLM-5
¿Cuál es la arquitectura de GLM-5?
GLM-5 usa una arquitectura sparse de mezcla de expertos de 744B parámetros que activa solo 40B por token, integra DeepSeek Sparse Attention para mayor eficiencia y fue preentrenado con 28,5T tokens, luego refinado con el framework de RL asíncrono «Slime».
¿Qué tan bueno es GLM-5 programando?
Genera código ejecutable a partir de lenguaje natural en frontend, backend y procesamiento de datos, alcanzando paridad con Claude Opus 4.5 en ingeniería de software, con 77,8 en SWE-bench Verified y 56,2 en Terminal Bench 2.0.
¿Qué tan fuertes son sus capacidades agénticas?
GLM-5 realiza toma de decisiones autónoma e invocación de herramientas, convirtiendo una sola frase en un entregable completo mediante ejecución de varios pasos. Ocupa el primer lugar entre los modelos de pesos abiertos en BrowseComp, MCP-Atlas y τ²-Bench.
¿Qué límites de contexto y salida admite?
GLM-5 admite una ventana de contexto de 200K tokens y hasta 128K tokens de salida. Maneja tareas de texto a texto con múltiples modos de pensamiento, function calling, salida JSON estructurada, caché de contexto y streaming.
¿Cómo se factura en Velokey?
Velokey enruta GLM-5 a través de un endpoint unificado con una sola API key a precios por debajo de lista, facturado por tokens de entrada y salida. El área de precios de esta página muestra el precio actual de Velokey en el panel.
Empieza a construir con GLM 5
Usa una sola API key para acceder a modelos de IA estables y de bajo coste mediante Velokey.