GLM 5
GLM-5 — флагманская разреженная MoE-модель Zhipu (Z.ai) с 744B параметров, активирующая всего 40B параметров на токен и достигающая паритета с Claude Opus 4.5 в кодинге. Получите доступ через единый endpoint Velokey по цене ниже прайс-листа.
Сценарии использования
Генерация full-stack кода · Автономные агенты и использование инструментов
Ввод
Текст
Вывод
Текст
Тарификация
За токены
Начать разговор
Введите сообщение ниже, чтобы начать
Зарегистрируйтесь и получите $0.5 бесплатных кредитов — около 20 бесплатных изображений
Детали цены
Прозрачные цены по факту использования, без скрытых платежей.
Подробные цены
Детализация цен по использованию
| Спецификация | Цена | Официальная | Экономия |
|---|---|---|---|
| Input/1M tokens | 0.8 кредитов≈$0.8 | 1 кредитов | -20% |
| Output/1M tokens | 2.56 кредитов≈$2.56 | 3.2 кредитов | -20% |
| Cache Read/1M tokens | 0.16 кредитов≈$0.16 | 0.2 кредитов | -20% |
Правила тарификации
- Цена вывода зависит от модели, разрешения, качества, длительности или расхода токенов.
- Загруженные референс-файлы могут тарифицироваться отдельно, если модель их поддерживает.
- Дополнительные возможности, такие как веб-поиск или поиск по изображениям, могут тарифицироваться за запрос.
- Токеновые модели тарифицируются по входным и выходным токенам.
- Если основной маршрут недоступен, Velokey может автоматически переключиться на стабильный резервный маршрут, когда это возможно.
- Оплата по мере использования с прозрачным списанием кредитов.
* Итоговая стоимость зависит от сгенерированного результата.
Похожие модели
Изучите другие модели того же типа.
- ZhipuСэкономьте 20%
GLM 5.2
GLM-5.2 is Z.ai's flagship model with a 1M-token context, strong project-level coding, stable multi-step execution, and adjustable thinking for long-horizon engineering.
- ZhipuСэкономьте 20%
GLM 5.1
GLM-5.1 is Zhipu's flagship AI model, excelling in programming, complex reasoning, and long-chain tasks.
- OpenAIСэкономьте 20%
GPT 5.4 Mini
OpenAI's fast, cost-efficient GPT-5.4 Mini for high-volume production, with vision, long context, and strong tool use at low latency.
- AlibabaСэкономьте 20%
Qwen3.6 Plus
Alibaba's Qwen3.6 Plus, a balanced flagship-tier model with strong reasoning, long context, multimodal input, and agentic tool use.
Доступный GLM-5 API
Получите доступ к GLM-5 от Zhipu на Velokey — кодинг уровня Opus-4.5, SOTA open-weight агентное использование инструментов и эффективная разреженная архитектура 744B/40B, с единым endpoint и ценой ниже прайс-листа для production-приложений.
Познакомьтесь с GLM-5 и доступом к её API
GLM-5 — флагманская модель Zhipu (Z.ai), построенная на разреженной архитектуре mixture-of-experts с 744B параметров, которая активирует только 40B параметров на токен и интегрирует DeepSeek Sparse Attention для эффективности в масштабе. Предобученная на 28.5T токенов и доработанная с помощью async reinforcement-learning-фреймворка "Slime", она кодит на уровне Claude Opus 4.5, занимает первое место среди open-weight моделей в агентных бенчмарках и поддерживает несколько режимов мышления. Velokey предоставляет доступный и простой для интеграции GLM-5 API: единый chat endpoint, понятный процесс запросов и цены ниже прайс-листа для production-систем, агентных pipelines и инструментов автоматизации.
Кодинг уровня Opus-4.5
Генерирует исполняемый код из естественного языка для frontend, backend и обработки данных, достигая паритета производительности с Claude Opus 4.5 в программной инженерии — 77.8 на SWE-bench Verified и 56.2 на Terminal Bench 2.0.
Посмотреть документацию →
SOTA open-weight агентное использование инструментов
Автономное принятие решений и вызов инструментов превращают одно предложение в готовый результат через многошаговое выполнение; модель занимает первое место среди open-weight моделей на BrowseComp, MCP-Atlas и τ²-Bench.
Посмотреть документацию →
Эффективная разреженная архитектура 744B/40B
Из 744B общих параметров активируются только 40B на токен, в сочетании с DeepSeek Sparse Attention (DSA) и предобучением на 28.5T токенов для качества frontier-уровня при более низкой стоимости обслуживания.
Посмотреть документацию →
Режимы мышления и богатый инструментарий
Несколько режимов мышления, обученных с помощью async RL-фреймворка "Slime", плюс function calling, структурированный JSON-вывод, кэширование контекста и streaming для надёжной production-интеграции.
Посмотреть документацию →
Как развернуть GLM-5 API на Velokey
Начните всего за несколько шагов.
Зарегистрируйтесь и получите API Key
Войдите в консоль Velokey, чтобы сгенерировать API Key, который аутентифицирует каждый запрос, отправленный в GLM-5.
Настройте параметры запроса
Установите model в glm-5 и отправьте messages. Выберите режим мышления для более глубоких рассуждений и включите function calling, структурированный JSON-вывод и кэширование контекста.
Интегрируйте и начните вызовы
Отправляйте запросы на единый endpoint Velokey /v1/chat/completions, чтобы powering assistants, agents и automation, с управлением использованием в одной консоли.
Реальные сценарии использования GLM-5
От full-stack инженерии до автономных агентов, охватывая множество сценариев с высокой автономностью.
Генерация full-stack кода
Благодаря кодингу уровня Opus-4.5 подходит для генерации исполняемого frontend-, backend- и data-processing-кода из естественного языка по всему стеку.
Автономные агенты и использование инструментов
Занимает первое место среди open-weight моделей в агентных бенчмарках — подходит для browsing, оркестрации MCP-инструментов и многошаговой автоматизации задач.
Сложные рассуждения и исследования
Несколько режимов мышления, обученных с помощью async RL, — подходит для глубоких рассуждений, анализа и долгосрочных исследовательских workflows.
Pipelines обработки данных
Генерирует исполняемый data-processing-код из естественного языка — подходит для ETL, трансформации и автоматизации аналитики.
Структурированный вывод и интеграция
Function calling и структурированный JSON-вывод — подходит для встраивания модели в backend-сервисы и типизированные потоки данных.
Анализ с длинным контекстом
Контекст 200K токенов и вывод до 128K — подходит для анализа больших документов, codebases и длинных conversations.
Почему стоит выбрать Velokey для GLM-5
Скидка от прайс-листа
Вызывайте GLM-5 по более низкой цене на Velokey — pay-as-you-go без принудительной подписки, снижая первоначальные затраты.
Единый API-интерфейс
Один API Key даёт доступ к GLM-5 и другим моделям — без необходимости управлять несколькими аккаунтами и ключами, что упрощает интеграцию.
Полная документация и рекомендации по интеграции
Справочники endpoint, детали параметров и примеры помогают плавно внедрить режимы мышления, function calling и структурированный вывод.
Стабильность и высокая доступность
Автоматический failover и стабильные fallback-маршруты поддерживают доступность, когда основной маршрут недоступен, сохраняя надёжность production.
Справочник API
Полные примеры вызовов API и описание параметров
Endpoint
https://api.velokey.ai/v1/chat/completionsAuthentication
Bearer YOUR_API_KEYRequest Example
curl https://api.velokey.ai/v1/chat/completions \
-X POST \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5",
"messages": [{"role": "user", "content": "Hello!"}],
"temperature": 0.7
}'Response Example
{
"id": "req_abc123",
"model": "glm-5",
"created": 1234567890,
"data": { ... }
}FAQ по GLM-5 API
Какая архитектура у GLM-5?
GLM-5 использует разреженную архитектуру mixture-of-experts с 744B параметров, которая активирует только 40B параметров на токен, интегрирует DeepSeek Sparse Attention для эффективности и была предобучена на 28.5T токенов, а затем доработана с помощью async RL-фреймворка "Slime".
Насколько хорошо GLM-5 справляется с кодингом?
Она генерирует исполняемый код из естественного языка для frontend, backend и обработки данных, достигая паритета производительности с Claude Opus 4.5 в программной инженерии, с результатами 77.8 на SWE-bench Verified и 56.2 на Terminal Bench 2.0.
Насколько сильны её агентные возможности?
GLM-5 выполняет автономное принятие решений и вызов инструментов, превращая одно предложение в готовый результат через многошаговое выполнение. Она занимает первое место среди open-weight моделей на BrowseComp, MCP-Atlas и τ²-Bench.
Какие лимиты контекста и вывода она поддерживает?
GLM-5 поддерживает контекстное окно 200K токенов и до 128K токенов вывода. Она обрабатывает text-to-text задачи с несколькими режимами мышления, function calling, структурированным JSON-выводом, кэшированием контекста и streaming.
Как тарифицируется использование на Velokey?
Velokey маршрутизирует GLM-5 через единый endpoint с одним API key по цене ниже прайс-листа, с оплатой по входным и выходным токенам. В блоке цен на этой странице показана текущая цена Velokey в dashboard.
Начните работать с GLM 5 уже сегодня
Один API-ключ — доступ к недорогим и стабильным ИИ-моделям через Velokey.