Kimi K3 API: почему контекст 1M меняет маршрутизацию моделей
Kimi K3 сочетает 2.8T параметров, контекст 1M, разреженный MoE и доступ по API. Разбираем цены, кэширование, маршрутизацию и компромиссы развёртывания.

Kimi K3 выходит с двумя цифрами, созданными для заголовков: 2.8 триллиона параметров и контекстное окно в 1 миллион токенов.
Для production-команды более полезное число — 10.
В официальном Kimi K3 API от Moonshot входные токены при промахе кэша стоят в десять раз дороже, чем при попадании в кэш. Но более важное требование — вовсе не число: многоходовые приложения и приложения с вызовом инструментов обязаны сохранять полное сообщение ассистента, включая рассуждения и состояние инструментов.
Это делает Kimi K3 чем-то большим, чем новый model ID. Компоновка контекста, стабильность кэша, персистентность сессии и маршрутизация на границах задач превращаются в production-архитектуру.
Кратко
- Moonshot описывает Kimi K3 как открытую модель класса 3T с 2.8T параметров, нативным зрением и контекстным окном 1,048,576 токенов.
- На момент проверки K3 уже была доступна через продукты Kimi и API Moonshot, а полные веса были запланированы к выпуску до 27 июля 2026 года.
- Модель активирует 16 из 896 экспертов, поэтому общее число параметров — не то же самое, что активные вычисления на токен.
- Официальные цены API: $0.30 за 1M входных токенов при попадании в кэш, $3.00 за 1M входных токенов при промахе кэша и $15.00 за 1M выходных токенов.
- Сегодня K3 всегда рассуждает на уровне
maxи требует сохранения полных сообщений ассистента в многоходовых диалогах и циклах вызова инструментов. - Moonshot предупреждает: отсутствие истории размышлений или переключение существующей сессии на K3 может сделать качество нестабильным.
- На момент проверки этой статьи K3 не значилась в актуальном каталоге Velokey. Не угадывайте model ID — сначала проверьте фактическую доступность.
Статус Kimi K3: подтверждено, ожидается и недоступно
Материалы вокруг запуска крупной модели обычно сводят несколько разных состояний к одному слову: выпущена.
Для Kimi K3 эти состояния нужно разделять.
| Пункт | Статус на 17 июля 2026 года |
|---|---|
| Приложения и продукты Kimi | Доступны |
Модель kimi-k3 в официальном API Moonshot | Доступна |
| Полные веса модели | Запланированы до 27 июля 2026 года |
| Финальная лицензия открытых весов | Ещё не подтверждена в изученных материалах запуска |
| Полный технический отчёт Kimi K3 | Ожидается |
| Kimi K3 через Velokey | Не значилась на момент проверки |
Страница релиза Kimi K3 от Moonshot называет её первой открытой моделью класса 3T. Это характеристика от самого провайдера. Практическое различие сейчас в том, что разработчики уже могут вызывать K3 через API Moonshot, тогда как командам, планирующим локальное развёртывание, всё ещё нужны сами веса, лицензия, model card и технический отчёт.
Если эта статья будет обновляться после 27 июля, статус выпуска весов следует проверить заново. Запланированный релиз и скачиваемый лицензированный артефакт — не одно и то же.
Что 2.8T параметров означают на практике
Kimi K3 сочетает Kimi Delta Attention, Attention Residuals и архитектуру Stable LatentMoE. По данным Moonshot, модель активирует 16 из 896 экспертов на запрос.
Это меняет то, как следует читать заголовочную цифру о параметрах.

*Moonshot сообщает о 2.8T параметров всего, эффективной активации 16 из 896 экспертов, контекстном окне 1,048,576 токенов и нативном зрении.*
Общее число параметров 2.8T описывает суммарную ёмкость модели. Это не значит, что каждый параметр активен для каждого токена. Разреженная активация экспертов — механизм, который позволяет очень большой модели предоставлять больше ёмкости, не оплачивая полные вычисления плотной модели на каждом шаге.
Moonshot также сообщает о примерно 2.5-кратном росте общей эффективности масштабирования по сравнению с Kimi K2. Это архитектурный результат по данным провайдера, а не независимое production-измерение, но он указывает на реальную инженерную цель: сделать очень большую модель пригодной для долгосрочной работы, а не просто большой.
K3 также включает нативное визуальное понимание и позиционируется для кодинга, работы со знаниями, рассуждений, изображений и видео. Эти возможности расширяют набор возможных API-нагрузок, но не говорят команде, какие нагрузки будут экономически оправданы.
Ответ на этот вопрос дают контекст, выход, задержка и поведение инструментов.
Почему окно в 1M токенов не отменяет контекстную инженерию
Официальная страница цен Kimi указывает контекстное окно 1,048,576 токенов.
Это большая ёмкость. Но это не инструкция заполнять каждый запрос.
Долго работающий кодинг- или research-агент может накапливать:
- системные инструкции
- правила разрешений и безопасности
- определения инструментов
- файлы репозитория и документы
- извлечённые свидетельства
- сообщения пользователя
- рассуждения ассистента
- вызовы инструментов и их результаты
- повторные попытки, исправления и заброшенные ветки
Контекст может помещаться, а задача при этом всё равно будет становиться медленнее, дороже и труднее в управлении.
Длинный контекст меняет главный вопрос с «Поместится ли это?» на «Что заслуживает оставаться активным?»
Production-сессия должна разделять четыре слоя:
- Стабильный префикс: долговременные инструкции, фиксированные знания и часто переиспользуемые определения инструментов.
- Рабочий набор задачи: файлы, свидетельства, изображения и инструменты, нужные для текущей цели.
- Полное состояние сессии: сообщения, необходимые для сохранения непрерывности рассуждений и инструментов.
- Перезапускаемые контрольные точки: проверенные сводки, позволяющие задаче восстановиться, не таская за собой вечно каждую неудачную ветку.

*Длинный контекст операционно полезен, когда стабильные инструкции, активный рабочий набор, полное состояние сессии и контрольные точки перезапуска управляются раздельно.*
Окно в миллион токенов даёт командам больше пространства. Оно не заменяет retrieval, компактизацию, контрольные точки и бюджеты токенов.
Как цены Kimi K3 меняют архитектуру промптов
Официальные цены K3 от Moonshot:
- Вход при попадании в кэш: $0.30 за 1M токенов
- Вход при промахе кэша: $3.00 за 1M токенов
- Выход: $15.00 за 1M токенов
Цены не включают применимые налоги и могут меняться. Перед закупкой проверяйте актуальную официальную страницу.
Базовая модель стоимости:
input cost = cache-hit MTok x $0.30 + cache-miss MTok x $3.00
output cost = output MTok x $15.00
*Цены, проверенные 17 июля 2026 года, показывают 10-кратный разрыв между ставками входа при попадании и промахе кэша — стабильность префикса становится механизмом контроля затрат. Это официальные ставки Kimi API, а не цены Velokey; цены могут измениться.*
Десятикратный разрыв во входной цене делает структуру промпта частью архитектуры затрат.
Кэширование контекста у Kimi автоматическое. Нет ручного cache ID или TTL, которыми нужно управлять. API пытается переиспользовать повторяющийся начальный контекст: системные промпты, документы знаний и определения инструментов.
Автоматическое не значит гарантированное.
Если приложение меняет начало промпта при каждом вызове, переставляет инструменты, вставляет временные метки в префикс или сериализует те же знания в другом порядке, оно может превратить переиспользуемый контекст в промахи кэша.
Moonshot заявляет, что официальный API достигал cache-hit rate выше 90% на кодинг-нагрузках. Относитесь к этому как к результату, о котором сообщает провайдер, а не как к обещанию для другого приложения. Число, которому production-команда может доверять, — то, что измерено на её собственном трафике.
Отслеживайте как минимум:
- входные токены с попаданием в кэш
- входные токены с промахом кэша
- выходные токены рассуждений и финального ответа
- время до первого токена
- общую задержку ответа
- число вызовов инструментов
- частоту повторных попыток
- стоимость на завершённую задачу
Цены в расчёте на запрос агенту недостаточно. Одна цель пользователя может породить десятки вызовов модели, вызовов инструментов, повторных попыток и шагов проверки.
Почему сохраняемые размышления меняют маршрутизацию моделей
Kimi K3 рассуждает всегда. Сейчас API поддерживает только reasoning_effort="max", и ответ может содержать reasoning_content в дополнение к финальному content.
Для многоходовых диалогов и вызовов инструментов документация Kimi требует добавлять полное сообщение ассистента в следующий запрос. Разработчикам не следует сохранять только видимый ответ. Возвращённое сообщение может также содержать поля рассуждений и вызовов инструментов, необходимые для непрерывности.
Это влияет и на стоимость, и на маршрутизацию.
История рассуждений продолжает занимать контекстное окно и вносит вклад в потребление токенов. Поэтому долгая агентная сессия растёт не только за счёт сообщений пользователя и документов.
Это также означает, что выбор модели нельзя безопасно считать операцией без состояния.
Moonshot предупреждает, что качество K3 может стать крайне нестабильным, когда обвязка не возвращает полную историю размышлений или когда идущую сессию с другой моделью переключают на K3.
Более безопасное production-правило звучит просто:
> Маршрутизируйте на границе задачи или сессии, затем закрепляйте выбранную модель до осознанной контрольной точки.
Если модель или провайдер отказывает посреди задачи, создайте пакет перезапуска: проверенные факты, выполненные действия, текущие файлы, открытые решения и оставшиеся цели. Запускайте замещающую модель из этого явного состояния, а не молча меняйте model ID внутри того же цикла инструментов.

*Выбирайте модель на границе задачи, закрепляйте её на весь цикл инструментов и меняйте модели только после осознанной контрольной точки или в новой сессии. Это production-рекомендация, а не официальная архитектура маршрутизации Kimi.*
В этом разница между маршрутизацией запросов и маршрутизацией сессий.
Место Kimi K3 в мультимодельном стеке
Режим максимального рассуждения K3 делает разделение нагрузок важным с первого дня.
| Нагрузка | Пригодность Kimi K3 | Production-суждение |
|---|---|---|
| Кодинг в масштабе репозитория | Сильный кандидат | Используйте стабильную обвязку, сохраняйте состояние, измеряйте успех инструментов. |
| Сложные исследования с многими инструментами | Сильный кандидат | Следите за повторными попытками, качеством свидетельств и ростом контекста. |
| Визуальные инженерные задачи | Кандидат | Тестируйте реальный workflow с изображениями, видео, UI, CAD или отладкой. |
| Высокоценный синтез знаний | Кандидат | Используйте, когда ценность ответа оправдывает долгие рассуждения и стоимость выхода. |
| Классификация и теггирование | Слабый выбор по умолчанию | Более дешёвая модель часто окажется эффективнее. |
| Извлечение и простое переписывание | Слабый выбор по умолчанию | Максимальное рассуждение обычно излишний оверхед. |
| Чат с низкой задержкой | Неясно | Замерьте время до первого токена и общую задержку. |
| Автономные production-действия | Условно | Добавьте узкие разрешения, песочницы, шлюзы одобрения и логи. |
Moonshot называет чрезмерную проактивность текущим ограничением. K3 может принимать неожиданные решения, когда долгая задача сталкивается с неоднозначностью или небольшим препятствием.
Это делает проектирование разрешений не менее важным, чем проектирование промптов:
- разделяйте доступ на чтение и доступ на запись
- держите API-ключи и production-учётные данные на стороне сервера
- требуйте одобрения для разрушительных или внешних действий
- определяйте явные условия остановки
- логируйте каждое запрошенное действие инструмента и его результат
- оценивайте поведение при восстановлении, а не только успешные прогоны
Самая способная модель не должна автоматически получать самые широкие разрешения.
Kimi K3 API или self-hosting
Запланированный выпуск открытых весов делает локальное развёртывание частью разговора. Но не делает его автоматическим победителем.
По словам Moonshot, K3 использует quantization-aware training с весами MXFP4 и активациями MXFP8. Для развёртывания компания рекомендует конфигурации-суперноды с 64 и более ускорителями.
Это рекомендация, а не опубликованный жёсткий минимум, но её достаточно, чтобы показать: полномасштабный сервинг K3 — инфраструктурный проект кластерного уровня.
Managed-доступ через API — практичный первый путь, когда:
- трафик ранний или переменный
- команда хочет проверить качество, прежде чем покупать инфраструктуру
- важна скорость развёртывания
- команда не может эксплуатировать крупный распределённый inference-стек
- продукту нужно сравнивать K3 с несколькими другими моделями
Self-hosting становится более реалистичным, когда:
- финальная лицензия разрешает планируемое использование
- требования суверенитета данных диктуют локальный контроль
- нагрузка достаточно устойчива, чтобы оправдать выделенные мощности
- организация уже эксплуатирует инфраструктуру для больших моделей
- команда способна управлять утилизацией, батчингом, кэшированием, обновлениями и восстановлением после сбоев
Открытые веса не делают бесплатными железо, сеть, простаивающие мощности, наблюдаемость или инженерное время.
Самый безопасный порядок: сначала оценка через API, затем обязательства по инфраструктуре.
Production-чеклист для агентов на Kimi K3
Прежде чем направлять production-трафик на K3, ответьте на эти вопросы.
Соответствие нагрузки
- Нужны ли задаче долгосрочные рассуждения, большой контекст, зрение или сложные инструменты?
- Достаточно ли ценен результат, чтобы оправдать максимальное рассуждение и стоимость выходных токенов?
- Могла бы более дешёвая модель выполнить первичную классификацию, извлечение или переписывание?
Дизайн сессии
- Закреплена ли модель на всё время жизни задачи?
- Сохраняется и воспроизводится ли полное сообщение ассистента?
- Может ли workflow перезапуститься с контрольной точки после сбоя?
- Загружаются ли определения инструментов только при необходимости?
Стоимость и задержка
- Какой процент входных токенов приходится на попадания в кэш?
- Как быстро растёт история рассуждений?
- Каковы время до первого токена и общая длительность задачи?
- Какая доля расходов приходится на повторные попытки и неудачные вызовы инструментов?
- Какова стоимость на принятый результат, а не только на запрос?
Безопасность и эксплуатация
- Какие действия требуют одобрения человеком?
- Хранятся ли учётные данные только на сервере?
- Заблокированы ли разрушительные действия по умолчанию?
- Наблюдаемы ли вызовы инструментов, ошибки, расход токенов, задержка и траты?
Оценка
- Превосходит ли K3 сильный бейзлайн на реальной нагрузке?
- Превосходит ли она более дешёвый бейзлайн настолько, чтобы оправдать стоимость?
- Что происходит при перезапуске задачи на другой модели?
- Как часто модели требуется человеческая корректировка?
Результатом оценки должна быть граница «качество — стоимость — задержка», а не один балл бенчмарка.
Как подготовить OpenAI-совместимый клиент, не выдумывая model ID
На момент проверки этой статьи Kimi K3 не было в актуальном каталоге Velokey. Доступность может измениться, поэтому проверьте живой каталог моделей и опросите endpoint моделей, прежде чем писать интеграционный код.
Не угадывайте model ID по посту в блоге.
Следующий пример выводит model ID, доступные аккаунту Velokey в данный момент. Он не предполагает наличие K3.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["VELOKEY_API_KEY"],
base_url="https://api.velokey.ai/v1",
)
for model in client.models.list().data:
print(model.id)Храните API-ключ в серверной переменной окружения. Если model ID Kimi K3 не появляется в GET /v1/models, значит, он ещё недоступен этому аккаунту через Velokey. Продолжайте использовать проверенно доступную модель или официальный API Kimi, а не хардкодьте отсутствующий в списке ID.
Когда новая модель становится доступной, OpenAI-совместимый клиент сокращает работу по миграции. Приложению всё равно нужны оценка под конкретную модель, правила сессий и телеметрия. Совместимость интерфейса не стирает поведенческие различия.
Когда Kimi K3 стоит своих денег
Kimi K3 наиболее убедительна, когда задача дорога для человека, плохо делится на части и достаточно ценна, чтобы оправдать длинный след рассуждений: крупный рефакторинг, research-задача со многими инструментами, мультимодальный инженерный workflow или сложный набор документов, требующий длительного синтеза.
Она менее убедительна как универсальный выбор по умолчанию. Классификация, извлечение, теггирование, простое переписывание и рутинная поддержка — те области, где мультимодельный стек должен защищать бюджет.
Production-решение не должно исходить из одних лишь 2.8T. Оно должно исходить из cache-hit rate, стоимости на завершённую задачу, стабильности сессий, успеха инструментов, задержки, поведения при восстановлении и человеческих корректировок.
В этом настоящая история Kimi K3 API. Модель велика, но полезной её делает окружающая архитектура сессий.
Kimi K3 API: часто задаваемые вопросы
Kimi K3 уже полностью open source?
По состоянию на 17 июля 2026 года Moonshot заявляла, что полные веса модели будут выпущены до 27 июля. K3 уже была доступна через продукты Kimi и официальный API. Проверьте репозиторий, лицензию, model card и технический отчёт, прежде чем называть её скачиваемой в последующей статье.
Какое контекстное окно у Kimi K3?
Moonshot указывает 1,048,576 токенов. Большое окно увеличивает ёмкость, но не отменяет необходимости в retrieval, кэшировании, контроле истории и контрольных точках.
Какова официальная цена Kimi K3 API?
Moonshot указывает $0.30 за 1M входных токенов при попадании в кэш, $3.00 за 1M входных токенов при промахе кэша и $15.00 за 1M выходных токенов, без учёта применимых налогов.
Использует ли Kimi K3 все 2.8T параметров на каждом токене?
Нет. По данным Moonshot, архитектура Stable LatentMoE активирует 16 из 896 экспертов. Общее число параметров описывает ёмкость, тогда как разреженная активация ограничивает активные вычисления.
Можно ли переключать модели посреди сессии Kimi K3?
Делайте это осторожно. Moonshot предупреждает, что неполная история размышлений или переключение идущей сессии с другой модели на K3 может сделать генерацию нестабильной. Маршрутизируйте на границе сессии или перезапускайтесь с проверенной контрольной точки.
Доступна ли Kimi K3 через Velokey?
На момент проверки этой статьи 17 июля 2026 года она не значилась в каталоге. Для актуальной доступности на уровне аккаунта используйте живой каталог моделей и GET /v1/models. Не полагайтесь на статичное утверждение из блога.
Источники
- Релиз и ограничения Kimi K3
- Быстрый старт Kimi K3 API
- Официальные цены Kimi K3
- Кэширование контекста Kimi API
- Уровень размышлений Kimi K3
Раскрытие информации: Velokey публикует эту статью и предоставляет OpenAI-совместимый слой доступа к API для моделей нескольких провайдеров. На момент обзора Kimi K3 не значилась в актуальном каталоге Velokey.
Хотите подготовить один клиент под текущие и будущие модели, не выдумывая ID? Следуйте [быстрому старту Velokey](https://docs.velokey.ai/quickstart), затем выбирайте только модель, возвращённую GET /v1/models.


