Что такое Kimi K3? Бенчмарки, цены, контекстное окно и планы по открытому весу
Kimi K3 — это новая флагманская модель Moonshot AI для долгосрочного кодирования, агентной работы со знаниями, визуального понимания и глубоких рассуждений. Анонсированная 16 июля 2026 года, она сочетает в себе архитектуру Mixture-of-Experts с 2,8 триллионами параметров, контекстное окно в один миллион токенов и необычайно разреженную схему маршрутизации.
Заявленные характеристики впечатляют, но детали имеют значение. Самые сильные результаты бенчмарков в настоящее время получены в ходе собственной оценки Moonshot при запуске, вывод API значительно дороже, чем у предыдущих моделей Kimi, а обещанные загружаемые веса еще не были доступны на момент публикации этой статьи 23 июля 2026 года. Это руководство разделяет то, что уже можно использовать, от того, что остается планом выпуска.
Ключевые выводы
- Kimi K3 — это многомодальная модель MoE с 2.8T параметрами , которая активирует 16 из 896 маршрутизируемых экспертов для каждого токена.
- Контекстное окно составляет 1 048 576 токенов , с автоматическим кэшированием префиксов и без более высокого уровня цен API для более длинных подсказок.
- Официальная цена API составляет $0.30 за миллион входных токенов с попаданием в кэш, $3.00 за миллион некэшированных входных токенов и $15.00 за миллион выходных токенов.
- Moonshot сообщает о ведущих или почти ведущих результатах по нескольким бенчмаркам в области кодирования, просмотра веб-страниц, работы с электронными таблицами, автоматизации и визуальных агентов, хотя настройки оценки не совпадают для разных моделей.
- Веса планировалось выпустить к 27 июля 2026 года. По состоянию на 23 июля контрольная точка, окончательная лицензия, размеры файлов и практические инструкции по развертыванию для сообщества еще не были доступны для ознакомления.
Что такое Kimi K3?
Kimi K3 — преемник поколения Kimi K2 от Moonshot AI и самая большая модель компании на сегодняшний день. Moonshot описывает ее как первую открытую модель в классе с тремя триллионами параметров. Она разработана не столько как легкая чат-модель, сколько как постоянно рассуждающий агент, способный поддерживать состояние на протяжении длительных рабочих процессов в области инженерии, исследований, документов и использования инструментов.
Модель изначально многомодальна. Она принимает текст, изображения и видео через поддерживаемые продукты Kimi и входные форматы API, затем генерирует текст и вызовы инструментов. Moonshot позиционирует K3 вокруг трех основных рабочих нагрузок: долгосрочная разработка программного обеспечения, сквозная работа со знаниями и задачи, которые сочетают визуальную обратную связь с кодом или структурированными инструментами.
Kimi K3 доступна через Kimi.com, мобильные приложения Kimi, Kimi Work, Kimi Code и Kimi API. Разработчики используют идентификатор модели API kimi-k3. Документация API гласит, что флагманский доступ разблокируется после успешного пополнения счета на сумму не менее 1 доллара, а ограничения скорости определяются уровнем учетной записи.
Читатели, которым требуется более широкие сведения о семействе продуктов, могут начать с руководства Zerlo по Kimi AI и Moonshot AI. . K3 — это выпуск модели; Kimi — это более широкая экосистема помощника, приложения и разработчиков.
Архитектура Kimi K3: почему 2.8 триллиона параметров не означают 2.8 триллиона активных параметров
Kimi K3 использует разреженную архитектуру Mixture-of-Experts. Сеть содержит 896 маршрутизируемых экспертов, но для каждого токена выбирается только 16. Это позволяет модели хранить очень большой объем специализированной мощности без запуска каждого эксперта на каждом прямом проходе. Полная контрольная точка все равно должна храниться и распределяться по кластеру инференции, поэтому разреженная активация уменьшает вычисления больше, чем уменьшает проблему хранения.
Moonshot выделяет четыре архитектурных компонента:
- Kimi Delta Attention (KDA): механизм линейного внимания, используемый в трех из каждых четырех слоев внимания для повышения эффективности обработки длинных последовательностей.
- Вентилируемое Многоголовое Скрытое Внимание: четвертый слой в цикле сохраняет полное глобальное внимание для точного извлечения информации.
- Остатки Внимания: блоки могут выборочно извлекать представления из более ранних глубин вместо того, чтобы полагаться только на один непрерывно накапливаемый остаточный поток.
- Стабильный LatentMoE: инфраструктура маршрутизации экспертов, которая поддерживает чрезвычайно разреженную конфигурацию из 16 экспертов из 896.
Компания заявляет, что эти изменения, в сочетании с обновленными методами обучения и рецептами данных, обеспечивают примерно в 2,5 раза большую общую эффективность масштабирования Kimi K2. Эта цифра является заявлением Moonshot, а не независимо воспроизведенным измерением. K3 также использует обучение с учетом квантования с весами MXFP4 и активациями MXFP8, а Moonshot рекомендует развертывания суперузлов с как минимум 64 ускорителями.
Простой расчет хранилища иллюстрирует масштаб. При четырех битах на параметр 2,8 триллиона параметров представляют около 1,4 терабайта необработанных данных весов до учета метаданных, структур маршрутизации, буферов времени выполнения, кэша KV, избыточности и накладных расходов фреймворка. Вот почему будущий выпуск с открытым исходным кодом будет ценен для исследователей и хостинговых компаний, но не сделает Kimi K3 обычной моделью для настольного компьютера.
Бенчмарки Kimi K3
Предстартовые материалы Moonshot сравнивают Kimi K3 с GPT-5.6 Sol, GPT-5.5, Claude Fable 5, Claude Opus 4.8 и GLM-5.2. Собственный итог компании относительно сдержан: K3 все еще отстает от самых мощных проприетарных систем в целом, но достигает пограничного уровня производительности и лидирует во многих отдельных задачах.
| Бенчмарк | Оценка Kimi K3 | Позиция в стартовой таблице Moonshot |
|---|---|---|
| DeepSWE | 67.5 | Отстает от GPT-5.6 Sol и Claude Fable 5 |
| Terminal Bench 2.1 | 88.3 | Второе место, 0.5 балла отставание от GPT-5.6 Sol |
| Program Bench | 77.8 | Самый высокий заявленный балл в таблице |
| SWE Marathon | 42.0 | Самый высокий заявленный балл в таблице |
| FrontierSWE | 81.2 | Второе место после Claude Fable 5 |
| BrowseComp | 91.2 | Самый высокий заявленный балл в таблице |
| SpreadsheetBench 2 | 34.8 | Лидирует на 0,1 балла над Claude Fable 5 |
| AutomationBench | 30.8 | Самый высокий заявленный балл в таблице |

Источник: kimi.com
Moonshot сообщает об особенно сильных результатах агентов-кодеров. K3 лидирует в Program Bench и SWE Marathon в стартовой таблице, занимая при этом высокие места в Terminal Bench 2.1 и FrontierSWE.
Как читать заявления о бенчмарках
Эти цифры не следует рассматривать как идеально контролируемый рейтинг. Moonshot использовал Kimi Code, Claude Code или Codex в зависимости от бенчмарка. Некоторые результаты конкурентов получены из официальных таблиц лидеров или публикаций о выпуске, в то время как другие модели были повторно запущены Moonshot. В стартовой таблице также отмечается возможное запасное поведение для Claude Fable 5 и прерывания защитных механизмов для GPT-5.6 Sol в некоторых задачах.
Все результаты K3 были получены при максимальном усилии рассуждения. Эта настройка может улучшить качество, но также может увеличить задержку и потребление выходных токенов. Несколько оценок являются внутренними, включая Kimi Code Bench 2.0 и части оценки работы со знаниями. Пока веса и инструменты оценки не будут общедоступны, сторонние компании не смогут полностью воспроизвести полный набор результатов.
Поэтому наиболее полезное прочтение — не «K3 превосходит каждую закрытую модель». Лучший вывод состоит в том, что K3 кажется очень конкурентоспособной для долгосрочного кодирования и рабочих процессов агентов, с выдающимися собственными результатами в области программной инженерии, просмотра веб-страниц, автоматизации, электронных таблиц и задач с визуальными документами. Реальное качество продукта по-прежнему будет зависеть от следования инструкциям, задержки, интеграции инструментов, поведения безопасности и стабильности в течение длительных сеансов.

Источник: kimi.com
K3 также демонстрирует сильные результаты в день запуска за пределами чистого кодирования, включая первое место в показанных сравнениях BrowseComp, AutomationBench и SpreadsheetBench 2.
Цены на Kimi K3
Официальный API Kimi использует три тарифа токенов. Цены не включают налоги и используют один миллион десятичных токенов в качестве расчетной единицы.
| Категория токенов | Цена за 1М токенов | Когда применяется |
|---|---|---|
| Вход с попаданием в кэш | $0.30 | Повторяющийся префикс запроса обслуживается из автоматического кэша контекста Kimi |
| Вход без попадания в кэш | $3.00 | Новый или измененный ввод, который должен быть обработан обычным образом |
| Вывод | $15.00 | Сгенерированные рассуждения и токены ответов, тарифицируемые как вывод |
K3 имеет фиксированное ценообразование за токен в пределах своего контекстного диапазона. Нет отдельной надбавки, как только запрос превышает порог в 200 тысяч или аналогичный. Однако длинные запросы по-прежнему могут быть дорогими в абсолютном выражении, а постоянно думающая модель может генерировать значительный объем вывода. Запрос с одним миллионом некэшированных входных токенов обойдется в 3 доллара до вывода; тот же кэшированный префикс обойдется в 0,30 доллара.
Автоматическое кэширование не требует идентификатора кэша или отдельной настройки API. Документация гласит, что предыдущий запрос должен превышать 256 токенов, а последующие запросы должны сохранять длинный префикс без изменений, чтобы иметь шанс попасть в кэш. Это делает K3 более экономичным для многократного анализа одного и того же репозитория, коллекции документов или базы знаний, чем для постоянно меняющихся одноразовых запросов.
Насколько велико контекстное окно Kimi K3?
Kimi K3 поддерживает контекст размером 1 048 576 токенов. На практике это может вмещать очень большие кодовые базы, обширные коллекции документов, длинные истории агентов или комбинации текстовых и визуальных вводов. Точное количество слов, страниц или файлов варьируется, потому что токенизация зависит от языка, форматирования, исходного кода и встроенных данных.
В документации API указано значение max_completion_tokens по умолчанию 131 072, и его можно увеличить до 1 048 576. Этот верхний предел не следует интерпретировать как рекомендацию генерировать ответы длиной в миллион токенов. Это, прежде всего, архитектурный потолок для необычно длинных рабочих процессов.
Большое контекстное окно также не гарантирует идеальной памяти. Moonshot прямо предупреждает, что K3 был обучен сохранять свою историю мышления. Рамки агента должны передавать полное сообщение помощника обратно в последующие шаги. Отказ от истории рассуждений, переключение моделей в середине сессии или использование несовместимого инструмента может сделать качество генерации нестабильным.
Является ли Kimi K3 открытым исходным кодом или открытым весом?
Moonshot называет Kimi K3 «открытой» и «открытой исходной» моделью класса трех триллионов, но время имеет решающее значение. Компания объявила, что полные веса будут выпущены к 27 июля 2026 года вместе с более подробными техническими деталями. Эта статья была опубликована за четыре дня до этого срока.
По состоянию на 23 июля K3 была доступна через продукты Kimi и официальный API, но полная контрольная точка еще не была указана на публичной странице Moonshot в Hugging Face. Окончательная лицензия модели, шары весов, контрольные суммы, точный объем хранения, поддерживаемые механизмы вывода и проверенные сообществом процедуры развертывания, следовательно, еще не могли быть проверены.
Точное описание на момент публикации – проприетарная хостинговая модель с обещанным выпуском открытого веса. После появления контрольной точки лицензия определит, разрешено ли коммерческое использование, модификация, перераспределение и хостинговые услуги. Открытые веса не означают автоматически, что также будут опубликованы обучающие данные, полный обучающий код или воспроизводимый обучающий конвейер.
Это различие более подробно рассмотрено в обзоре Zerlo Экосистемы открытого AI в Китае. . K3 также является полезным сравнением масштаба с GLM-5 и его агентским подходом к кодированию с открытым весом.
Где можно использовать Kimi K3?
- Kimi.com и мобильные приложения: доступ для потребителей через веб-сайт и текущие приложения для iOS, Android и HarmonyOS.
- Kimi Work: настольная среда для работы со знаниями, с поддержкой K3 в версии 3.1.0 или более поздней для Windows и Mac на базе Apple silicon.
- Kimi Code: доступ к кодированию на основе терминала, где пользователи выбирают K3 через меню модели.
- Kimi API: совместимый с OpenAI доступ для разработчиков с использованием идентификатора модели kimi-k3.
- Kimi Enterprise: корпоративные учетные записи с функциями конфиденциальности предприятия и управления участниками.
- Самостоятельный хостинг: планируется после выпуска веса, но для реалистичного развертывания потребуется крупная инфраструктура с несколькими ускорителями.
Кому стоит рассмотреть Kimi K3?
K3 наиболее привлекателен для команд, которым нужен агент для работы с необычайно большими наборами данных: сложными репозиториями, длинными техническими историями, большими коллекциями PDF, исследованиями с большим объемом данных, рабочими процессами визуального программного обеспечения или повторяющимися запросами к стабильной базе знаний. Его кэшированное ценообразование разработано для поощрения такого повторяющегося шаблона префиксов.
Он менее очевидно подходит для коротких, недорогих чат-завершений. Модель всегда рассуждает, вывод стоит 15 долларов за миллион токенов, а выполнение с максимальными усилиями может быть медленнее, чем у легкой нерассуждающей модели. Команды должны сравнивать общую стоимость задачи, а не только цену ввода: повторные попытки, длинные трассировки рассуждений, вызовы инструментов и время выполнения агента могут иметь большее значение, чем заявленная ставка токенов.
Организациям, заинтересованным в первую очередь в открытом развертывании, следует дождаться фактического выпуска весов и лицензии, прежде чем принимать решения по инфраструктуре или соблюдению требований. Даже если контрольная точка имеет разрешительную лицензию, модель объемом 2.8T, скорее всего, будет потребляться через специализированных провайдеров инференции, а не загружаться на обычные рабочие станции.
Ограничения и открытые вопросы
- Независимая проверка не завершена: полная контрольная точка не была публичной на дату публикации.
- Настройки бенчмарков различаются: различные системы и цитируемые сторонние оценки ограничивают прямую сравнимость.
- Постоянные рассуждения могут увеличить стоимость и задержку: меньшие усилия могут помочь, но это не эквивалентно недумающему режиму.
- Стабильность длительных сессий зависит от обработки истории: Moonshot предостерегает от отбрасывания истории мышления или переключения моделей в середине сессии.
- Модель может быть чрезмерно проактивной: в документации по запуску рекомендуется устанавливать явные поведенческие ограничения для приложений, которые не должны импровизировать за узкие рамки.
- Самостоятельный хостинг — это кластерный проект: разреженная активация не устраняет необходимость хранения и распределения огромной контрольной точки.
FAQ
Что такое Kimi K3?
Kimi K3 — это флагманская мультимодальная модель Moonshot AI с 2.8 триллионами параметров. Она предназначена для долгосрочного кодирования, исследований, использования инструментов, визуальных рассуждений и работы со знаниями, с контекстным окном в один миллион токенов.
Сколько стоит Kimi K3 API?
Официальная ставка составляет $0.30 за миллион входных токенов, попавших в кэш, $3.00 за миллион некэшированных входных токенов и $15.00 за миллион выходных токенов, без учета применимых налогов.
Каково контекстное окно Kimi K3?
Kimi K3 поддерживает контекст в 1 048 576 токенов. По умолчанию API устанавливает максимальный лимит завершения в 131 072 токена, который может быть увеличен до 1 048 576 для специализированных рабочих нагрузок.
Доступен ли Kimi K3 на Hugging Face?
На момент публикации 23 июля 2026 года еще нет. Moonshot заявила, что полные веса будут выпущены к 27 июля. Официальную страницу организации Hugging Face следует проверить еще раз после этой даты.
Может ли Kimi K3 работать локально?
Это не является практической локальной моделью для потребительского оборудования. Грубый расчет веса в четыре бита составляет около 1,4 ТБ только до накладных расходов во время выполнения, и Moonshot рекомендует конфигурации развертывания с как минимум 64 ускорителями.
Kimi K3 лучше, чем GPT или Claude?
По данным запуска нельзя установить однозначного победителя. K3 лидирует в нескольких отчетах по кодированию и агентским бенчмаркам, хотя Moonshot сама заявляет, что модель все еще отстает от сильнейших проприетарных систем в целом. Более информативным будет независимое тестирование после выпуска веса.
Поддерживает ли Kimi K3 изображения и видео?
Да. K3 обладает встроенным визуальным пониманием и поддерживает ввод изображений и видео через документированные продукты Kimi и форматы API. API требует поддерживаемых форматов загружаемых файлов или закодированных входов, а не произвольных публичных URL-адресов изображений.
Итог
Kimi K3 — один из самых амбициозных запусков моделей ИИ 2026 года: разреженная MoE с 2,8 Т параметрами, встроенным зрением, контекстным окном в один миллион токенов, сильными собственными бенчмарками в области кодирования и агентов, а также конкурентоспособными ценами на кэшированный ввод. Она уже доступна как хостинговая модель, но история с открытым весом 23 июля была еще обещанием, а не загружаемой, лицензированной контрольной точкой.
Разработчики могут оценить API сейчас, особенно для повторяющихся рабочих процессов с длинным контекстом, которые выигрывают от автоматического кэширования. Исследователям и командам по инфраструктуре следует дождаться выпуска весов 27 июля, а затем проверить лицензию, файлы модели, поддерживаемые стеки обслуживания и независимые результаты бенчмарков, прежде чем рассматривать K3 как готовое к производству развертывание с открытым весом.