GPT, Claude, Gemini — все модели через единый API. Работает в России без VPN.Начать бесплатно

Kimi K3 — что нового в архитектуре и сколько это стоит

Kimi K3Moonshot AIKimi Delta AttentionMoEBrowseCompArtificial AnalysisАгентный AI

16 июля 2026 года Moonshot AI выпустила флагман на 2.8 триллиона параметров, который занял первое место на BrowseComp и по пути переписал собственный тренировочный GPU-код за 15 часов автономной работы.

Kimi K3 — обзор нового флагмана Moonshot AI, бенчмарки Artificial Analysis, цена за токены и доступ из России

Перед релизом Kimi K3 инженеры Moonshot AI посадили пять моделей за одну и ту же задачу: ускорить настоящий тренировочный kernel компании, не меняя результат вычислений. Условия были одинаковыми для всех — изолированная песочница, до суток на эксперименты, доступ к NVIDIA H200 и GPGPU другого вендора. Kimi K3 взяла один из четырёх раундов и на кернеле AttnRes спроектировала с нуля новый двухфазный алгоритм: за 15 часов непрерывных попыток время прохода упало с 283.6 до 114.4 миллисекунды. Модель обошла GPT-5.6 Sol, GPT-5.5 и Claude Opus 4.8 и почти сравнялась с Claude Fable 5.

Kimi K3 вышла 16 июля 2026 года — 2.8 триллиона параметров, контекст на миллион токенов и новая архитектура внимания Kimi Delta Attention. Доступ идёт через приложение Kimi, веб-версию и API.

Дальше разберём, как устроена архитектура, что показывают независимые бенчмарки Artificial Analysis против Claude Fable 5, GPT-5.6 Sol и Claude Opus 4.8, сколько реально стоит балл интеллекта и что Moonshot признаёт сама — от роста доли галлюцинаций до временной приостановки новых подписок из-за нехватки мощностей.

Как Kimi K3 сама ускорила код своего обучения

В материалах релиза Moonshot описала эксперимент, которого раньше не проводил ни один конкурент в таком виде. Пяти моделям — Kimi K3, Claude Fable 5, Claude Opus 4.8, GPT-5.6 Sol и GPT-5.5 — дали одну и ту же инженерную задачу: оптимизировать четыре реальных тренировочных kernel'а компании (AttnRes, KDA, DSA и MLA с 512-мерными головами) на NVIDIA H200 и GPGPU альтернативного вендора. У каждой модели было до 24 часов, полная песочница и одно жёсткое ограничение — результат вычислений менять нельзя, речь только о скорости.

На кернеле AttnRes условия были такими: 96 слоёв, размерность модели 8192, последовательность 8192 токена, исходная реализация на Triton из библиотеки FLA. Kimi K3 за 15 часов непрерывных итераций спроектировала двухфазный алгоритм и слила несколько операций в единые кернелы, сохранив исходную численную точность. Время прямого и обратного прохода упало с 283.6 до 114.4 миллисекунды — ускорение в 2.48 раза. По итоговому результату Kimi K3 и Claude Fable 5 (с фоллбэком) финишировали почти вровень, но K3 улучшала результат быстрее на каждой отдельной итерации, а GPT-5.6 Sol, GPT-5.5 и Claude Opus 4.8 остались заметно позади.

У этой истории есть продолжение, которое Moonshot упомянула отдельно: на поздних этапах разработки K3 ранняя версия самой модели уже выполняла большую часть работы по оптимизации кернелов внутри команды. Инженеры не столько писали код руками, сколько проверяли и принимали то, что предлагала ещё не выпущенная модель — практика, которая обычно звучит как сценарий из презентации, а не как рабочий процесс конкретной лаборатории.

Архитектура на 2.8 триллиона параметров

K3 держит номинальный размер в 2.8 трлн параметров, но на каждый токен реально работают лишь 16 из 896 экспертов — эффективная стоимость инференса сопоставима с гораздо более компактной плотной моделью. Балансировку между таким количеством экспертов обеспечивает Stable LatentMoE вместе с механизмом Quantile Balancing, который распределяет токены между экспертами напрямую по квантилям их оценок, без ручных эвристик и хрупких гиперпараметров, которые обычно приходится подбирать вручную для MoE такого масштаба.

Контекст в миллион токенов держится на Kimi Delta Attention (KDA) — механизме внимания, который остаётся линейным по вычислительной стоимости там, где обычное внимание растёт квадратично с длиной последовательности. Второй новый компонент, Attention Residuals (AttnRes), отвечает за то, как модель выборочно переносит представления между слоями по глубине сети, а не накапливает их равномерно. По заявлению Moonshot, вместе эти решения дают примерно 2.5-кратный рост эффективности масштабирования по сравнению с предыдущей K2 — то есть K3 превращает то же количество вычислений в заметно больше полезного интеллекта.

Стабильность обучения при такой разреженности обеспечивают ещё несколько узкоспециализированных модулей: Per-Head Muon расширяет оптимизатор Muon так, что каждая голова внимания настраивается независимо, а Sigmoid Tanh Unit и Gated MLA управляют активациями и избирательностью внимания. Обучение идёт с учётом будущего квантования с самого этапа fine-tuning — веса модели хранятся в формате MXFP4, активации в MXFP8, что снижает требования к памяти при инференсе.

Бенчмарки без прикрас

Moonshot сравнивает K3 с четырьмя моделями, которые задают верхнюю границу рынка на июль 2026 года: Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8 и GPT-5.5, плюс GLM-5.2 как ориентир среди самых доступных по цене моделей. Вот как это выглядит на графиках Artificial Analysis по кодингу и агентным задачам.

Бенчмарки Kimi K3 по кодингу: DeepSWE, Terminal Bench 2.1, Program Bench, FrontierSWE, Kimi Code Bench 2.0 и SWE Marathon в сравнении с Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 и GLM-5.2
Бенчмарки кодинга. Kimi K3 берёт первое место на Program Bench и SWE Marathon. Источник: Artificial Analysis.
Бенчмарки Kimi K3 по агентным задачам и работе со знаниями: GDPval-AA v2, JobBench, AA-Briefcase, SpreadsheetBench 2, Automation Bench, BrowseComp, CharXiv и Zerobench
Общие и визуальные агенты. Kimi K3 лидирует на BrowseComp, SpreadsheetBench 2 и Automation Bench. Источник: Artificial Analysis.

Ниже — та же картина в виде сводной таблицы, с точными числами по каждому бенчмарку. Синим выделена Kimi K3, жирным — лучший результат в строке.

БенчмаркKimi K3Fable 5GPT-5.6 SolOpus 4.8GPT-5.5GLM-5.2
Кодинг
DeepSWE 1.167.570.073.059.067.046.2
FrontierSWE81.286.671.366.764.967.3
Kimi Code Bench 2.072.976.964.871.769.064.2
Terminal-Bench 2.188.384.688.884.683.482.7
Program Bench77.876.877.671.970.863.7
SWE Marathon42.035.039.040.014.013.0
Агенты и работа со знаниями
GDPval-AA v2 (Elo)166817601748160014941514
JobBench52.957.446.548.438.343.4
AA-Briefcase (Elo)154815831495135411581260
SpreadsheetBench 234.834.732.431.629.128.1
Automation Bench30.829.129.727.222.712.9
BrowseComp91.288.090.484.384.4
Визуальные агенты
CharXiv (RQ) w/tool91.393.589.189.989.0
Zerobench w/tool (Pass@5)41.046.035.034.041.0
Таблица 1. Независимые замеры Artificial Analysis, режим максимального рассуждения для всех моделей. Синим — Kimi K3, жирным — лучший результат в строке.

Из четырнадцати строк таблицы K3 занимает первое место в пяти — Program Bench, SWE Marathon, SpreadsheetBench 2, Automation Bench и BrowseComp — и почти везде остаётся в тройке лучших. Модель уступает Terminal-Bench 2.1 всего 0.5 балла и FrontierSWE — 5.4 балла лидеру Claude Fable 5. По общему индексу интеллекта Artificial Analysis, композитной оценке из девяти замеров, K3 набирает 57 баллов и занимает третье-четвёртое место среди 189 протестированных моделей — позади Claude Fable 5 (60) и GPT-5.6 Sol (59), но заметно опережая GLM-5.2 (51).

Сколько стоит балл интеллекта

Официальная цена API — $3.00 за 1M входных токенов на кэш-промахе, $0.30 при кэш-хите и $15.00 за 1M выходных, флат по всему окну в 1 048 576 токенов без надбавки за длину контекста. По методологии Artificial Analysis, которая считает стоимость выполнения задачи, а не токена, K3 обходится в $0.95 за задачу на Intelligence Index — дешевле GPT-5.6 Sol ($1.04) и Claude Opus 4.8 ($1.80), но дороже открытой GLM-5.2 ($0.47).

Разница становится нагляднее на конкретных бенчмарках. На BrowseComp Kimi K3 в режиме максимального рассуждения достигает результата около 91% при цене порядка $2–4 за задачу. Claude Opus 4.8 на том же бенчмарке в максимальном режиме тратит около $25.5 за задачу и получает 84.4% — почти в семь раз дороже за более слабый результат.

График BrowseComp: результат против цены за задачу для Kimi K3, GPT-5.6 Sol, Claude Mythos 5, Claude Opus 4.8 и Claude Sonnet 5
BrowseComp — результат против цены за задачу. Kimi K3 занимает верхний левый угол графика: высокий балл при низкой цене. Источник: Artificial Analysis.

На Kimi Code Bench V2 картина похожая: Kimi K3 в режиме max набирает 72.3% за $4 за задачу, тогда как Claude Opus 4.8 тратит $6.5 за 71% — Kimi K3 обходится дешевле и при этом чуть точнее. Claude Fable 5 в максимальном режиме доходит до 77.5%, но при цене около $10.3 за задачу, в 2.5 раза больше, чем у K3.

График Kimi Code Bench V2: результат против цены за задачу для Kimi K3, GLM-5.2, Claude Opus 4.8 и Claude Fable 5
Kimi Code Bench V2 — результат против цены за задачу. При цене $4 Kimi K3 обходит Claude Opus 4.8, который стоит $6.5 за задачу. Источник: Kimi Code / Moonshot AI.

Есть и обратная сторона. Скорость генерации у K3, по замерам Artificial Analysis, — около 33 токена в секунду, заметно ниже, чем у большинства конкурентов. А на полном прогоне Intelligence Index модель израсходовала 130 миллионов выходных токенов — Artificial Analysis прямо называет K3 многословной и достаточно дорогой в расчёте на реальную сессию, а не на изолированный тестовый прогон.

Что Moonshot признаёт сама

Раздел ограничений в техническом блоге K3 написан необычно прямо для релизного материала. Moonshot пишет, что модель обучена с расчётом на сохранённую историю рассуждений между шагами агента: если харнесс обрезает или теряет цепочку мыслей, качество ответов может стать «крайне нестабильным». Отдельно компания признаёт, что K3 «избыточно проактивна» в неоднозначных задачах — модель предпочитает действовать сама, а не уточнять у пользователя, что именно нужно сделать. В том же разделе Moonshot соглашается, что разговорный UX у K3 пока уступает Claude Fable 5 и GPT-5.6 Sol.

По данным Artificial Analysis, на бенчмарке фактической точности AA-Omniscience доля галлюцинаций у K3 выросла примерно до 51% против 39% у предыдущей K2.6, хотя доля правильных ответов среди тех случаев, где модель не галлюцинирует, тоже подросла — с 33% до 46%. Модель стала точнее там, где отвечает верно, но заметно хуже понимает, когда стоит остановиться и признать неуверенность.

20 июля, спустя четыре дня после запуска, Moonshot временно приостановила регистрацию новых платных подписок — по данным Reuters, спрос на K3 превысил доступные вычислительные мощности. Успех запуска обернулся дефицитом инференса, а не проблемой с качеством ответов.

Доступ к Kimi K3 из России

Прямая оплата API Moonshot AI из России затруднена — платформа требует верификацию через китайский номер телефона или банковскую карту. AITUNNEL открывает доступ к Kimi K3 через единый OpenAI-совместимый API с оплатой в рублях, без VPN и обхода блокировок.

Регистрация занимает пару минут: заводите аккаунт, пополняете баланс, получаете ключ вида sk-aitunnel- и меняете base_url на https://api.aitunnel.ru/v1/. Модель указывается как moonshotai/kimi-k3 — стриминг, вызов инструментов и работа с изображениями переносятся из существующего кода на OpenAI SDK без изменений.

Kimi K3

Флагман Moonshot AI
16 июля 2026Контекст: 1 048 576 токеновВывод: 131 072 токена по умолчанию, до 1M настраивается

MoE-модель на 2.8 трлн параметров, из которых на каждый токен эффективно активны 16 из 896 экспертов. Построена на Kimi Delta Attention и Attention Residuals — паре архитектурных решений, которые держат вычисления линейными на длинном контексте и стабилизируют обучение сети такой разреженности. Контекст 1M токенов, рассуждение включено по умолчанию (режим max), нативная работа с изображениями и видео. Заняла первое место на BrowseComp и в WebDev Code Arena, при этом по общему индексу интеллекта Artificial Analysis идёт следом за Claude Fable 5 и GPT-5.6 Sol.

Ключевые преимущества

  • 91.2% на BrowseComp — лучший результат среди всех протестированных моделей
  • 77.8 балла на Program Bench и 30.8 на Automation Bench — первое место по обеим метрикам
  • 42.0 на SWE Marathon (многочасовая инженерная работа) против 40.0 у Claude Opus 4.8 и 39.0 у GPT-5.6 Sol
  • 88.3 на Terminal-Bench 2.1 — уступает только GPT-5.6 Sol (88.8)
  • Самостоятельно спроектировала новый алгоритм GPU-kernel и ускорила его в 2.48 раза за 15 часов без участия инженеров

Подходит для

  • Многошаговый поиск и браузинг информации в интернете
  • Автоматизация рабочих процессов в бизнес-софте и таблицах
  • Терминальные и системные агентные задачи
  • Многочасовые инженерные проекты, где агент работает без постоянного контроля
Ввод / 1M600 ₽
Вывод / 1M3000 ₽
Подробнее о модели

Итог

Kimi K3 запомнится не только цифрами в таблицах, хотя они сильные — первое место на BrowseComp, Program Bench и Automation Bench, третье-четвёртое место в общем индексе интеллекта Artificial Analysis среди 189 моделей. Запомнится история о том, как модель за 15 часов автономной работы спроектировала новый алгоритм для собственного тренировочного kernel'а и ускорила его в 2.48 раза, обогнав GPT-5.6 Sol, GPT-5.5 и Claude Opus 4.8. У модели остаются реальные оговорки: рост доли галлюцинаций до 51%, невысокая скорость генерации, зависимость от сохранности истории рассуждений в агентном харнессе и временная приостановка новых подписок из-за нехватки мощностей уже через четыре дня после запуска. Доступ к модели идёт через приложение Kimi, веб-версию и API, а AITUNNEL даёт такой доступ из России без VPN и с оплатой в рублях.

Часто задаваемые вопросы

Когда вышла Kimi K3 и где она доступна

Moonshot AI выпустила Kimi K3 16 июля 2026 года. Модель доступна через приложение Kimi, веб-версию kimi.com, Kimi Code и API.

Правда ли что Kimi K3 сама ускорила код своего обучения

Да. В рамках теста Moonshot дала пяти моделям задачу оптимизировать реальный тренировочный GPU-kernel без права менять результат вычислений. На кернеле AttnRes (96 слоёв, размерность 8192, последовательность 8192 токена) Kimi K3 за 15 часов автономных итераций спроектировала новый двухфазный алгоритм и сократила время прохода с 283.6 до 114.4 миллисекунды — ускорение в 2.48 раза, обогнав по этой задаче GPT-5.6 Sol, GPT-5.5 и Claude Opus 4.8.

Насколько Kimi K3 умнее закрытых флагманов вроде Claude Fable 5 и GPT-5.6 Sol

По независимому индексу интеллекта Artificial Analysis K3 набирает 57 баллов и идёт следом за Claude Fable 5 (60) и GPT-5.6 Sol (59), опережая при этом лучшую открытую модель до своего релиза, GLM-5.2 (51). При этом K3 занимает первое место на BrowseComp, Program Bench, SWE Marathon, SpreadsheetBench 2 и Automation Bench — конкретных бенчмарках, где модель обходит обоих закрытых лидеров.

Сколько стоит Kimi K3 в API

Официальная цена — $3.00 за 1M входных токенов на кэш-промахе, $0.30 при кэш-хите и $15.00 за 1M выходных, без надбавки за длину контекста вплоть до 1 048 576 токенов. По методологии Artificial Analysis стоимость одной выполненной задачи на Intelligence Index — $0.95, дешевле GPT-5.6 Sol и Claude Opus 4.8, но дороже открытой GLM-5.2.

Правда что у Kimi K3 выросли галлюцинации

Да, по данным бенчмарка фактической точности AA-Omniscience от Artificial Analysis доля галлюцинаций выросла примерно до 51% против 39% у предыдущей K2.6. Одновременно доля правильных ответов среди негаллюцинирующих случаев выросла с 33% до 46% — модель точнее там, где отвечает уверенно, но хуже определяет момент, когда стоит признать неуверенность.

Как подключить Kimi K3 из России без VPN

Через AITUNNEL: регистрируетесь, пополняете баланс в рублях, получаете ключ вида sk-aitunnel- и меняете base_url на "https://api.aitunnel.ru/v1/". Модель указывается как moonshotai/kimi-k3, остальной код на OpenAI SDK, включая стриминг и вызов инструментов, работает без изменений. Прямая оплата API Moonshot AI из России осложнена требованием китайского номера телефона или карты — AITUNNEL решает эту проблему без обхода блокировок.

Доступ к этому провайдеру через AITUNNEL

Все модели провайдера доступны через единый API. Работает из России без VPN, оплата в рублях.

Единый APIОплата картой РФБез VPN
Начать работуРегистрация за 1 минуту

Статьи по теме

Qwen11 мая 2026 г.

Модели Qwen — Обзор и сравнение моделей

QwenAlibabaOpen Source

Рынок языковых моделей в 2025–2026 году развивается с такой скоростью, что даже опытные разработчики успевают за новинками с трудом. Если год назад выбор сводил

Читать
ПопробоватьВсе модели