16 июля 2026 года Moonshot AI выпустила флагман на 2.8 триллиона параметров, который занял первое место на BrowseComp и по пути переписал собственный тренировочный GPU-код за 15 часов автономной работы.
Перед релизом Kimi K3 инженеры Moonshot AI посадили пять моделей за одну и ту же задачу: ускорить настоящий тренировочный kernel компании, не меняя результат вычислений. Условия были одинаковыми для всех — изолированная песочница, до суток на эксперименты, доступ к NVIDIA H200 и GPGPU другого вендора. Kimi K3 взяла один из четырёх раундов и на кернеле AttnRes спроектировала с нуля новый двухфазный алгоритм: за 15 часов непрерывных попыток время прохода упало с 283.6 до 114.4 миллисекунды. Модель обошла GPT-5.6 Sol, GPT-5.5 и Claude Opus 4.8 и почти сравнялась с Claude Fable 5.
Kimi K3 вышла 16 июля 2026 года — 2.8 триллиона параметров, контекст на миллион токенов и новая архитектура внимания Kimi Delta Attention. Доступ идёт через приложение Kimi, веб-версию и API.
Дальше разберём, как устроена архитектура, что показывают независимые бенчмарки Artificial Analysis против Claude Fable 5, GPT-5.6 Sol и Claude Opus 4.8, сколько реально стоит балл интеллекта и что Moonshot признаёт сама — от роста доли галлюцинаций до временной приостановки новых подписок из-за нехватки мощностей.
Как Kimi K3 сама ускорила код своего обучения
В материалах релиза Moonshot описала эксперимент, которого раньше не проводил ни один конкурент в таком виде. Пяти моделям — Kimi K3, Claude Fable 5, Claude Opus 4.8, GPT-5.6 Sol и GPT-5.5 — дали одну и ту же инженерную задачу: оптимизировать четыре реальных тренировочных kernel'а компании (AttnRes, KDA, DSA и MLA с 512-мерными головами) на NVIDIA H200 и GPGPU альтернативного вендора. У каждой модели было до 24 часов, полная песочница и одно жёсткое ограничение — результат вычислений менять нельзя, речь только о скорости.
На кернеле AttnRes условия были такими: 96 слоёв, размерность модели 8192, последовательность 8192 токена, исходная реализация на Triton из библиотеки FLA. Kimi K3 за 15 часов непрерывных итераций спроектировала двухфазный алгоритм и слила несколько операций в единые кернелы, сохранив исходную численную точность. Время прямого и обратного прохода упало с 283.6 до 114.4 миллисекунды — ускорение в 2.48 раза. По итоговому результату Kimi K3 и Claude Fable 5 (с фоллбэком) финишировали почти вровень, но K3 улучшала результат быстрее на каждой отдельной итерации, а GPT-5.6 Sol, GPT-5.5 и Claude Opus 4.8 остались заметно позади.
У этой истории есть продолжение, которое Moonshot упомянула отдельно: на поздних этапах разработки K3 ранняя версия самой модели уже выполняла большую часть работы по оптимизации кернелов внутри команды. Инженеры не столько писали код руками, сколько проверяли и принимали то, что предлагала ещё не выпущенная модель — практика, которая обычно звучит как сценарий из презентации, а не как рабочий процесс конкретной лаборатории.
Архитектура на 2.8 триллиона параметров
K3 держит номинальный размер в 2.8 трлн параметров, но на каждый токен реально работают лишь 16 из 896 экспертов — эффективная стоимость инференса сопоставима с гораздо более компактной плотной моделью. Балансировку между таким количеством экспертов обеспечивает Stable LatentMoE вместе с механизмом Quantile Balancing, который распределяет токены между экспертами напрямую по квантилям их оценок, без ручных эвристик и хрупких гиперпараметров, которые обычно приходится подбирать вручную для MoE такого масштаба.
Контекст в миллион токенов держится на Kimi Delta Attention (KDA) — механизме внимания, который остаётся линейным по вычислительной стоимости там, где обычное внимание растёт квадратично с длиной последовательности. Второй новый компонент, Attention Residuals (AttnRes), отвечает за то, как модель выборочно переносит представления между слоями по глубине сети, а не накапливает их равномерно. По заявлению Moonshot, вместе эти решения дают примерно 2.5-кратный рост эффективности масштабирования по сравнению с предыдущей K2 — то есть K3 превращает то же количество вычислений в заметно больше полезного интеллекта.
Стабильность обучения при такой разреженности обеспечивают ещё несколько узкоспециализированных модулей: Per-Head Muon расширяет оптимизатор Muon так, что каждая голова внимания настраивается независимо, а Sigmoid Tanh Unit и Gated MLA управляют активациями и избирательностью внимания. Обучение идёт с учётом будущего квантования с самого этапа fine-tuning — веса модели хранятся в формате MXFP4, активации в MXFP8, что снижает требования к памяти при инференсе.
Бенчмарки без прикрас
Moonshot сравнивает K3 с четырьмя моделями, которые задают верхнюю границу рынка на июль 2026 года: Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8 и GPT-5.5, плюс GLM-5.2 как ориентир среди самых доступных по цене моделей. Вот как это выглядит на графиках Artificial Analysis по кодингу и агентным задачам.
Бенчмарки кодинга. Kimi K3 берёт первое место на Program Bench и SWE Marathon. Источник: Artificial Analysis.
Общие и визуальные агенты. Kimi K3 лидирует на BrowseComp, SpreadsheetBench 2 и Automation Bench. Источник: Artificial Analysis.
Ниже — та же картина в виде сводной таблицы, с точными числами по каждому бенчмарку. Синим выделена Kimi K3, жирным — лучший результат в строке.
Бенчмарк
Kimi K3
Fable 5
GPT-5.6 Sol
Opus 4.8
GPT-5.5
GLM-5.2
Кодинг
DeepSWE 1.1
67.5
70.0
73.0
59.0
67.0
46.2
FrontierSWE
81.2
86.6
71.3
66.7
64.9
67.3
Kimi Code Bench 2.0
72.9
76.9
64.8
71.7
69.0
64.2
Terminal-Bench 2.1
88.3
84.6
88.8
84.6
83.4
82.7
Program Bench
77.8
76.8
77.6
71.9
70.8
63.7
SWE Marathon
42.0
35.0
39.0
40.0
14.0
13.0
Агенты и работа со знаниями
GDPval-AA v2 (Elo)
1668
1760
1748
1600
1494
1514
JobBench
52.9
57.4
46.5
48.4
38.3
43.4
AA-Briefcase (Elo)
1548
1583
1495
1354
1158
1260
SpreadsheetBench 2
34.8
34.7
32.4
31.6
29.1
28.1
Automation Bench
30.8
29.1
29.7
27.2
22.7
12.9
BrowseComp
91.2
88.0
90.4
84.3
84.4
—
Визуальные агенты
CharXiv (RQ) w/tool
91.3
93.5
89.1
89.9
89.0
—
Zerobench w/tool (Pass@5)
41.0
46.0
35.0
34.0
41.0
—
Таблица 1. Независимые замеры Artificial Analysis, режим максимального рассуждения для всех моделей. Синим — Kimi K3, жирным — лучший результат в строке.
Из четырнадцати строк таблицы K3 занимает первое место в пяти — Program Bench, SWE Marathon, SpreadsheetBench 2, Automation Bench и BrowseComp — и почти везде остаётся в тройке лучших. Модель уступает Terminal-Bench 2.1 всего 0.5 балла и FrontierSWE — 5.4 балла лидеру Claude Fable 5. По общему индексу интеллекта Artificial Analysis, композитной оценке из девяти замеров, K3 набирает 57 баллов и занимает третье-четвёртое место среди 189 протестированных моделей — позади Claude Fable 5 (60) и GPT-5.6 Sol (59), но заметно опережая GLM-5.2 (51).
Сколько стоит балл интеллекта
Официальная цена API — $3.00 за 1M входных токенов на кэш-промахе, $0.30 при кэш-хите и $15.00 за 1M выходных, флат по всему окну в 1 048 576 токенов без надбавки за длину контекста. По методологии Artificial Analysis, которая считает стоимость выполнения задачи, а не токена, K3 обходится в $0.95 за задачу на Intelligence Index — дешевле GPT-5.6 Sol ($1.04) и Claude Opus 4.8 ($1.80), но дороже открытой GLM-5.2 ($0.47).
Разница становится нагляднее на конкретных бенчмарках. На BrowseComp Kimi K3 в режиме максимального рассуждения достигает результата около 91% при цене порядка $2–4 за задачу. Claude Opus 4.8 на том же бенчмарке в максимальном режиме тратит около $25.5 за задачу и получает 84.4% — почти в семь раз дороже за более слабый результат.
BrowseComp — результат против цены за задачу. Kimi K3 занимает верхний левый угол графика: высокий балл при низкой цене. Источник: Artificial Analysis.
На Kimi Code Bench V2 картина похожая: Kimi K3 в режиме max набирает 72.3% за $4 за задачу, тогда как Claude Opus 4.8 тратит $6.5 за 71% — Kimi K3 обходится дешевле и при этом чуть точнее. Claude Fable 5 в максимальном режиме доходит до 77.5%, но при цене около $10.3 за задачу, в 2.5 раза больше, чем у K3.
Kimi Code Bench V2 — результат против цены за задачу. При цене $4 Kimi K3 обходит Claude Opus 4.8, который стоит $6.5 за задачу. Источник: Kimi Code / Moonshot AI.
Есть и обратная сторона. Скорость генерации у K3, по замерам Artificial Analysis, — около 33 токена в секунду, заметно ниже, чем у большинства конкурентов. А на полном прогоне Intelligence Index модель израсходовала 130 миллионов выходных токенов — Artificial Analysis прямо называет K3 многословной и достаточно дорогой в расчёте на реальную сессию, а не на изолированный тестовый прогон.
Что Moonshot признаёт сама
Раздел ограничений в техническом блоге K3 написан необычно прямо для релизного материала. Moonshot пишет, что модель обучена с расчётом на сохранённую историю рассуждений между шагами агента: если харнесс обрезает или теряет цепочку мыслей, качество ответов может стать «крайне нестабильным». Отдельно компания признаёт, что K3 «избыточно проактивна» в неоднозначных задачах — модель предпочитает действовать сама, а не уточнять у пользователя, что именно нужно сделать. В том же разделе Moonshot соглашается, что разговорный UX у K3 пока уступает Claude Fable 5 и GPT-5.6 Sol.
По данным Artificial Analysis, на бенчмарке фактической точности AA-Omniscience доля галлюцинаций у K3 выросла примерно до 51% против 39% у предыдущей K2.6, хотя доля правильных ответов среди тех случаев, где модель не галлюцинирует, тоже подросла — с 33% до 46%. Модель стала точнее там, где отвечает верно, но заметно хуже понимает, когда стоит остановиться и признать неуверенность.
20 июля, спустя четыре дня после запуска, Moonshot временно приостановила регистрацию новых платных подписок — по данным Reuters, спрос на K3 превысил доступные вычислительные мощности. Успех запуска обернулся дефицитом инференса, а не проблемой с качеством ответов.
Доступ к Kimi K3 из России
Прямая оплата API Moonshot AI из России затруднена — платформа требует верификацию через китайский номер телефона или банковскую карту. AITUNNEL открывает доступ к Kimi K3 через единый OpenAI-совместимый API с оплатой в рублях, без VPN и обхода блокировок.
Регистрация занимает пару минут: заводите аккаунт, пополняете баланс, получаете ключ вида sk-aitunnel- и меняете base_url на https://api.aitunnel.ru/v1/. Модель указывается как moonshotai/kimi-k3 — стриминг, вызов инструментов и работа с изображениями переносятся из существующего кода на OpenAI SDK без изменений.
16 июля 2026Контекст: 1 048 576 токеновВывод: 131 072 токена по умолчанию, до 1M настраивается
MoE-модель на 2.8 трлн параметров, из которых на каждый токен эффективно активны 16 из 896 экспертов. Построена на Kimi Delta Attention и Attention Residuals — паре архитектурных решений, которые держат вычисления линейными на длинном контексте и стабилизируют обучение сети такой разреженности. Контекст 1M токенов, рассуждение включено по умолчанию (режим max), нативная работа с изображениями и видео. Заняла первое место на BrowseComp и в WebDev Code Arena, при этом по общему индексу интеллекта Artificial Analysis идёт следом за Claude Fable 5 и GPT-5.6 Sol.
Ключевые преимущества
91.2% на BrowseComp — лучший результат среди всех протестированных моделей
77.8 балла на Program Bench и 30.8 на Automation Bench — первое место по обеим метрикам
42.0 на SWE Marathon (многочасовая инженерная работа) против 40.0 у Claude Opus 4.8 и 39.0 у GPT-5.6 Sol
88.3 на Terminal-Bench 2.1 — уступает только GPT-5.6 Sol (88.8)
Самостоятельно спроектировала новый алгоритм GPU-kernel и ускорила его в 2.48 раза за 15 часов без участия инженеров
Подходит для
Многошаговый поиск и браузинг информации в интернете
Автоматизация рабочих процессов в бизнес-софте и таблицах
Терминальные и системные агентные задачи
Многочасовые инженерные проекты, где агент работает без постоянного контроля
Kimi K3 запомнится не только цифрами в таблицах, хотя они сильные — первое место на BrowseComp, Program Bench и Automation Bench, третье-четвёртое место в общем индексе интеллекта Artificial Analysis среди 189 моделей. Запомнится история о том, как модель за 15 часов автономной работы спроектировала новый алгоритм для собственного тренировочного kernel'а и ускорила его в 2.48 раза, обогнав GPT-5.6 Sol, GPT-5.5 и Claude Opus 4.8. У модели остаются реальные оговорки: рост доли галлюцинаций до 51%, невысокая скорость генерации, зависимость от сохранности истории рассуждений в агентном харнессе и временная приостановка новых подписок из-за нехватки мощностей уже через четыре дня после запуска. Доступ к модели идёт через приложение Kimi, веб-версию и API, а AITUNNEL даёт такой доступ из России без VPN и с оплатой в рублях.
Часто задаваемые вопросы
Когда вышла Kimi K3 и где она доступна
Moonshot AI выпустила Kimi K3 16 июля 2026 года. Модель доступна через приложение Kimi, веб-версию kimi.com, Kimi Code и API.
Правда ли что Kimi K3 сама ускорила код своего обучения
Да. В рамках теста Moonshot дала пяти моделям задачу оптимизировать реальный тренировочный GPU-kernel без права менять результат вычислений. На кернеле AttnRes (96 слоёв, размерность 8192, последовательность 8192 токена) Kimi K3 за 15 часов автономных итераций спроектировала новый двухфазный алгоритм и сократила время прохода с 283.6 до 114.4 миллисекунды — ускорение в 2.48 раза, обогнав по этой задаче GPT-5.6 Sol, GPT-5.5 и Claude Opus 4.8.
Насколько Kimi K3 умнее закрытых флагманов вроде Claude Fable 5 и GPT-5.6 Sol
По независимому индексу интеллекта Artificial Analysis K3 набирает 57 баллов и идёт следом за Claude Fable 5 (60) и GPT-5.6 Sol (59), опережая при этом лучшую открытую модель до своего релиза, GLM-5.2 (51). При этом K3 занимает первое место на BrowseComp, Program Bench, SWE Marathon, SpreadsheetBench 2 и Automation Bench — конкретных бенчмарках, где модель обходит обоих закрытых лидеров.
Сколько стоит Kimi K3 в API
Официальная цена — $3.00 за 1M входных токенов на кэш-промахе, $0.30 при кэш-хите и $15.00 за 1M выходных, без надбавки за длину контекста вплоть до 1 048 576 токенов. По методологии Artificial Analysis стоимость одной выполненной задачи на Intelligence Index — $0.95, дешевле GPT-5.6 Sol и Claude Opus 4.8, но дороже открытой GLM-5.2.
Правда что у Kimi K3 выросли галлюцинации
Да, по данным бенчмарка фактической точности AA-Omniscience от Artificial Analysis доля галлюцинаций выросла примерно до 51% против 39% у предыдущей K2.6. Одновременно доля правильных ответов среди негаллюцинирующих случаев выросла с 33% до 46% — модель точнее там, где отвечает уверенно, но хуже определяет момент, когда стоит признать неуверенность.
Как подключить Kimi K3 из России без VPN
Через AITUNNEL: регистрируетесь, пополняете баланс в рублях, получаете ключ вида sk-aitunnel- и меняете base_url на "https://api.aitunnel.ru/v1/". Модель указывается как moonshotai/kimi-k3, остальной код на OpenAI SDK, включая стриминг и вызов инструментов, работает без изменений. Прямая оплата API Moonshot AI из России осложнена требованием китайского номера телефона или карты — AITUNNEL решает эту проблему без обхода блокировок.
Доступ к этому провайдеру через AITUNNEL
Все модели провайдера доступны через единый API. Работает из России без VPN, оплата в рублях.
За последние два года рынок языковых моделей изменился до неузнаваемости. Если в 2023 году вопрос сводился к «ChatGPT или что-то другое», то сегодня выбор модел…
Рынок языковых моделей в 2025–2026 году развивается с такой скоростью, что даже опытные разработчики успевают за новинками с трудом. Если год назад выбор сводил…
Если попросить любого разработчика назвать первую AI-компанию, которая приходит на ум, 9 из 10 скажут OpenAI. Это не случайно: именно ChatGPT в ноябре 2022 года…