GPT, Claude, Gemini — все модели через единый API. Работает в России без VPN.Начать бесплатно

Модели Kimi (Moonshot AI) — обзор и сравнение

KimiKimi K3Moonshot AIKimi K2Kimi Delta AttentionMCPОткрытые весаАгентное кодированиеCursor

Разбираем все актуальные модели Kimi от Moonshot AI — новый флагман K3 с 2.8 трлн параметров и контекстом на миллион токенов, всю линейку K2 (K2.6, K2.7 Code, K2 Thinking) и честно — где Kimi реально выигрывает, а где пока нет

Moonshot AI — пекинская лаборатория, о которой в русскоязычном AI-сообществе знают заметно меньше, чем о DeepSeek или Qwen, хотя по качеству моделей она давно играет в той же лиге. Основана в 2023 году, специализируется на двух вещах: длинном контексте и агентных сценариях — работе с инструментами, кодом и многошаговыми задачами. Самый громкий релиз линейки на сегодня — Kimi K3, 2.8-триллионная модель с контекстом в миллион токенов, которая заняла первое место на Arena Frontend Code Arena, обойдя Claude Fable 5 и GPT-5.6 Sol.

До K3 линейка успела разрасти в три специализированные ветки. Kimi K2.6 остаётся рабочей лошадкой общего назначения — тот самый триллион-параметровый MoE, который многие уже используют в Cursor и других агентных редакторах. Kimi K2.7 Code — узкая специализация под агентное программирование. Kimi K2 Thinking — вариант с расширенным рассуждением. K3 не заменяет эти модели, а встаёт над ними как новый флагман — с другой архитектурой, другой ценой и другим набором компромиссов.

В этом материале — что на самом деле умеет K3 по независимым замерам Artificial Analysis, честная таблица бенчмарков против Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8 и GLM-5.2, разбор всей линейки K2 и то, где Kimi выигрывает не на бумаге, а в реальных пайплайнах.

Moonshot AI и архитектура линейки Kimi

Moonshot AI основана в 2023 году в Пекине и с самого начала выбрала узкую специализацию — длинный контекст и агентные способности, а не попытка быть «ещё одним универсальным чат-ботом». В январе 2025 года компания заметно потеряла позиции на фоне взрывного роста DeepSeek, но сделала ставку на открытые веса и разработчиков — и это привело к Kimi K3, самому обсуждаемому открытому релизу 2026 года.

Технически линейка построена на MoE-архитектуре (Mixture-of-Experts): на каждый токен активируется лишь небольшая часть от общего числа параметров. У K2 это порядка 32 млрд активных параметров при 1 трлн общих. У K3 экспертов стало намного больше — 896 штук, из которых на каждый токен включаются только 16, а эффективная стоимость инференса сопоставима с плотной моделью на ~50 млрд параметров при заявленных 2.8 трлн общих. Именно такая архитектура позволяет Kimi оставаться одной из самых доступных по цене моделей флагманского уровня, несмотря на огромный номинальный размер.

От базовой K2 линейка разошлась в три специализированные ветки: K2.6 (универсальная), K2.7 Code (агентное программирование) и K2 Thinking (расширенное рассуждение). K3 — не четвёртая ветка K2, а следующее поколение архитектуры целиком, с новым механизмом внимания и на порядок большим контекстом.

Kimi K3 — новый флагман: 2.8 трлн параметров и контекст на миллион токенов

Что изменилось в архитектуре

Moonshot заявляет о 2.5-кратном росте эффективности масштабирования по сравнению с K2 — то есть K3 конвертирует то же количество вычислений в заметно больше полезного интеллекта. За это отвечают два новых компонента. Kimi Delta Attention (KDA) — гибридный механизм внимания, который держит вычислительную стоимость линейной там, где обычное attention растёт квадратично с длиной последовательности. По данным Moonshot, KDA даёт до 6.3× более быстрый decoding именно на контекстах в районе миллиона токенов — без этого 1M-контекст был бы экономически неоправданным.

Attention Residuals (AttnRes) — второй компонент, отвечающий за то, как информация проходит по глубине сети, а не по длине последовательности. По заявлению Moonshot, это даёт около 25% прироста эффективности обучения при менее чем 2% дополнительных вычислений. Третий элемент — Stable LatentMoE, фреймворк балансировки нагрузки между экспертами, без которого обучение MoE-модели с таким уровнем разреженности (16 из 896 экспертов) было бы нестабильным.

Показательная деталь из релиза: команда Moonshot прогнала K3 на задаче оптимизации собственного тренировочного kernel'а AttnRes (96 слоёв, размерность модели 8192, 8192 токена). За 15 часов непрерывных итераций модель спроектировала новый двухфазный алгоритм kernel'а и сократила время forward+backward прохода с 283.6 мс до 114.4 мс — без ограничения в 50 шагов, просто предоставленная сама себе.

Что подтверждают независимые бенчмарки

Самый надёжный результат запуска — независимо подтверждённый: на Arena Frontend Code Arena (слепое сравнение реальными разработчиками) Kimi K3 набрала 1679 очков и заняла первое место, обойдя Claude Fable 5 (1631) и GPT-5.6 Sol (1618), с win rate 76% в парных сравнениях. Это первое открытое место в истории этого рейтинга на такой позиции.

По общему индексу интеллекта Artificial Analysis (v4.1) K3 набирает 57.1 балла и занимает четвёртое место из 189 моделей — позади Claude Fable 5 (59.9) и GPT-5.6 Sol Max (58.9), но заметно опережая Claude Opus 4.8. На GPQA-Diamond у K3 — 93.5%, лучший результат среди открытых моделей на момент запуска. Модель также лидирует на BrowseComp (91.2%), SpreadsheetBench 2 (34.8) и Automation Bench (30.8), а на SWE Marathon — бенчмарке многочасовой инженерной работы — набирает 42.0 против 40.0 у Claude Opus 4.8, тогда как GPT-5.5 и GLM-5.2 на этой же задаче скатываются к 14 и 13 баллам соответственно.

На классическом FrontierSWE K3 набирает 81.2% — второе место после Claude Fable 5 (86.6%), но заметно впереди Claude Opus 4.8 (66.7%) и GPT-5.5 (64.9%). Картина в целом: K3 регулярно попадает в топ-3 практически по всем направлениям, иногда выигрывает вчистую, но не претендует на звание самой умной модели в мире — этот титул по индексу Artificial Analysis всё ещё держат Claude Fable 5 и GPT-5.6 Sol Max.

Что важно знать перед продакшеном

Есть нюанс, который Moonshot не выносит в свои бенчмарк-графики. На AA-Omniscience — бенчмарке Artificial Analysis, измеряющем фактическую точность, — доля галлюцинаций у K3 выросла с 39% у предыдущей K2.6 до примерно 51%. При этом модель одновременно стала точнее в правильных ответах (33% → 46%) — то есть она чаще отвечает верно, но заметно хуже понимает, когда ошибается. Для контекста: у Claude Fable 5 на том же бенчмарке показатель галлюцинаций — 54.9%, так что абсолютное значение K3 не выбивается из общего ряда, но рост на 12 п.п. за одно поколение стоит учитывать в задачах, где фактическая точность критична — юридические, медицинские, финансовые.

Скорость генерации у K3 — около 62 токенов в секунду по замерам Artificial Analysis, тогда как у Claude Fable 5 это 71 т/с, а у GPT-5.6 Sol — 85 т/с. Для интерактивных сценариев с мгновенным ответом разница ощутима. Сама Moonshot также открыто указывает на три ограничения в блоге релиза: модель чувствительна к сохранности истории рассуждений между шагами агента (если харнесс обрезает или меняет цепочку мыслей, качество заметно падает), K3 «избыточно проактивна» в неоднозначных агентных сценариях — предпочитает действовать, а не уточнять задачу, а общий разговорный UX пока уступает Fable 5 и GPT-5.6 Sol.

И главное: открытые веса K3 обещаны на 27 июля 2026 года под модифицированной MIT-лицензией — на момент публикации этого материала они ещё не опубликованы. Формально анонсированная как open-weight, сегодня модель доступна только через хостед API и приложение Kimi. Даже когда веса выйдут, самостоятельный запуск потребует серьёзной инфраструктуры: при квантовании MXFP4 вес модели — около 1.4 ТБ, а Moonshot рекомендует конфигурацию из 64+ ускорителей в одном высокоскоростном интерконнекте (нативная поддержка MXFP4 — это NVIDIA Blackwell или AMD MI400). Для сравнения, K2.6 и K2.7 Code в квантованном виде можно поднять на кластере из 8 GPU — с K3 такой вариант не сработает.

Линейка K2 — три модели, три разных фокуса

Kimi K2.6 — универсальная рабочая модель

K2.6 — модель, вокруг которой построена основная экосистема Kimi, и именно её открытие весов в апреле 2026 сделало Kimi вторым по популярности LLM на OpenRouter. У неё нет узкой специализации, но именно это делает её удобным выбором по умолчанию: одна модель закрывает и чат, и агентные сценарии, и работу с кодом среднего уровня сложности. Контекст 200K токенов и лимит вывода 32K — достаточно для большинства практических задач, а самостоятельный запуск не требует инфраструктуры уровня K3.

Отдельный практический момент, о котором стоит знать: K2.6 — одна из немногих моделей, которая стабильно проходит верификацию и работает в Agent Mode популярных AI-редакторов вроде Cursor через кастомные OpenAI-совместимые endpoint'ы. Брендированные модели Anthropic и OpenAI через такие endpoint'ы часто спотыкаются на верификации ключа или ломают tool calling после очередного обновления редактора — у K2.6 эта проблема практически не встречается, потому что модель изначально проектировалась под открытые агентные сценарии, а не под закрытый API одного вендора.

Kimi K2.7 Code и лидерство на MCP Mark Verified

K2.7 Code — логичное развитие K2.6 в сторону узкой специализации. Главное отличие не в сыром качестве кода, а в том, как модель ведёт себя на длинных дистанциях: в сессиях с сотнями вызовов инструментов K2.7 Code расходует заметно меньше токенов на единицу полезной работы, чем K2.6. Для агентных пайплайнов, где счёт идёт на тысячи tool-вызовов, это прямая экономия, а не абстрактное улучшение.

На MCP Mark Verified — бенчмарке, оценивающем качество работы модели с инструментами через Model Context Protocol, — K2.7 Code лидирует среди открытых моделей своего поколения. Контекст увеличен до 256K токенов, что важно при работе с крупными монорепозиториями, где даже 200K иногда не хватает, чтобы удержать весь релевантный контекст в одном запросе.

Kimi K2 Thinking — когда важна глубина, а не скорость

K2 Thinking решает задачу, для которой K2.6 и K2.7 Code подходят слабо — многошаговую логику и математику, где ошибка на промежуточном шаге портит весь результат. Модель разворачивает более длинную цепочку рассуждений перед финальным ответом, за счёт чего заметно точнее на AIME, HMMT и похожих задачах. Плата за это — увеличенный лимит вывода (64K токенов) и выше латентность: для интерактивных сценариев с мгновенным ответом K2 Thinking не лучший выбор, для оффлайн-анализа и многошаговых расчётов — да.

K2.7 Code против других открытых моделей

Сравнение по бенчмаркам агентного кодирования

Ниже — сводная таблица по ключевым бенчмаркам агентного кодирования и рассуждения для линейки K2 (без K3 — она разобрана в отдельной таблице выше). Синим выделены модели линейки Kimi, жирным — лучший результат в каждой строке.

БенчмаркKimi K2.7 CodeKimi K2 ThinkingGLM-5.1Qwen3.6+DeepSeek V4Claude Opus 4.8GPT-5.6
Агентное кодирование
SWE-Bench Pro54.148.658.456.652.360.959.2
MCP Mark Verified71.866.264.367.958.174.673.9
Terminal-Bench 2.065.859.463.561.641.268.967.1
Рассуждение
AIME 202689.496.295.395.194.898.998.5
HLE27.833.531.028.825.638.241.4
GPQA-Diamond83.287.986.290.482.492.891.5
Таблица 1. Сравнение моделей линейки Kimi K2 с открытыми и закрытыми флагманами. Синим — модели Kimi, жирным — лучший результат в строке.

Главный вывод из таблицы: на MCP Mark Verified Kimi K2.7 Code — лучший результат среди открытых моделей своего поколения (GLM-5.1, Qwen3.6+, DeepSeek V4), хотя закрытые Claude Opus 4.8 и GPT-5.6 всё ещё немного впереди. На классическом SWE-Bench Pro Kimi уступает и GLM-5.1, и закрытым флагманам — это не универсальный лидер по коду, а модель с конкретным преимуществом в работе с инструментами и MCP-протоколом. Новая K3 идёт заметно дальше по абсолютным результатам (см. таблицу выше), но и стоит в разы больше K2.7 Code.

Где Kimi проигрывает

Честный разбор требует и слабых сторон на каждом уровне линейки. У K2.7 Code и K2 Thinking — отставание от GPT-5.6 и Claude Opus 4.8 на чистом рассуждении (HLE) на 8–10 пунктов, а GLM-5.1 обходит K2.7 Code на SWE-Bench Pro. У новой K3 — своя пара слабых мест: рост доли галлюцинаций до 51% на AA-Omniscience и более низкая скорость генерации (62 т/с против 71–85 у Claude Fable 5 и GPT-5.6 Sol). Плюс формально открытая модель, веса которой пока недоступны для скачивания.

Там, где Kimi реально выигрывает по всей линейке — это соотношение цена/качество, длинный контекст и специализация на агентных задачах и коде, а не абсолютное лидерство на каждом бенчмарке без исключений.

Kimi на практике — Cursor и агентные инструменты

Одна из причин, почему Kimi K2.6 стала популярной моделью в сообществе разработчиков — практическая совместимость с агентными IDE. В Cursor, например, брендированные модели Anthropic и OpenAI через кастомные OpenAI-совместимые endpoint'ы нередко спотыкаются на верификации ключа или теряют часть функциональности в Agent Mode и Composer после обновлений редактора. Kimi K2.6 и K2.7 Code проектировались именно под открытые агентные сценарии tool calling и проходят этот пайплайн стабильно — многие используют их как основную модель именно по этой причине, а не только из-за цены.

K3 в повседневных агентных редакторах пока используют реже — она в разы дороже K2.6/K2.7 Code, а её реальное преимущество проявляется на задачах с очень длинным контекстом или фронтенд-генерацией, а не на типовом ежедневном рефакторинге. Для большинства команд разумная стратегия — оставаться на K2.7 Code для повседневных агентных сессий и подключать K3 точечно, когда контекст или сложность задачи выходят за пределы 256K токенов.

Открытые веса и локальный запуск

K2.6, K2.7 Code и K2 Thinking распространяются с открытыми весами и доступны на Hugging Face, а также через NVIDIA NIM. Для локального запуска подходят vLLM и SGLang — оба инференс-сервера поддерживают MoE-архитектуру K2 из коробки, а квантованную версию можно поднять на кластере из 8 GPU.

У K3 всё сложнее. Полные веса обещаны на 27 июля 2026 под модифицированной MIT-лицензией, но даже когда они выйдут, речь не о запуске на домашнем железе: вес модели при квантовании MXFP4 — около 1.4 ТБ, а рекомендуемая Moonshot конфигурация — 64+ ускорителей в едином высокоскоростном интерконнекте на базе NVIDIA Blackwell или AMD MI400. По факту самостоятельный хостинг K3 на старте доступен только облачным провайдерам и крупным инференс-компаниям, а не разработчику с домашней GPU-стойкой. Для остальных — API-доступ через AITUNNEL без необходимости поднимать инфраструктуру такого масштаба.

Доступ к Kimi API из России

Прямое подключение к API Moonshot AI из России осложнено требованиями к верификации через китайский номер телефона или банковскую карту. AITUNNEL закрывает эту проблему: все модели линейки Kimi, включая K3, доступны через единый OpenAI-совместимый API без VPN, с оплатой в рублях и поддержкой юридических лиц.

Подключение занимает пару минут: регистрируетесь, пополняете баланс, получаете ключ вида sk-aitunnel- и меняете base_url на https://api.aitunnel.ru/v1/. Модели указываются как moonshotai/kimi-k3, moonshotai/kimi-k2.6, moonshotai/kimi-k2.7-code или moonshotai/kimi-k2-thinking — остальной код, включая tool calling и стриминг, работает без изменений.

Модели Kimi

Kimi K3

Флагман
16 июля 2026Контекст: 1 000 000 токеновВывод: 64 000 токенов

Новый флагман Moonshot AI — MoE-модель с 2.8 трлн параметров (16 из 896 экспертов активны на каждый токен, эффективно — уровень плотной ~50-миллиардной модели). Контекст 1M токенов на архитектуре Kimi Delta Attention, нативная мультимодальность (текст, изображения, видео), рассуждение включено по умолчанию. Заняла первое место на Arena Frontend Code Arena, но на общем индексе интеллекта Artificial Analysis идёт четвёртой — позади Claude Fable 5 и GPT-5.6 Sol Max. Открытые веса обещаны на 27 июля 2026 под модифицированной MIT-лицензией — на момент публикации ещё не опубликованы.

Ключевые преимущества

  • №1 на Arena Frontend Code Arena — 1679 очков, 76% побед в слепых сравнениях против Claude Fable 5 и GPT-5.6 Sol
  • Контекст 1 000 000 токенов благодаря Kimi Delta Attention — до 6.3× быстрее decoding на длинных последовательностях
  • 93.5% на GPQA-Diamond — лучший результат среди открытых моделей на старте
  • Победа на SWE Marathon (многочасовая инженерная работа) и BrowseComp
  • Нативная мультимодальность: текст, изображения и видео в одном запросе

Подходит для

  • Фронтенд-разработка и UI-генерация — здесь модель объективно сильнее конкурентов
  • Задачи с очень длинным контекстом: целые кодовые базы, большие пакеты документов
  • Длинные агентные сессии с автономным принятием решений
  • Мультимодальные сценарии с видео и изображениями в одном запросе
Ввод / 1M600 ₽
Вывод / 1M3000 ₽
Подробнее о модели

Kimi K2.7 Code

Агентное кодирование
Июнь 2026Контекст: 256 000 токеновВывод: 32 000 токенов

Специализированная версия линейки Kimi K2, заточенная под агентное программирование. Лидирует на MCP Mark Verified среди открытых моделей, заметно эффективнее K2.6 по расходу токенов в длинных агентных сессиях с большим числом вызовов инструментов. MoE-архитектура, открытые веса, совместима с Claude Code, Cursor, OpenCode и другими агентными редакторами через OpenAI-совместимый API.

Ключевые преимущества

  • Лидер среди открытых моделей на MCP Mark Verified
  • Существенно эффективнее по токенам в длинных tool-calling сессиях, чем K2.6
  • Контекст 256K токенов — хватает на крупные монорепозитории
  • Стабильная работа в Cursor Agent Mode, Composer и Claude Code
  • Открытые веса — доступна на Hugging Face и NVIDIA NIM

Подходит для

  • Автономные агенты для рефакторинга и ревью кода
  • Long-horizon агентные сессии с сотнями tool-вызовов
  • Работа внутри Cursor, OpenCode, Claude Code и аналогичных IDE-агентов
  • CI-пайплайны с автоматическим исправлением тестов
Ввод / 1M190 ₽
Вывод / 1M800 ₽
Подробнее о модели

Kimi K2.6

Универсальная
Апрель 2026Контекст: 200 000 токеновВывод: 32 000 токенов

Флагман общего назначения линейки Kimi K2 — MoE-модель на 1 трлн параметров с сильным tool use и стабильной работой в агентных сценариях. Не заточена под одну задачу, как K2.7 Code, но покрывает широкий спектр применений: от чат-ботов до сложных агентов. Одна из немногих моделей, которая без проблем проходит верификацию Cursor и стабильно работает в Agent Mode. После открытия весов в апреле 2026 стала вторым по популярности LLM на OpenRouter.

Ключевые преимущества

  • 1 трлн параметров MoE — высокий интеллект при разумной стоимости инференса
  • Стабильно проходит верификацию и Agent Mode в Cursor, в отличие от многих брендированных моделей через кастомные endpoint'ы
  • Универсальность — не требует переключения модели под разные задачи
  • Открытые веса, заметно ниже цена по сравнению с закрытыми аналогами

Подходит для

  • Основная модель для AI-редакторов кода (Cursor, OpenCode, Codex CLI)
  • Универсальные чат-боты и ассистенты
  • Задачи со средней сложностью рассуждения без необходимости thinking-режима
  • Пайплайны, где важна предсказуемая стоимость токена
Ввод / 1M190 ₽
Вывод / 1M800 ₽
Подробнее о модели

Kimi K2 Thinking

Расширенное рассуждение
2025Контекст: 200 000 токеновВывод: 64 000 токенов

Вариант линейки K2 с расширенным режимом рассуждения — модель разворачивает более длинную цепочку размышлений перед ответом, за счёт чего заметно точнее на математике, многошаговой логике и задачах, где легко ошибиться на промежуточном шаге. Компромисс — больше выходных токенов и выше латентность по сравнению с K2.6 и K2.7 Code.

Ключевые преимущества

  • Заметно точнее K2.6 на математике и многошаговой логике
  • Увеличенный лимит вывода (64K) — достаточно для длинных цепочек рассуждения
  • Открытые веса под ту же лицензию, что и остальные модели линейки
  • Хорошая альтернатива закрытым reasoning-моделям по цене

Подходит для

  • Сложные математические и логические задачи
  • Многошаговый анализ данных с проверкой промежуточных выводов
  • Задачи, где важна точность больше, чем скорость ответа
  • Замена дорогих закрытых reasoning-моделей там, где бюджет ограничен
Ввод / 1M90 ₽
Вывод / 1M470 ₽
Подробнее о модели

Итог

Kimi выросла из одной открытой модели в целую линейку с чёткими нишами. K2.6 — надёжный универсальный выбор, который без проблем работает в Agent Mode популярных AI-редакторов. K2.7 Code — лучший вариант среди открытых моделей своего поколения для длинных агентных сессий с интенсивным tool calling. K2 Thinking — для задач, где важна точность многошаговой логики. А 16 июля добавился новый флагман — Kimi K3: 2.8 трлн параметров, контекст 1M токенов, первое место на Arena Frontend Code Arena и четвёртое место в общем индексе интеллекта Artificial Analysis, позади Claude Fable 5 и GPT-5.6 Sol Max. У K3 есть реальные оговорки — рост доли галлюцинаций до 51%, более низкая скорость генерации и открытые веса, которые пока не опубликованы (обещаны на 27 июля). Для повседневных агентных задач и кода разумнее оставаться на K2.7 Code или K2.6, а K3 подключать точечно — под фронтенд-генерацию и задачи с очень длинным контекстом. Все модели линейки доступны через AITUNNEL без VPN с оплатой в рублях, открытые веса K2 — бесплатно через Hugging Face и NVIDIA NIM.

Часто задаваемые вопросы

Kimi K3 уже вышла?

Да. Moonshot AI выпустила Kimi K3 16 июля 2026 года, модель доступна через приложение Kimi, веб-плеейграунд и API. Открытые веса под модифицированной MIT-лицензией обещаны на 27 июля 2026 — на момент этой публикации они ещё не опубликованы, поэтому формально open-weight модель пока доступна только через хостед-доступ.

Насколько Kimi K3 лучше закрытых флагманов вроде Claude Opus 4.8 и GPT-5.6?

По независимому индексу Artificial Analysis K3 набирает 57.1 балла и занимает четвёртое место из 189 моделей — позади Claude Fable 5 (59.9) и GPT-5.6 Sol Max (58.9), но опережает Claude Opus 4.8. При этом K3 заняла первое место на Arena Frontend Code Arena, обойдя и Fable 5, и GPT-5.6 Sol. Итог: не абсолютный лидер по всем направлениям, но топ-4 модель в мире с открытыми (пока не опубликованными) весами и заметным преимуществом на фронтенд-задачах.

Правда, что у Kimi K3 выросли галлюцинации?

Да, по данным независимого бенчмарка AA-Omniscience (Artificial Analysis) доля галлюцинаций выросла с 39% у K2.6 до примерно 51% у K3, при этом фактическая точность правильных ответов улучшилась с 33% до 46%. Для сравнения, у Claude Fable 5 показатель на этом бенчмарке — 54.9%, так что абсолютное значение K3 не аномальное, но рост за одно поколение стоит учитывать в задачах с высокими требованиями к фактической точности.

Чем Kimi K2.7 Code отличается от Kimi K2.6?

K2.7 Code (июнь 2026) — специализированная версия для агентного программирования: заметно эффективнее по токенам в длинных агентных сессиях с большим числом tool-вызовов и лидирует на MCP Mark Verified среди открытых моделей своего поколения. Контекст увеличен до 256K токенов. K2.6 остаётся более универсальной моделью для широкого круга задач, не только кода. Обе доступны через AITUNNEL по единому API.

Можно ли запустить Kimi K3 или K2 локально?

K2.6, K2.7 Code и K2 Thinking — да, открытые веса уже доступны на Hugging Face и через NVIDIA NIM, для инференса подходят vLLM и SGLang, квантованную версию можно поднять на кластере из 8 GPU. K3 — сложнее: полные веса обещаны на 27 июля 2026, а рекомендуемая конфигурация для self-hosting — 64+ ускорителей NVIDIA Blackwell или AMD MI400 в едином интерконнекте, что реалистично только для облачных провайдеров и крупных инференс-компаний.

Как подключить Kimi API в России?

Через AITUNNEL: регистрируетесь, пополняете баланс (от небольшой суммы в рублях), получаете API-ключ вида sk-aitunnel- и указываете base_url = "https://api.aitunnel.ru/v1/". Прямой доступ к API Moonshot AI из России затруднён из-за требований к китайскому номеру или карте. AITUNNEL решает эту проблему без VPN, модели указываются как moonshotai/kimi-k3, moonshotai/kimi-k2.6, moonshotai/kimi-k2.7-code или moonshotai/kimi-k2-thinking.

Доступ к этому провайдеру через AITUNNEL

Все модели провайдера доступны через единый API. Работает из России без VPN, оплата в рублях.

Единый APIОплата картой РФБез VPN
Начать работуРегистрация за 1 минуту

Статьи по теме

ПопробоватьВсе модели