GPT, Claude, Gemini — все модели через единый API. Работает в России без VPN.Начать бесплатно

GLM-5.3: обзор, бенчмарки и подключение из России

GLM-5.3Z.aiTerminal-BenchPost-trainingCyberGymАгентное кодированиеCode Bench

База как у GLM-5.2: 743 миллиарда параметров. Команда доучила её на длинных задачах, и на нескольких тестах модель уже дышит в спину Fable 5 и GPT-5.6 Sol.

GLM-5.3, обзор флагмана Z.ai: та же база, что у GLM-5.2, другой post-training

14 августа Z.ai выложила GLM-5.3. Я полез в технический пост за новой архитектурой и не нашёл её. Это та же сеть, что в GLM-5.2: 743 миллиарда параметров, смесь экспертов, контекст на миллион токенов. Разница в том, как её доучивали.

У GLM-5.2 на Terminal-Bench 3.0 было 4.6. Сейчас 28.3. На своём Code Bench они пишут про плюс 50% к точности, при этом модель жжёт меньше выходных токенов. API открыли 18 августа, ценник не трогали: $1.40 за миллион входа, $4.40 за выход.

Внутри это всё ещё GLM-5.2

GLM-5.2 вышла 13 июня. В августе те же инженеры взяли ту же MoE-сеть и накрутили post-training: больше сред, задачи подлиннее, траектории на часы, а не на минуты. В посте они сами так и написали: весь прирост из post-training.

Среды стали похожи на работу, которую старший инженер делает несколько дней подряд. В одном примере из релиза модели дают кластер, сторадж, внутреннюю документацию и логи экспериментов. Она сама ищет узкое место в тренировочном стеке, пишет правку, гоняет прогон и не имеет права сломать корректность. Вам больше не нужно резать задачу на шаги.

Чтобы таких сред хватило на обучение, Z.ai собрала пайплайн. Исследовательские агенты снимают паттерны с настоящей работы и собирают из них длинные задачи со скрытым состоянием. Другой агент пытается задачу решить и проверяет, что она вообще решаемая. Верификатор пишут без доступа к эталону, иначе модель быстро находит дырку в награде. Человек в этом контуре всё ещё сидит. Автономную генерацию сред они обещают потом.

Из 5.2 перетащили SAO с compaction. Без него короткие победы не доживают до длинной сессии. На публичных тестах это лучше всего видно по Terminal-Bench 3.0 и DeepSWE.

С 4.6 до 28.3 на самом жёстком терминале

Terminal-Bench 3.0 сажает агента в Linux и даёт ему долго ковыряться: команды, файлы, отладка. У GLM-5.2 тут было 4.6, цифра скорее провал, чем результат. GLM-5.3 вытянул 28.3. Kimi K3 на 17.4, Opus 4.8 на 21.1. Fable 5 и GPT-5.6 Sol всё ещё выше, 33.7 и 34.6. Если выбираете среди моделей, веса которых обещают выложить, 5.3 сейчас впереди.

DeepSWE v1.1 это починка настоящих GitHub Issues от тикета до зелёных тестов. Было 46.2, стало 66.9. Kimi K3 на 67.5, то есть вы с ней рядом. Fable 5 на 69.7, Sol на 72.7. Закрытые модели держат два-шесть пунктов.

Agents' Last Exam в CLI: 28.5 у 5.3 и 28.6 у Sol. Для меня это ничья. Fable 5 и старый 5.2 оба сидят на 23.8.

LLM Performance Evaluation: GLM-5.3 против GLM-5.2, Kimi K3, Fable 5 и GPT-5.6 Sol по шести бенчмаркам
Рисунок 1. GLM-5.3, GLM-5.2, Kimi K3, Fable 5 и GPT-5.6 Sol на Terminal-Bench 3.0, DeepSWE, Agents' Last Exam, AutomationBench, HLE w/ Tools и GDPval-AA v2. Источник: Z.ai.

На AutomationBench v1.0.6 GLM-5.3 берёт 48.2 и обходит Kimi, Fable и Sol. GDPval-AA v2, это 44 профессии: 1769 баллов, тоже первое место, у Fable 1743. HLE с инструментами 62.5, середина между Kimi и Fable.

Меньше токенов, больше закрытых задач

Публичные бенчмарки все уже наизусть. Z.ai поэтому держит свой Code Bench: локальная среда, разные типы задач, смотрят и долю доведённых до конца, и чеклист. Набор закрытый, накачаться на нём сложнее. Гоняли через Claude Code 2.1.207.

На Max GLM-5.3 закрывает 34.5% задач и тратит около 75 тысяч выходных токенов. Старый 5.2 на Max выжимал 23.4% и сжигал тысяч 96. На High новая модель выходит на 31.4% при 50 тысячах токенов и обходит Opus 4.8, которому для 29.5% нужно 120 тысяч. Fable 5 на Max всё равно выше: 39.5% при 115 тысячах.

Agentic Coding Performance by Effort Level: GLM-5.3, GLM-5.2, Claude Fable 5 и Claude Opus 4.8 на Z.ai Code Bench
Рисунок 2. Z.ai Code Bench v1.0, Claude Code 2.1.207. GLM-5.3 на Max берёт 34.5% при ~75K токенов, GLM-5.2 на Max 23.4% при ~96K. Источник: Z.ai.

Мне этот график нравится больше публичных таблиц. Вы крутите high или max и за те же деньги закрываете больше задач, чем закрывал 5.2. Fable по потолку не догнали. Зато 5.3 уже похож на модель, которую не стыдно поставить в ежедневный агент.

Где я бы пока не менял Fable или Kimi

SWE-Marathon v1.1 это многочасовая инженерия. GLM-5.3 набирает 42.5, у 5.2 было 19.4. Kimi K3 держит 48.1, Opus 4.8 48.8. Fable 5 тут слабее, 33.1. Длинный горизонт вырос вдвое, до Kimi и Opus не хватает шести пунктов.

На FrontierSWE выросли с 67.5 до 78.1, а Fable 5 сидит на 88.2. Собирать репозиторий с нуля (NL2Repo) модель умеет на 58.0, как Kimi, но Opus 4.8 всё ещё на 69.7. Toolathlon Verified: 73.0, Kimi на 76.5.

Автоматизацию и офисные профессии 5.3 уже умеет спорить с закрытыми. Собрать репу с нуля и тянуть многочасовой марафон я бы пока отдал Moonshot и Anthropic.

Киберспособность, из-за которой веса задержали

В post-training подмешали среды для поиска уязвимостей. Инженеры потом сами удивились скорости, с которой это поехало. Агент находит слабость, разбирает причину, проверяет цепочку. В посте это назвали emergent cyber capability.

CyberGym это белый ящик: исходники есть, надо найти дыру и подтвердить её. 84.5% против 77.2% у 5.2. Mythos 5 на 83.8, Sol на 83.6. Первое место. ExploitBench уже про более глубокий разбор известных дыр: 54.4 после 24.4. Mythos и Sol тут на 78 и 76.5. Найти баг 5.3 умеет на уровне закрытых. Собрать из него рабочую цепочку пока нет.

CyberSecurity Evaluation: GLM-5.3, GLM-5.2, Kimi K3, Mythos 5 и GPT-5.6 Sol на CyberGym, ExploitBench и ExploitGym
Рисунок 3. CyberGym, ExploitBench и ExploitGym. На поиске уязвимостей GLM-5.3 первая, на эксплуатации отстаёт от Mythos 5 и GPT-5.6 Sol. Источник: Z.ai.

С июня они гоняли модель по живым репозиториям вместе с китайскими security-командами. После экспертного разбора получилось 2 436 находок в 269 проектах, 1 097 из них средней и высокой тяжести. Ядра, браузерные движки, веб, сетевые протоколы. Часть багов сидела в коде десятилетиями, самым старым около 40 лет. Всё это кладут в Z.ai Security Disclosure Ledger.

Веса в день релиза поэтому не выложили. Обещают примерно через две недели после 14 августа, после отдельной проверки. API открыли 18 августа. Скачать 743B и поднять у себя пока нельзя. Меня это бесит как пользователя, и я понимаю, зачем они так сделали.

Сводка по бенчмаркам

Синим выделены значения GLM-5.3, жирным лучший результат в строке. Это таблица из релиза Z.ai, цифры вендорские.

БенчмаркGLM-5.3GLM-5.2Kimi K3Fable 5GPT-5.6 Sol
Кодинг
Terminal-Bench 2.188.281.088.388.088.8
Terminal-Bench 3.028.34.617.433.734.6
DeepSWE v1.166.946.267.569.772.7
NL2Repo58.048.958.0н/дн/д
SWE-Marathon v1.142.519.448.133.142.5
FrontierSWE78.167.5н/д88.2н/д
Агенты
AutomationBench v1.0.648.226.246.746.245.8
Agents' Last Exam CLI28.523.827.623.828.6
HLE w/ Tools62.554.759.863.964.5
GDPval-AA v217691508168217431730
Toolathlon Verified73.059.976.574.774.9
Кибер
CyberGym84.577.280.083.8*83.6
ExploitBench54.424.432.278.0*76.5
Таблица 1. Цифры Z.ai на момент релиза, 14 августа 2026. *В кибер-блоке официальный пост сравнивает с Mythos 5 (83.8 / 78.0), в общей таблице та же колонка подписана как Fable 5 with fallback. Источник: z.ai/blog/glm-5.3.

Reasoning больше нельзя выключить

На вход идёт только текст, картинок нет. Контекст миллион токенов, выход до 131 тысяч. Function calling, стриминг, JSON Schema и кэш работают. Для зрения остаются GLM-4.6V и GLM-5V Turbo.

Рассуждение выключить нельзя. Три уровня: low, high, max, по умолчанию max. Если в клиенте у вас стоит thinking.type: "disabled" как на 5.2, запрос на glm-5.3 упадёт. Перед сменой модели включите thinking и поставьте reasoning_effort: "low", если не хотите жечь max на каждом запросе. Для кода они сами просят max.

Цена как у 5.2: $1.40 / $4.40 за миллион, кэш входа $0.26. VentureBeat сложили миллион входа и миллион выхода и получили $5.80. Grok 4.6 на коротком контексте $8, Kimi K3 $18, Opus 5 $30, Sol $35.

Как открыть из России

Официальный кабинет Z.ai из России часто упирается в оплату. Через AITUNNEL модель называется glm-5.3, адрес https://api.aitunnel.ru/v1, ключ вида sk-aitunnel-. 280 ₽ за миллион входа, 880 ₽ за выход, кэш около 52 ₽. Пополнение от 500 ₽ картой РФ или по счёту. В OpenAI SDK меняете base URL и имя модели, остальное как было.

Claude Code, OpenCode и ZCode её уже подхватывают. У Z.ai ещё есть GLM Coding Plan с баллами: в час пик (14:00-18:00 UTC+8 по будням) списывают полный тариф, ночью и в выходные половину. Если нужен предсказуемый счёт, я бы брал токены в API.

Локально пока не запустить. Предыдущие флагманы шли под MIT, для 5.3 лицензию не объявили. Когда веса выложат, ориентир тот же, что у 5.2: vLLM или SGLang и несколько H100 80GB в fp8.

Кому менять модель на этой неделе

Агент на 5.2 можно пересадить без смены ценника и контекста. Reasoning теперь обязательный. На терминале и длинных сессиях модель другая. На Code Bench это плюс 11 пунктов точности и минус тысяч 20 токенов на задачу.

Fable 5 на их внутреннем бенчмарке всё равно сильнее: 39.5% против 34.5%. Sol сильнее на DeepSWE и Terminal-Bench 3.0. За этот запас вы платите в несколько раз больше за токен. Если нужен дешёвый флагман под агентный код, который скоро можно будет скачать, я бы смотрел на 5.3.

Локальный контур подождёт весов. Пока оставайтесь на 5.2. Искать дыры в своём коде этой моделью можно только в изолированной среде и с человеком, который читает находки. Веса задержали из-за этой киберспособности.

GLM-5.3

Флагман
14 августа 2026Контекст: 1 048 576 токеновВывод: 131 072 токена

Флагман Z.ai на той же 743B MoE-базе, что и GLM-5.2. Весь рост дал масштабированный post-training на длинных задачах. Reasoning включён всегда (low, high, max). Среди открытых моделей лидирует на Terminal-Bench 3.0 (28.3) и Agents' Last Exam CLI (28.5). На CyberGym 84.5, первое место. Веса обещаны после проверки безопасности.

Ключевые преимущества

  • 28.3 на Terminal-Bench 3.0 против 4.6 у GLM-5.2, лучший результат среди открытых моделей
  • 66.9 на DeepSWE v1.1, рядом с Kimi K3 (67.5)
  • 48.2 на AutomationBench, выше Fable 5 и GPT-5.6 Sol
  • 1769 на GDPval-AA v2, первое место в таблице Z.ai
  • 84.5% на CyberGym, впереди Mythos 5 (83.8%) и GPT-5.6 Sol (83.6%)
  • На Z.ai Code Bench 34.5% при ~75K выходных токенов против 23.4% при 96K у GLM-5.2

Подходит для

  • Длинные агентные сессии в терминале и локальном репозитории
  • Автоматизация рабочих процессов и многошаговые CLI-задачи
  • Поиск уязвимостей в белом ящике и разбор чужого кода в безопасном контуре
  • On-premise после публикации весов, если данные нельзя отдавать наружу
Ввод / 1M280 ₽
Вывод / 1M880 ₽
Подробнее о модели

Итог

Мне GLM-5.3 интересен тем, что это не новая сеть. Ту же 743B из июня доучили на длинных задачах, и Terminal-Bench 3.0 вырос с 4.6 до 28.3. На AutomationBench и GDPval модель обошла Fable и Sol. На CyberGym она первая. Веса ещё не отдают, reasoning выключить нельзя, Fable на Code Bench держит потолок. Для агентного кода по $1.40/$4.40 я бы уже переключался, если вам не нужен локальный инференс на этой неделе.

Часто задаваемые вопросы

Z.ai учила новую базу для GLM-5.3?

Нет. База та же, что у GLM-5.2: около 743 миллиардов параметров, MoE, контекст 1M. Весь заявленный рост дал масштабированный post-training на длинных задачах и новых средах.

Чем GLM-5.3 сильнее GLM-5.2?

Terminal-Bench 3.0 вырос с 4.6 до 28.3, DeepSWE v1.1 с 46.2 до 66.9, AutomationBench с 26.2 до 48.2, SWE-Marathon v1.1 с 19.4 до 42.5, CyberGym с 77.2% до 84.5%. На внутреннем Code Bench точность на Max поднялась с 23.4% до 34.5% при меньшем расходе токенов (75K против 96K).

Можно ли скачать веса GLM-5.3?

Пока нет. Z.ai отложила публикацию примерно на две недели после 14 августа 2026, пока идёт проверка безопасности. API доступен с 18 августа. Лицензию для 5.3 ещё не объявили, предыдущие флагманы линейки шли под MIT.

Как вызвать GLM-5.3 из России без VPN?

Через AITUNNEL: base URL https://api.aitunnel.ru/v1, модель glm-5.3, оплата в рублях. Ввод 280 ₽/1M, вывод 880 ₽/1M. Минимальное пополнение 500 ₽. В Claude Code укажите model: glm-5.3. Reasoning выключать нельзя, для кода ставьте reasoning_effort max.

Почему в GLM-5.3 нельзя выключить thinking?

Модель всегда работает с рассуждением. Доступны low, high и max, по умолчанию max. Запрос с thinking.type disabled, как в GLM-5.2, вернёт ошибку. Перед миграцией включите thinking и выберите уровень. Для кода я бы ставил max, как просит Z.ai.

Доступ к этому провайдеру через AITUNNEL

Все модели провайдера доступны через единый API. Работает из России без VPN, оплата в рублях.

Единый APIОплата картой РФБез VPN
Начать работуРегистрация за 1 минуту

Статьи по теме

Qwen11 мая 2026 г.

Модели Qwen — Обзор и сравнение моделей

QwenAlibabaOpen Source

Рынок языковых моделей в 2025–2026 году развивается с такой скоростью, что даже опытные разработчики успевают за новинками с трудом. Если год назад выбор сводил

Читать
ПопробоватьВсе модели