Anthropic не подняла цену и не назвала эту модель своей самой умной. Зато Opus 5 втрое обходит предыдущее поколение на тесте новых задач и берёт на себя роль модели, с которой начинают рабочий день миллионы разработчиков.
24 июля Anthropic представила Claude Opus 5 и сразу поставила её дефолтной моделью в Claude Max, а на Claude Pro она стала самой сильной из доступных. Цена за токен не изменилась ни на цент с прошлого релиза, а по внутренним тестам компании модель почти нагнала более дорогую Fable 5 на большинстве прикладных бенчмарков.
Anthropic прямо признаёт: Fable 5 остаётся умнее на многодневных автономных проектах, а модель конкурентов Mythos 5 держит лидерство в биологии и кибербезопасности. Opus 5 не претендует на титул самой умной модели в мире. Она претендует на другой титул — модель, которую хочется открывать каждый день, потому что она не разоряет бюджет на токены.
Разберём, что стоит за этим позиционированием: какие цифры показывает модель на бенчмарках, как она сама проверяет собственную работу и во что это выливается для разработчиков, которые уже подключили Opus 5 в продакшн.
Что физически изменилось в Opus 5
Контекстное окно осталось на отметке 1 миллион токенов, максимум на выходе — 128 000. А вот режим рассуждений (thinking) теперь включён по умолчанию, и здесь есть настоящий breaking change: отключить thinking можно только на уровнях эффорта high и ниже. На xhigh и max запрос с parameter thinking: disabled вернёт ошибку 400. Если ваш код сейчас отключает thinking при высоком эффорте, придётся выбрать — либо снизить эффорт, либо оставить рассуждения включёнными.
Из новых возможностей в бета-версии — смена набора инструментов прямо посреди разговора без сброса prompt cache. Раньше добавление или удаление tool в середине долгой агентной сессии обесценивало кеш системного промпта целиком, и разработчики предпочитали либо держать фиксированный набор инструментов на весь диалог, либо платить за пересчёт кеша. Теперь список инструментов можно менять между репликами, а кешированный префикс останется на месте.
Вторая бета-функция — автоматические фолбэки на уровне API. Если запрос к Opus 5 или Fable 5 срабатывает на классификаторах безопасности, раньше он просто блокировался. Теперь можно включить автоматическую переадресацию на другую модель — запрос не потеряется, а уйдёт на менее мощную модель с более низким порогом риска. Пользователь в чате увидит уведомление, что сработал переход.
Opus 5 поддерживает всю линейку эффорта — low, medium, high, xhigh и max, включая верхнюю ступень для задач, где на первом месте результат, а не скорость получения ответа.
Цифры на бенчмарках и где Opus 5 всё же не первый
Anthropic сравнивает четыре модели: Opus 5, Fable 5, предыдущий Opus 4.8 и модель конкурента GPT-5.6 Sol. На Frontier-Bench v0.1 — тесте агентного кодинга в терминале — у Opus 5 43.3%, у Opus 4.8 было 21.1%, у Fable 5 33.7%, у GPT-5.6 Sol 34.4%. Разрыв с предыдущим поколением получился двукратный.
Сравнение Claude Opus 5 с Fable 5, Opus 4.8 и GPT-5.6 Sol по двенадцати бенчмаркам. Источник: Anthropic.
Остальные строки таблицы:
GDPval-AA v2, офисная работа: у Opus 5 1861 балл, у Fable 5 1747, у Opus 4.8 1593. Более дорогая Fable 5 здесь позади.
BrowseComp, агентный поиск: 90.8% у Opus 5, 90.4% у GPT-5.6 Sol. Разница на уровне погрешности.
Humanity's Last Exam с доступом к инструментам: 64.7% у Opus 5, 63.9% у Fable 5, 57.9% у Opus 4.8.
OSWorld 2.0, работа с рабочим столом: 70.6% у Opus 5, 66.1% у Fable 5, 62.6% у GPT-5.6 Sol.
Но не все строки в пользу Opus 5, и Anthropic их не прячет:
DeepSWE v1.1: у GPT-5.6 Sol 72.7%, у Opus 5 68.8%. Единственный тест, где модель OpenAI обходит обе модели Anthropic сразу.
FrontierCode v1.1: счёт почти равный, 53.5% у Fable 5 и 53.4% у Opus 5.
Legal Agent Benchmark, held-out данные: 13.3% у Fable 5, 11.7% у Opus 5.
HealthBench Professional: 60.5% у GPT-5.6 Sol, 59.8% у Opus 5.
Эти четыре строки стоят в той же таблице, что и победы, без каких-либо оговорок мелким шрифтом.
Модель на каждый день вместо самой умной модели
Anthropic формулирует стратегию линейки без обтекаемостей. Представитель компании описал её в интервью VentureBeat так: Opus 5 — для сложной работы, которую отдают модели и проверяют по факту готовности; Fable 5 — для самых амбициозных задач, многодневных автономных проектов, которые раньше не мог взять на себя никто; Sonnet 5 — для работы, которая идёт в масштабе, где решает скорость и цена звонка; Haiku 4.5 — для субагентов и мгновенных ответов.
Средняя награда на Frontier-Bench v0.1 в зависимости от стоимости одной попытки, разные уровни эффорта от low до max. Источник: Anthropic.
На графике линия Opus 5 идёт заметно выше линий Opus 4.8 и GPT-5.6 Sol при сопоставимой стоимости попытки, а на верхних уровнях эффорта почти догоняет Fable 5, которая стоит дороже на каждом сравнимом уровне. Anthropic намеренно строит презентацию вокруг результата на единицу стоимости, а не вокруг пикового балла — это разговор не про то, кто умнее, а про то, что можно себе позволить прогонять тысячи раз в день.
Ранние клиенты подтверждают экономику цифрами, а не общими словами. Юридическая AI-компания Harvey получила от Opus 5 результат на уровне Opus 4.8 в режиме максимального рассуждения, но, по словам главы отдела прикладных исследований Нико Групена, с расходом на 26% меньше токенов. Fundamental Research Lab на сложных финансовых задачах получила точность на девять процентных пунктов выше при на треть меньшем числе ходов и вызовов инструментов, а по времени — на 60% быстрее.
Тройной скачок на тесте новых задач
Самое резкое число во всём релизе — не про кодинг и не про офисную работу. На ARC-AGI-3, тесте на решение задач, с которыми модель не встречалась в обучении, Opus 5 набирает 30.2% на высоком эффорте. Следующий результат в сравнении — у GPT-5.6 Sol, 7.8%. У Opus 4.8 на том же уровне эффорта — около 1.5%.
Итоговый счёт на ARC-AGI-3 в зависимости от полной стоимости прогона бенчмарка. Источник: Anthropic.
ARC-AGI не про знания и не про заученные шаблоны кода — каждая задача там новая, и решить её нельзя, просто вспомнив похожий пример из тренировочных данных. Рост с 1.5% до 30.2% за одно поколение модели не укладывается в обычную кривую бенчмарков, где годовой прогресс измеряется единицами процентов, и это ровно то число, ради которого исследователи AGI смотрят на релизы моделей внимательнее, чем на прирост в проценте на SWE-bench.
У этого скачка есть цена — прогон полного набора задач ARC-AGI-3 на Opus 5 в режиме high стоит около $20 000, что заметно дороже, чем у GPT-5.6 Sol на его максимальном эффорте. Задача сложная и требует много токенов на рассуждение независимо от модели, разница в основном в том, что у Opus 5 эти токены наконец начали окупаться результатом.
Модель, которая не сдаётся после первой неудачной попытки
В одном из тестовых заданий Frontier-Bench модели дали чертёж детали и попросили восстановить её как 3D CAD-модель — без возможности напрямую посмотреть на исходное изображение. Ни одна из конкурирующих моделей не решила задачу за пять попыток. Opus 5 написала собственный пайплайн компьютерного зрения, чтобы извлечь геометрию из пикселей чертежа, и повторяла попытки, пока не получила рабочий результат.
В другом случае модели дали реальный баг в популярном open-source пакетном менеджере. Одна из конкурирующих моделей заделала симптом и отчиталась об успехе. Opus 5 нашла причину глубже и закрыла edge case, который пропустил даже официальный патч сообщества. Инженер трейдинговой компании рассказал похожую историю уже не в тестовой среде — Opus 5 строила фид рыночных данных для новой биржи и, не найдя живого источника для проверки, сама написала тестовый стенд, чтобы валидировать код парсинга.
Доля пройденных бизнес-сценариев AutomationBench в зависимости от стоимости задачи. Источник: Anthropic.
Генеральный директор Zapier Уэйд Фостер описал результат на AutomationBench без метафор: Opus 5 возглавила рейтинг компании, прогнав полный сценарий предотвращения оттока клиентов от начала до конца без превышения расхода токенов прежних моделей Claude. Предыдущие модели этот сценарий целиком не проходили — Opus 5 закрыла его на 100%.
Схожая история от Stripe: старший инженер Кристиан Ривера отдал модели роль дежурного по своим дев-окружениям на выходные — Opus 5 сама построила систему мониторинга, провела каждую машину через нужные шаги и звала человека только там, где решение требовало субъективной оценки, а не проверки правил.
Осознанные границы вместо максимума возможностей
По автоматизированному поведенческому аудиту Opus 5 получила 2.3 балла за общий уровень несогласованного поведения — ниже, чем у Opus 4.8, Sonnet 5 и Fable 5 — и показала самый низкий уровень обманчивого поведения и самую низкую подверженность манипуляциям на использование модели во вред среди моделей Anthropic.
На кибербезопасность Opus 5 специально не обучали, как и Opus 4.8 до неё. Общий рост способностей модели подтянул и эту область сам по себе: на тесте OSS-Fuzz модель находит уязвимости с вероятностью 79.4% против 80% у конкурирующей Mythos 5 — почти на равных. Но довести уязвимость до рабочего эксплойта Opus 5 смогла лишь в 4 случаях против 13 у Mythos 5. Разрыв между обнаружением проблемы и её использованием выглядит выбором, а не случайностью — Anthropic ожидает, что классификаторы кибербезопасности Opus 5 будут срабатывать на 85% реже, чем у Fable 5.
В биологии направление обратное. Opus 5 стала самой способной из доступных широкой аудитории моделей Anthropic для научной работы — на внутреннем бенчмарке по химии прирост к Opus 4.8 составил 10.2 процентного пункта. При этом для многодневных открытых исследовательских кампаний, вроде автономного дизайна лекарств, Anthropic прямо называет более сильной моделью Mythos 5.
Итоговая картина не про идеальную модель без изъянов. Opus 5 сильнее прежней версии почти везде, уступает Fable 5 в задачах без чёткого финиша, а Mythos 5 в узких предметных областях — и Anthropic говорит об этом в собственном материале, а не прячет за общими фразами про рекорды.
Подключение Opus 5 из России без VPN
Anthropic не работает напрямую с российскими картами и IP-адресами — запрос к официальному API с территории России возвращает ошибку 403 или 451 без VPN. AITUNNEL даёт OpenAI-совместимый доступ к Claude Opus 5 с оплатой в рублях, регистрацией по законам РФ и без обхода блокировок.
Для перехода в коде меняется одна переменная. Base_url указывается как https://api.aitunnel.ru/v1/, в параметре модели прописывается claude-opus-5. Остальная логика — streaming, tool use, vision, Prompt Caching, смена набора инструментов и эффорт-уровни — работает без изменений в архитектуре приложения.
Оплата проходит картой российского банка или по счёту для юрлиц. Актуальный курс и наценку платформы к базовой цене $5/$25 за 1M токенов всегда стоит проверять в калькуляторе на странице провайдера — курс валют и условия могут меняться.
24 июля 2026Контекст: 1 000 000 токеновВывод: 128 000 токенов
Модель Anthropic, занявшая место основного рабочего инструмента в линейке Claude — между более дорогой Fable 5 и более быстрым Sonnet 5. По словам компании, Opus 5 приближается к интеллекту Fable 5 при половине её стоимости и ставит новые рекорды на бенчмарках агентного кодинга и офисной работы. Доступна через Claude API под идентификатором claude-opus-5.
Ключевые преимущества
43.3% на Frontier-Bench v0.1 против 21.1% у Opus 4.8 и 33.7% у Fable 5
30.2% на ARC-AGI-3 — втрое выше результата любой другой модели в сравнении
1861 балл на GDPval-AA v2, лучший результат среди всех сравниваемых моделей
70.6% на OSWorld 2.0, обходит Fable 5 при цене примерно в треть от неё
Самый низкий уровень несогласованного поведения среди моделей Anthropic по автоматизированному аудиту
Клиенты сообщают о экономии до 26% токенов при том же качестве ответа, что у Opus 4.8 на максимальном режиме
Подходит для
Повседневная агентная работа с кодом — дебаг, ревью, рефакторинг без раздувания счёта за токены
Бизнес-автоматизация многошаговых процессов — от заявки в CRM до финального письма клиенту
Работа с реальным рабочим столом и браузером через computer use
Финансовый и юридический анализ, где цена ошибки высока, а бюджет на инференс ограничен
Claude Opus 5 выигрывает не за счёт нового потолка возможностей — этот титул Anthropic сама оставляет за Fable 5. Модель выигрывает за счёт того, что делает почти вдвое больше на каждый потраченный доллар: 43.3% на Frontier-Bench против 21.1% у предшественника при той же цене $5/$25 за 1M токенов, тройной скачок на ARC-AGI-3 и клиенты, которые считают не пиковый балл, а сэкономленные токены и часы ручной проверки. Модель откровенно уступает Fable 5 на задачах без фиксированного финиша и отстаёт от Mythos 5 в кибербезопасности и биологии — Anthropic говорит об этом прямо в собственном анонсе. Для ежедневной агентной работы, где важен не рекорд, а стабильный результат за разумные деньги, Opus 5 сейчас лучший вариант в линейке Claude.
Часто задаваемые вопросы
Чем Claude Opus 5 отличается от Opus 4.8
Главное отличие — результаты на бенчмарках при той же цене: 43.3% против 21.1% на Frontier-Bench v0.1, 30.2% против 1.5% на ARC-AGI-3, 1861 против 1593 баллов на GDPval-AA v2. Технически добавлены thinking по умолчанию с новым ограничением на его отключение только при эффорте high и ниже, смена инструментов посреди разговора без сброса prompt cache и автоматические фолбэки на уровне API.
Сколько стоит Claude Opus 5 в API
$5 за 1M входных токенов и $25 за 1M выходных в обычном режиме — цена не изменилась относительно Opus 4.8. Fast mode, режим со скоростью примерно в 2.5 раза выше обычной, стоит вдвое дороже базовой цены — $10 за 1M входных и $50 за 1M выходных токенов.
Правда ли что Claude Opus 5 умнее Fable 5
Нет, Anthropic прямо называет Fable 5 более сильной моделью для многодневных автономных проектов и задач без фиксированного финиша. Opus 5 обходит Fable 5 на части прикладных бенчмарков — Frontier-Bench, GDPval-AA v2, OSWorld 2.0 — при заметно меньшей стоимости запроса, но уступает на FrontierCode v1.1 и Legal Agent Benchmark.
Что такое автоматические фолбэки и смена инструментов на лету
Автоматические фолбэки — бета-функция API, которая при срабатывании классификаторов безопасности на запросе к Opus 5 или Fable 5 переадресует его на другую модель вместо блокировки, с уведомлением в чате. Смена инструментов посреди разговора позволяет добавлять или убирать доступные модели инструменты между репликами диалога без сброса prompt cache — раньше это обесценивало кеш системного промпта целиком.
Как подключить Claude Opus 5 из России без VPN
Через AITUNNEL: зарегистрируйтесь, пополните баланс в рублях, получите API-ключ и укажите base_url = "https://api.aitunnel.ru/v1/", модель — claude-opus-5. Оплата картой российского банка или по счёту для юрлиц, обхода блокировок не требуется.
Доступ к этому провайдеру через AITUNNEL
Все модели провайдера доступны через единый API. Работает из России без VPN, оплата в рублях.
За последние два года рынок языковых моделей изменился до неузнаваемости. Если в 2023 году вопрос сводился к «ChatGPT или что-то другое», то сегодня выбор модел…
Рынок языковых моделей в 2025–2026 году развивается с такой скоростью, что даже опытные разработчики успевают за новинками с трудом. Если год назад выбор сводил…
Если попросить любого разработчика назвать первую AI-компанию, которая приходит на ум, 9 из 10 скажут OpenAI. Это не случайно: именно ChatGPT в ноябре 2022 года…