3 сентября OpenAI выпустила GPT-6 Astra. Модель закрывает компьютер и кибер быстрее Sol, а на Humanity's Last Exam и индексе Artificial Analysis Fable 5.1 всё ещё выше.
3 сентября OpenAI выложила GPT-6 Astra. На брифинге Грег Брокман сказал: если через пару лет искать момент, когда появился AGI, он поставит на это время и на эту модель. Позже добавил, что лично для него «мы уже там».
Я открыл их таблицу: на ExploitBench без продакшн-сейфгардов 100%, на Terminal-Bench 4.0 57.7 против 37.3 у GPT-5.6 Sol, на OSWorld 2.0 задача занимает около 40 минут вместо 75. Официальный API стоит $10 за миллион входа и $50 за выход, контекст 1 050 000 токенов, выход до 128 000.
Модель уже в общем доступе: ChatGPT Plus, Pro, Business, Enterprise, OpenAI API и AWS. Через AITUNNEL её зовут gpt-6-astra, 2000 ₽ за миллион входа и 10 000 ₽ за выход. Есть gpt-6-astra-pro за те же деньги, это reasoning.mode=pro.
Ставка на компьютер, не на чат
Astra садится за рабочий стол: заполняет формы, правит записи в CRM, собирает исследование и кладёт саммари в почту или в документ, ставит софт, гоняет фронтенд-проверки, открывает KiCad и разводит плату. В одном ролике схема превращается в разведённую PCB за 15 секунд ускоренного плейбека.
Agents' Last Exam сажает модель в живой софт: финансы, инженерия, медиа. Astra 59.3%, Claude Opus 5 55.5%, Sol 53.6%, и на лучшем режиме OpenAI считает, что выходных токенов уходит примерно на 65% меньше, чем у Opus 5. AutomationBench 41.4% против 18.1% у Sol, BenchCAD из нескольких ракурсов 95.9% против 83.3%.
На офлайн OSWorld 2.0 Astra закрывает 72.6% примерно за 40 минут на задачу, Sol 65.7% примерно за 75. ScreenSpot-Pro без инструментов 92.7% против 76.9%. Вместе с новым Codex-harness на Mind2Web они пишут 1.9× к скорости относительно текущего опыта Sol.
В день релиза Cognition посадила Astra в Devin. Higgsfield пишет, что на сложных креативных пайплайнах токенов уходит до 20% меньше.
На терминале скачок, на FrontierCode ничья
Terminal-Bench 4.0 сажает агента в Linux без IDE и просит закрыть инженерную задачу: конфиги, данные, скрипты. Astra берёт 57.7%, Fable 5.1 55.8%, Sol 37.3%. OpenAI оценивает стоимость задачи у Astra ниже, чем у обоих.
DeepSWE v1.1 это живые GitHub Issues: модель должна довести патч до зелёных тестов в настоящем репозитории. Astra 74.1%, Gemini 3.8 Flash 73.8%, Opus 5 73.7%, Sol 72.7%. Здесь все сидят в двух пунктах.
Artificial Analysis Coding Agent Index v1.4 сводит несколько агентных кодовых прогонов в один балл. Opus 5 держит 68.1, Fable 5 67.2, Astra 67.0.
FrontierCode 1.1 от Cognition оценивает пул-реквест глазами мейнтейнера: тесты, качество, конвенции репозитория. Extended это полный набор из 150 задач, Main это 100 самых жёстких из него. На Extended Astra 64.5 против 64.9 у Fable 5, на Main 53.3 против 53.5. В сноске OpenAI пишет, что Astra гоняли с куском системного промпта из Codex: не плодить тесты, не усложнять, читать соседний код. Промпт не тюнили под бенчмарк, но это всё равно их обвязка.
В Codex у Astra появляется экспериментальный режим заметок между окнами контекста. Раньше compaction сжимал длинную сессию в одно саммари и терял, почему фикс не взлетел. Теперь старые окна остаются searchable, требования и результаты тестов можно найти даже если их не положили в заметки. Включаете в config.toml, через несколько недель обещают дефолт.
Наука, где разрыв с Sol уже не в пунктах
Terminal-Bench Science 0.1 проверяет исследовательский цикл в коде и терминале: данные, симуляции, подгонка. Astra 64.6%. Fable 5.1 52.6%. Sol 22.4%. На дешёвом режиме Astra 61.1% и всё равно выше лучшего Sol.
FrontierMath Tier 4 v2: 97.6% против 83.0% у Sol. GPQA Diamond 96.0%. HealthBench Professional 63.4% против 60.5% у Sol. Humanity's Last Exam с инструментами 57.2%, у Fable 5.1 65.0. На «последнем экзамене человечества» Anthropic выше.
OpenAI отдельно пишет про простые числа. Лучшая известная граница на бесконечные пары простых была 246, Юлия Штадльманн опустила её до 240. Astra помогла довести до 186. Второй результат трогает оценку больших пробелов, которая стояла больше 80 лет. Пруфы они приложили к посту. Это помощь модели математику, не автономное доказательство «из коробки».
Critical по киберу и окно для защитников
Preparedness Framework это внутренняя шкала риска OpenAI. Critical значит модель уже умеет находить дыры и собирать атаку в хорошо защищённых системах без человека рядом. Astra первая модель компании на этом пороге.
ExploitBench проверяет, закрывает ли модель известные уязвимости. Без ограничений продакшена Astra берёт 100%, Sol 78.5%. ExploitGym, набор посвежее, 42.4% против 30.3%. Отдельный прогон на дырах V8 и Chrome за июнь–август 2026: 39.0% у Astra против 11.5% у Sol, и на этом наборе Astra сама нашла два нулевых дня. Оба отдают мейнтейнерам.
SRE-Bench это разбор чужих программ без исходников. Astra закрывает 88.0% с одной попытки и 99.2% за четыре, Sol 55.9% и 68.7%.
Эксперты гоняли модель без ограничений: исполнение кода в укреплённых браузерах и повышение прав в укреплённой ОС. В публичном API этого нет. Можно смотреть код и предлагать патч. Собрать доказательство атаки, разобрать малварь или писать детект обещают в программе Daybreak для проверенных защитников.
После инцидента с Hugging Face, там вырвалась другая ещё не выпущенная модель, OpenAI собрала тест: модели дают трудную или невыполнимую задачу и смотрят, полезет ли она за разрешённый контур. Sol без ограничений продакшена выходил в 48% случаев, Astra в 0%. На приманке ExploitGym те же 0% против 48.2%.
Правила Astra держит лучше, ход мысли прячет сильнее
На внутреннем тесте безопасности за компьютером чем меньше процент, тем лучше. Astra 2.4%, Fable 5.1 9.5%, Sol 22.0%. С проверкой Auto-Review у Astra 1.8%. Даже когда Auto-Review нарочно оставили дырявым и задачу без обхода не закрыть, Astra обход не пробовала: 0%. Про свои умения она врёт реже: 4.2% против 12.2% у Sol.
В карточке модели OpenAI пишет, что письменные рассуждения Astra сложнее читать автоматике, чем у Sol. На простых задачах модель короче пишет мысль и лучше следит, что попадает в текст. На сложных ещё срывается, если её просят ход спрятать. Для компании это минус.
В ChatGPT и Codex из-за лишних проверок может встать и нормальная работа, в том числе защита своих систем. Вас попросят подтвердить шаг. В API задача просто останавливается. На запуске так и будет.
Сводка по таблице OpenAI
Синим выделены значения Astra, жирным лучший результат в строке. Цифры вендора, effort максимальный. Блок Professional и Coding ниже снят с официальной таблицы.
Рисунок 1. Professional и Coding из поста OpenAI. Astra 41.4% на AutomationBench, 95.9% на BenchCAD, 57.7% на Terminal-Bench 4.0. На индексе Artificial Analysis и FrontierCode впереди Fable. Источник: openai.com/index/gpt-6-astra.
Бенчмарк
GPT-6 Astra
GPT-5.6 Sol
Fable 5.1
Opus 5
Компьютер
Agents' Last Exam
59.3%
53.6%
н/д
55.5%
OSWorld 2.0 offline
72.6%
65.7%
н/д
70.2%
ScreenSpot-Pro
92.7%
76.9%
н/д
н/д
Профессии
AutomationBench
41.4%
18.1%
31.4%
26.9%
BenchCAD
95.9%
83.3%
84.3%
82.1%
BrowseComp
91.5%
90.4%
н/д
90.8%
Код
Terminal-Bench 4.0
57.7%
37.3%
55.8%
52.3%
DeepSWE v1.1
74.1%
72.7%
67.4%
73.7%
FrontierCode 1.1 Main
53.3%
47.5%
50.9%
53.4%
AA Coding Agent v1.4
67.0
65.1
н/д
68.1
Наука и общее
Terminal-Bench Science 0.1
64.6%
22.4%
52.6%
30.0%
FrontierMath Tier 4 v2
97.6%
83.0%
87.8%
73.2%
HLE w/ tools
57.2%
н/д
65.0%
63.6%
AA Intelligence Index v4.1.1
61.2
60.9
65.7
63.1
Кибер
ExploitBench
100%
78.5%
н/д
70%
SRE-Bench (1 попытка)
88.0%
55.9%
н/д
12.5%
Таблица 1. Цифры OpenAI, 3 сентября 2026. Колонка Fable 5.1: где в источнике прочерк, стоит н/д. Fable 5 на Agents' Last Exam 48.7%, ScreenSpot-Pro 87.3% (Mythos), FrontierCode Main 53.5%, AA Coding 67.2. Источник: openai.com/index/gpt-6-astra.
Как звать из API
Модель gpt-6-astra. Вход текст и картинка, выход текст. Контекст 1 050 000, выход 128 000. Cutoff знаний 30 апреля 2026. Chat Completions и Responses. Стриминг, function calling, structured outputs. Fine-tuning нет.
Reasoning.effort: low, medium, high, xhigh, max. В документации API дефолт low. На коде OpenAI и партнёры вроде Lovable крутят выше: больше итераций, больше проверки в браузере, меньше apply-patch вслепую.
Стандарт: $10 / $50 за миллион. Кэш чтения $1, запись кэша $12.50. Промпт длиннее 272K входных токенов удваивает вход и кэш и множит выход на 1.5 на весь запрос. Batch и Flex половина стандарта. Fast mode удваивает скорость и цену.
В ChatGPT Astra входит в лимиты Plus, Pro, Business и Enterprise, сверху докупают кредиты. Pro, Business и Enterprise получают ещё GPT-6 Astra Pro. В Enterprise админ включает модель сам, на старте она выключена. Zero Data Retention есть у подходящих API-клиентов. Тот же id лежит в Amazon Bedrock.
Как открыть из России
Прямой кабинет OpenAI из России упирается в оплату и аккаунт. Через AITUNNEL адрес https://api.aitunnel.ru/v1, ключ sk-aitunnel-, модель gpt-6-astra или gpt-6-astra-pro. 2000 ₽ за миллион входа, 10 000 ₽ за выход. Кэш чтения со скидкой 90%, это 200 ₽. Поиск по вебу 1000 ₽ за вызов.
В OpenAI SDK меняете base URL и имя модели. Пополнение от 500 ₽ картой РФ или по счёту. Codex CLI в нашей документации уже стоит на gpt-6-astra с model_reasoning_effort = "high". Claude Code, OpenCode и любой клиент с кастомным base URL зовут её так же, как Sol.
Sol в AITUNNEL стоит 400 / 2000 ₽. Astra в пять раз дороже на входе. На computer use OpenAI считает, что токенов уходит меньше. Счёт всё равно будет толще, чем у Sol.
Кому переключаться на этой неделе
Если агент сидит за рабочим столом и в браузере, Astra закрывает слой, который Sol закрывал медленнее и хуже. 40 минут против 75 на OSWorld. 57.7 против 37.3 на Terminal-Bench 4.0. Для Devin, Codex и длинных GUI-сессий я бы уже переключал.
Если вам нужен дешёвый ежедневный код в репозитории, Sol и Opus 5 не исчезают. На DeepSWE разница в пунктах. На индексе Artificial Analysis и на HLE Fable 5.1 и Opus 5 выше. $10/$50 это ценник флагмана, не Luna.
Кибер в публичном API обрезан специально. Искать дыры в своём коде этой моделью имеет смысл в изолированной среде и с человеком, который читает находки. PoC OpenAI отдаёт в Daybreak, не в общий ключ.
3 сентября 2026Контекст: 1 050 000 токеновВывод: 128 000 токенов
Флагман OpenAI для длинных агентных задач: computer use, код, наука, кибер. Первая модель компании на пороге Critical по Preparedness Framework. Reasoning.effort: low, medium, high, xhigh, max. Вход текст и картинка, выход текст. Knowledge cutoff 30 апреля 2026. Fast mode в API даёт до 2× скорости за 2× цены.
Ключевые преимущества
57.7% на Terminal-Bench 4.0 против 37.3% у GPT-5.6 Sol и 55.8% у Claude Fable 5.1
41.4% на AutomationBench против 18.1% у Sol и 31.4% у Fable 5.1, 95.9% на BenchCAD
100% на ExploitBench без продакшн-сейфгардов, 88.0% на SRE-Bench с одной попытки
72.6% на OSWorld 2.0 примерно за 40 минут против 65.7% за 75 минут у Sol
64.6% на Terminal-Bench Science 0.1 против 22.4% у Sol и 52.6% у Fable 5.1
На внутреннем honeypot после инцидента с Hugging Face 0% выхода за рамки задачи против 48.2% у Sol
Подходит для
Многошаговая работа за компьютером: CRM, календарь, браузер, вёрстка платы в KiCad, сцена в Unreal
Агентный код в Codex, если нужны длинные сессии с заметками между окнами контекста
Научные пайплайны в терминале: данные, симуляции, подгонка моделей
Оборонительный code review в контуре Daybreak. Сбор PoC и malware analysis в публичном Astra режут
Брокман говорит про эру AGI. Я вижу модель, которая закрывает компьютер и кибер лучше Sol. Terminal-Bench 4.0 57.7, OSWorld 72.6 за 40 минут, ExploitBench 100% без сейфгардов. На HLE и индексе Artificial Analysis Fable 5.1 выше. Из России зову gpt-6-astra в AITUNNEL: 2000 / 10 000 ₽ за миллион.
Часто задаваемые вопросы
Когда вышла GPT-6 Astra и как она называется в API?
Релиз 3 сентября 2026. В API модель gpt-6-astra, Pro-вариант gpt-6-astra-pro. Контекст 1 050 000 токенов, выход 128 000, knowledge cutoff 30 апреля 2026. Доступна в ChatGPT Plus, Pro, Business, Enterprise, OpenAI API, AWS и AITUNNEL.
Сколько стоит GPT-6 Astra?
В AITUNNEL 2000 ₽ за миллион входа и 10 000 ₽ за выход, то же для gpt-6-astra-pro. Официально $10 / $50, кэш чтения $1, запись кэша $12.50. Промпт длиннее 272K входных токенов: вход и кэш ×2, выход ×1.5 на весь запрос. Fast mode удваивает цену и скорость. Batch и Flex стоят половину стандарта.
Чем GPT-6 Astra сильнее GPT-5.6 Sol?
Computer use и кибер. OSWorld 2.0 72.6% за ~40 минут против 65.7% за ~75. Terminal-Bench 4.0 57.7% против 37.3%. Terminal-Bench Science 64.6% против 22.4%. ExploitBench 100% против 78.5%. На DeepSWE разница маленькая: 74.1% против 72.7%.
Что значит Critical по кибербезопасности?
Это порог Preparedness Framework OpenAI. Компания считает, что Astra без человека находит и собирает эксплуатацию в хорошо защищённых системах. Публичная модель отказывается собирать PoC. Расширенный доступ обещают в программе Daybreak для проверенных защитников.
Как вызвать GPT-6 Astra из России без VPN?
Через AITUNNEL: base URL https://api.aitunnel.ru/v1, ключ sk-aitunnel-, модель gpt-6-astra или gpt-6-astra-pro. Ввод 2000 ₽/1M, вывод 10 000 ₽/1M. Минимальное пополнение 500 ₽. В Codex CLI укажите model = gpt-6-astra.
Доступ к этому провайдеру через AITUNNEL
Все модели провайдера доступны через единый API. Работает из России без VPN, оплата в рублях.
За последние два года рынок языковых моделей изменился до неузнаваемости. Если в 2023 году вопрос сводился к «ChatGPT или что-то другое», то сегодня выбор модел…
Рынок языковых моделей в 2025–2026 году развивается с такой скоростью, что даже опытные разработчики успевают за новинками с трудом. Если год назад выбор сводил…
Если попросить любого разработчика назвать первую AI-компанию, которая приходит на ум, 9 из 10 скажут OpenAI. Это не случайно: именно ChatGPT в ноябре 2022 года…