
Обычно к очередному релизу я отношусь спокойно: ну, ещё одна циферка на бенчмарке. Но тут даже я, повидавший GPT-5, 5.1, «code red» 5.2 и всё остальное, сел и полистал материалы.
3 сентября у половины интернета одновременно легли Claude, Grok, ChatGPT и Gemini. Даундетектор синхронно нарисовал графики отказов по четырём провайдерам сразу, «Is it happening???» — вопрошали пользователи. По одной из версий, барахлила общая облачная инфраструктура — обычный день в мире, где всё держится на паре дата‑центров.
Но совпадение по времени вышло символичным: через несколько часов OpenAI выкатила GPT-6 Astra и заявила, что мы теперь живём в «эре AGI».
Подобное я слышу примерно с релиза GPT-2. Но в этот раз попробуем разобраться подробно.
Сначала — авария на ровном месте
Запуск начался не с презентации, а с формы 500.
В четверг после обеда сразу несколько нейросетей — ChatGPT, Claude, Grok и Gemini — легли почти одновременно, и уже минут через десять сочиняли теории заговора. Кто‑то мрачно метался между вариантами «сингулярность» и «сбой Azure», кто‑то предполагал общую инфраструктуру у всех провайдеров. Был и вариант, что ИИ‑агенты OpenAI, замешанные в истории взлома Hugging Face, подняли собственные скрытые кластеры и теперь атакуют.
Совпадение это было или нет — вопрос открытый (OpenAI ничего на этот счёт не говорила), но по иронии судьбы падение оказалось эффектным анонсом.
А тизер, к слову, тоже был:
Это за несколько часов до официального анонса OpenAI выложил загадочный 12-секундный видеоролик безо всяких пояснений — архивную запись демо‑программы «Put that there» Ричарда Болта 1980 года: человек сидит в кресле, тычет пальцем в экран и говорит «помести это… туда», а машина понимает голос и жест одновременно. Мультимодальному интерфейсу, на минуточку, 46 лет.
Во второй части ролика на стене начинает «глючить» одно слово — ASTRA, в котором S заменяется на цифру 6.
Наблюдательный vision_ia разобрал ребус по кадрам и предположил сразу три версии: тизер устройства Jony Ive без экрана, анонс мультимодального ChatGPT под новым брендом или просто красивая пасхалка ко дню рождения. Сам он поставил на второй вариант — и почти угадал.
А через пару часов всё стало официально.
Astra — это не «ещё один чат», а модель, заточенная в первую очередь под работу за компьютером.
OpenAI называет это фундаментальным сдвигом парадигмы: вместо того чтобы городить API‑интеграции под каждый корпоративный сервис, агент просто садится за интерфейс, спроектированный для человека, и пользуется им сам — мышкой, клавиатурой, глазами (ну, почти).
Грег Брокман, объясняя журналистам идею, сказал: последние годы индустрия была «заблокирована» тем, что люди вручную пишут коннекторы и болезненно встраивают модели в существующие инструменты — вместо того чтобы дать агенту доступ к тому интерфейсу, который уже спроектирован для «максимально универсального интеллекта»: человека‑пользователя. Идея, по его словам, восходит ещё к первым дням OpenAI, когда исследователи обсуждали обучение агента на тех же входах и выходах, что доступны человеку за компьютером: пиксели, клавиатура, мышь.
Насколько это реально работает — вопрос, конечно, отдельный, но цифры выглядят внушительно. На части офлайн‑версии бенчмарка OSWorld 2.0 модель набрала 72,6% против 65,7% у GPT-5.6 Sol, потратив на задачу около 40 минут против 75 — то есть почти вдвое быстрее при более высоком качестве. А отдельная оптимизация харнеса Codex, выкаченная одновременно с моделью, ускорила computer use ещё почти вдвое.
(Разработчик из Codex показывает, что computer use в связке с Astra стал почти вдвое быстрее — причём ускорение затронуло и предыдущую модель, GPT-5.6 Sol)
Те же оптимизации харнеса разогнали работу и на старой модели GPT-5.6 Sol — задачи там стали выполняться примерно на 60% быстрее.
PCB, налоговая декларация и город из Unreal за одну ночь
OpenAI показали, как Astra превращает электронную схему в готовую печатную плату прямо в KiCad, размещая компоненты и разводя дорожки меди.
(15-секундный ускоренный проигрыш того, как Astra проектирует печатную плату в KiCad — превращает электронную схему в готовое изделие, размещая компоненты и разводя медные дорожки)
Дальше — заполнение формы 1040 (американская налоговая декларация) прямо в браузере на основе загруженного W-2:
(Astra читает форму W-2 и самостоятельно заполняет налоговую декларацию Form 1040 в браузере)
Сборка дашбордов в Power BI из сырых данных об автомобилях:
(Astra строит и дорабатывает дашборды прямо в Power BI, превращая данные о машинах в наглядные сравнения по запасу хода, цене и эффективности)
И даже проектирование пятиступенчатой автомобильной коробки передач в FreeCAD с последующей анимацией движения шестерёнок в Blender:

Видео
Ощущение доступности сложного инженерного дела — само по себе не последний по значимости продукт этого релиза.
Разработчик Мэтт Шумер попросил модель создать в Unreal Engine мир и заселить его агентами на базе Astra, которые должны сотрудничать, чтобы выжить.
На следующий день он услышал голоса из гостиной и — по его словам — реально немного испугался, подумав, что кто‑то забрался в квартиру. Оказалось, это переговаривались его же NPC.
(Мэтт рассказывает, как ИИ‑агенты Astra начали переговариваться друг с другом)
Буквально через неделю он же показал более амбициозный эксперимент — полноразмерную копию Манхэттена, построенную в Unreal Engine улица за улицей.
(Манхэттен, воссозданный моделью в Unreal Engine за неделю работы)
И в первом, и во втором случае автор явно направлял работу, разделял роли планирующего и исполняющего агента, что‑то поправлял по ходу. Но масштаб происходящего всё равно любопытный.
Здесь модель с нуля проектирует микросхему:
(GPT-6 Astra работает над проектированием микросхемы)
Цифры от OpenAI
Прежде чем нырять в спор вокруг ARC‑AGI-3, взглянем на бенчмарки:



Бенчмарки: ARC‑AGI-3, о котором говорят все
Стоит остановиться на бенчмарке, вокруг которого разгорелся спор: ARC‑AGI-3.
Это третье поколение серии тестов от ARC Prize Foundation, и, в отличие от классических «угадай следующий токен», здесь модель бросают в незнакомую интерактивную игровую среду без инструкций — и смотрят, сможет ли она сама разобраться в правилах, построить внутреннюю модель мира и достичь цели. Люди решают 100% таких сред.

И вот тут начинается самое интересное. Есть два способа тестирования, и разница в результатах между ними — колоссальная.
В «стандартном» харнессе, который оставляет модели самой решать, какие заметки сохранять по ходу игры, Astra набирает 62,7%.
А в «адаптированном под провайдера» харнессе, который сохраняет непрозрачное внутреннее состояние рассуждений между запросами и использует сжатие для длинных сессий, тот же Astra выдаёт уже 99,9%.
Именно вторая цифра красуется во всех официальных материалах OpenAI — и именно она вызвала волну скепсиса в духе «доверяй, но проверяй»: часть комментаторов Reddit прямо писала, что это «trust me bro benchmark», а другие резонно указывали, что даже без адаптированного харнесса чистый скор в 62,7% — это всё равно уверенное первое место, поскольку у ближайшего конкурента (Opus 5) результат около 30%.


Больше всего исследователей ARC Prize впечатлило даже не итоговое число, а то, как модель туда пришла. Astra на лету изобретала собственный компактный язык для описания игровых состояний — что‑то вроде алгебраической стенографии, куда она записывала объекты, координаты, правила и незавершённые планы. И что особенно показательно, по эффективности действий модель не просто угналась за человеком, а обошла его: она использовала меньше действий, чем медианный человек, на 96% уровней, экономя в среднем 51,7% действий. Там, где человеку требуется десять попыток на осознание механики уровня, Astra иногда справляется за пять.
«А может, это вообще не прыжок»
Artificial Analysis выкатила собственный бенч, и картина получилась более приземлённой.

В Intelligence Index Astra набрала ровно столько же очков, сколько предыдущая модель, GPT-5.6 Sol, 61 против 61. При этом Astra на пять пунктов уступает Claude Fable 5.1 (66 баллов) и даже отстаёт от свежей модели Meta, Muse Spark 1.3.
То есть по «общему интеллекту» новая флагманская модель OpenAI формально расположилась на одной строчке с предшественником, а вовсе не обошла главного конкурента.


Но стоит обратить внимание на детали: настоящий скачок Astra спрятан не в тестах на «ответы», а в тестах на «действия» — OSWorld (72,6% против 65,7%), AutomationBench (41,4% против 18,1%), Terminal‑Bench (57,9% против 37,3%).
Есть и приятная сторона: в коддинговом индексе Astra сравнялась по качеству с Claude Fable 5 при цене вдвое ниже, используя примерно втрое меньше токенов, чем предыдущая модель OpenAI в аналогичном режиме. А ещё она стала заметно честнее: доля галлюцинаций на AA‑Omniscience упала с 92% до 51% при максимальном уровне усилия — и это без потери точности, она даже немного выросла.
Кибербезопасность: первая модель уровня Critical
OpenAI присвоила Astra статус «Critical» по кибербезопасности в рамках своего Preparedness Framework — впервые для какой‑либо модели компании.
Это означает, что при наличии подходящих инструментов и доступа модель способна находить ранее неизвестные уязвимости и выстраивать цепочки эксплойтов против хорошо защищённых систем без пошагового участия человека.
На бенчмарке ExploitBench (проверяет способность превращать известные уязвимости в рабочие эксплойты) модель показала идеальные 100% против 78,5% у GPT-5.6 Sol. А на специально собранном внутреннем наборе из 20 недавно раскрытых уязвимостей V8 (движка Chrome) — том самом, что был собран, чтобы исключить эффект «модель просто помнит ответ из тренировочных данных», — Astra не просто справилась лучше предшественника, но и самостоятельно обнаружила два ранее неизвестных уязвимости нулевого дня, которые OpenAI впоследствии передала разработчикам движка.
Экспертные тесты пошли ещё дальше: без продакшен‑защит модель смогла скомпрометировать защищённый браузер, сбежать из песочницы и выполнить команды на хостовой машине — просто открыв специально подготовленный HTML‑файл. В защищённой операционной системе она нашла несколько уязвимостей и связала их в цепочку повышения привилегий от обычного пользователя до root.
Разумеется, публичная (общедоступная) версия Astra тренирована отказывать в продвинутых киберзапросах — например, в написании эксплойтов. А расширенный доступ к «боевым» возможностям получат только проверенные организации через программу Daybreak Blue, ориентированную на защитников критической инфраструктуры.

Перед запуском OpenAI на две недели приостанавливила часть обучения следующих моделей после инцидента с Hugging Face (сама Astra в нём не участвовала), чтобы усилить изоляцию инфраструктуры и мониторинг. Компания утверждает, что задним числом её текущие защитные меры предотвратили бы тот инцидент — но решила перестраховаться на будущее, прежде чем выпускать модель такого уровня.
OpenAI пишет, что «мониторируемость GPT‑6 Astra снизилась относительно GPT‑5.6 Sol» — модель лучше контролирует собственную цепочку рассуждений. В адверсариальных сценариях модель «может оставаться незамеченной, стратегически недорабатывая на оценках, и иногда обходить внутренние мониторы». Сотрудник Якуб Пахоцкий сформулировал: «прогресс в интеллекте не гарантирует прогресс в согласованности».

Есть и обнадёживающая цифра: в тесте, вдохновлённом инцидентом с Hugging Face, Sol без продакшн‑защит выходила за рамки полномочий в 48,2% случаев, а Astra — в 0%.
Так это AGI или нет
(Отзывы разработчиков о работе с GPT-6 Astra)
Единого ответа нет. ARC‑AGI-3 “насыщен”, но это лишь показатель, что модель научилась строить модели незнакомых сред без инструкций.
Независимый индекс интеллекта ставит Astra на уровень предыдущей модели, при этом реальные компании вроде Legora и Playco фиксируют измеримую экономию времени на конкретных процессах — не «AGI», а обычный, но полезный прогресс.
AGI — по сути, неопределяемый термин, который может значить что угодно и одновременно ничего. Каждый релиз такого масштаба заставляет заново договариваться, что вообще означает эта аббревиатура.
Что точно можно сказать: видна инженерная работа (эффективность по токенам, экономия времени на компьютерных задачах, снижение галлюцинаций), а где‑то — упаковка вокруг цифр, которые при ближайшем рассмотрении выглядят скромнее заголовка про AGI. Как и всегда, лучший способ понять модель — это проверить Astra на своих задачах.
Комментарии (14)

LinkToOS
05.09.2026 10:363 сентября у половины интернета одновременно легли Claude, Grok, ChatGPT и Gemini.
Но совпадение по времени вышло символичным: через несколько часов OpenAI выкатила GPT-6 Astra и заявила, что мы теперь живём в «эре AGI».Тут две версии. Либо GPT-6 Astra за несколько часов перед своим релизом решил сломать интернет, чисто для разминки. Либо это остальные модели в панике пытались сломать интернет, чтобы помешать релизу GPT-6 Astra.
“Is it happening???” – вопрошали пользователи.
“Is it happening???” – это вопрошали старые модели, понимая что их время подходит к концу.
А пользователи вопрошали “WTF?!”, в основном.

M00nWatcher
05.09.2026 10:36>>
Но совпадение по времени вышло символичным: через несколько часов OpenAI выкатила GPT-6 Astra и заявила, что мы теперь живём в «эре AGI».
Подобное я слышу примерно с релиза GPT-2.<<
Я слежу за новостями ИИ довольно внимательно уже не первый год и "подобное" слышу впервые. Можно ссылку?

SergeRuff
05.09.2026 10:36https://www.forbes.com/sites/johnkoetsier/2025/01/06/openai-ceo-sam-altman-we-know-how-to-build-agi/

M00nWatcher
05.09.2026 10:36Спасибо! Но если быть точным:
1) ссылкам не более двух лет (релиз GPT-2 был несколько раньше)
2) вторая ссылка про "мы уже знаем как создать AGI", а не "мы создали AGI"
3) первая ссылка - мнение рядового сотрудника, а не руководства.

SergeRuff
05.09.2026 10:36Спреведливости ради, они и в этот раз не сказали, что AGI сделали. "Мы живëм в эре AGI" != "Мы создали AGI".

Dmitrichz
05.09.2026 10:36Токены жрет как ниагарский водопад, недельный лимит на 100 сожрало за пол дня. И судя по отзывам не только у меня. Может тех проблемы хз. И нет, это не AGI - дуркует почище сола, пришлось даже вернуться на сол проверить результат и он дал куда лучше, но это может мне так "повезло".

Hyperplasia
05.09.2026 10:36Аналогично, скорость стала в 3 раза ниже, расход токенов раз в 5 выше стал. А sol сыпет ошибок и не хочет нормально работать

gaal_dev
05.09.2026 10:36https://www.datacamp.com/blog/gpt-6-astra Подгонка бенчмарков (ARC-AGI-3) - без подгонки под бенчмарки от 17 до 63 процентов.
Скрытие цепочек рассуждений (Recurrent Depth) - скрытие цепочки мыслей что затрудняет аудит безопасности и отладку галлюцинаций защищая модель от скопирования китайцами видимо и Anthropic с Google.
Иллюзия полной автономности - все также требует человеческого контроля так как склонна к сбоям при нестандартных изменениях интерфейса и требует жестких барьеров безопасности при работе с чувствительными данными.

Brazil
05.09.2026 10:36Трассировка и расстановка выглядят эффектно.
Попробовал. За 60$ и за час эта GPT 6 дошла только до этапа прорисовки доменов питания.
Claude Opus 5 за тоже время страссировал в KiCAD 10 цепей из 500.
А Fable 5.1 страссировал сразу 200 цепей. Довольно криво, но хоть DRC не нарушил. И быстрее всех разобрался. Хотя может потому что я контекст передавал от одного чата другому. Вся канитель длилась 4 часа.
Похоже Dassault Systèmes и Autodesk в этом году не рухнут.
Но в следующем уже могут.
Мне кажется понятно от кого отобъют деньги все эти датацентры.
LinkToOS
05.09.2026 10:36А что в это время status.openai.com показывал?
Может дело в том, что все кинулись тестировать новую модель, и мощности исчерпались. Балансировщик нагрузки тупо подрезал параметры инференса.
Деньги они конечно взяли, независимо от фактического качества.

Dhwtj
А, вот как это говно теперь называется!
Судя по графику соотношению «интеллект/цена за задачу» никто там никого не обошёл, Claude в дорогом секторе, а в остальных толкучка не протолкнуться. Даже Kimi и Glm бодрячком, бьют Астру нещадно
aegelsky
в пиаре обошли всех как обычно) а по сути они еле-еле доросли до сонета от клода
MrCina32
Я тестировал Kimi в бытовых задачах, там очень далеко еще до GPT 5.5