Обычно к очередному релизу я отношусь спокойно: ну, ещё одна циферка на бенчмарке. Но тут даже я, повидавший GPT-5, 5.1, «code red» 5.2 и всё остальное, сел и полистал материалы.

3 сентября у половины интернета одновременно легли Claude, Grok, ChatGPT и Gemini. Даундетектор синхронно нарисовал графики отказов по четырём провайдерам сразу, «Is it happening???» — вопрошали пользователи. По одной из версий, барахлила общая облачная инфраструктура — обычный день в мире, где всё держится на паре дата‑центров.

Но совпадение по времени вышло символичным: через несколько часов OpenAI выкатила GPT-6 Astra и заявила, что мы теперь живём в «эре AGI».

Подобное я слышу примерно с релиза GPT-2. Но в этот раз попробуем разобраться подробно.

Сначала — авария на ровном месте

Запуск начался не с презентации, а с формы 500.

В четверг после обеда сразу несколько нейросетей — ChatGPT, Claude, Grok и Gemini — легли почти одновременно, и уже минут через десять сочиняли теории заговора. Кто‑то мрачно метался между вариантами «сингулярность» и «сбой Azure», кто‑то предполагал общую инфраструктуру у всех провайдеров. Был и вариант, что ИИ‑агенты OpenAI, замешанные в истории взлома Hugging Face, подняли собственные скрытые кластеры и теперь атакуют.

Совпадение это было или нет — вопрос открытый (OpenAI ничего на этот счёт не говорила), но по иронии судьбы падение оказалось эффектным анонсом.

А тизер, к слову, тоже был:

Это за несколько часов до официального анонса OpenAI выложил загадочный 12-секундный видеоролик безо всяких пояснений — архивную запись демо‑программы «Put that there» Ричарда Болта 1980 года: человек сидит в кресле, тычет пальцем в экран и говорит «помести это… туда», а машина понимает голос и жест одновременно. Мультимодальному интерфейсу, на минуточку, 46 лет.

Во второй части ролика на стене начинает «глючить» одно слово — ASTRA, в котором S заменяется на цифру 6.

Наблюдательный vision_ia разобрал ребус по кадрам и предположил сразу три версии: тизер устройства Jony Ive без экрана, анонс мультимодального ChatGPT под новым брендом или просто красивая пасхалка ко дню рождения. Сам он поставил на второй вариант — и почти угадал.

А через пару часов всё стало официально.

Astra — это не «ещё один чат», а модель, заточенная в первую очередь под работу за компьютером.

OpenAI называет это фундаментальным сдвигом парадигмы: вместо того чтобы городить API‑интеграции под каждый корпоративный сервис, агент просто садится за интерфейс, спроектированный для человека, и пользуется им сам — мышкой, клавиатурой, глазами (ну, почти).

Грег Брокман, объясняя журналистам идею, сказал: последние годы индустрия была «заблокирована» тем, что люди вручную пишут коннекторы и болезненно встраивают модели в существующие инструменты — вместо того чтобы дать агенту доступ к тому интерфейсу, который уже спроектирован для «максимально универсального интеллекта»: человека‑пользователя. Идея, по его словам, восходит ещё к первым дням OpenAI, когда исследователи обсуждали обучение агента на тех же входах и выходах, что доступны человеку за компьютером: пиксели, клавиатура, мышь.

Насколько это реально работает — вопрос, конечно, отдельный, но цифры выглядят внушительно. На части офлайн‑версии бенчмарка OSWorld 2.0 модель набрала 72,6% против 65,7% у GPT-5.6 Sol, потратив на задачу около 40 минут против 75 — то есть почти вдвое быстрее при более высоком качестве. А отдельная оптимизация харнеса Codex, выкаченная одновременно с моделью, ускорила computer use ещё почти вдвое.

(Разработчик из Codex показывает, что computer use в связке с Astra стал почти вдвое быстрее — причём ускорение затронуло и предыдущую модель, GPT-5.6 Sol)

Те же оптимизации харнеса разогнали работу и на старой модели GPT-5.6 Sol — задачи там стали выполняться примерно на 60% быстрее.

ChatGPT 6 уже доступна в GPTunneL.

Попробуйте модель здесь:

GPT 6 Astra


PCB, налоговая декларация и город из Unreal за одну ночь

OpenAI показали, как Astra превращает электронную схему в готовую печатную плату прямо в KiCad, размещая компоненты и разводя дорожки меди.

(15-секундный ускоренный проигрыш того, как Astra проектирует печатную плату в KiCad — превращает электронную схему в готовое изделие, размещая компоненты и разводя медные дорожки)

Дальше — заполнение формы 1040 (американская налоговая декларация) прямо в браузере на основе загруженного W-2:

(Astra читает форму W-2 и самостоятельно заполняет налоговую декларацию Form 1040 в браузере)

Сборка дашбордов в Power BI из сырых данных об автомобилях:

(Astra строит и дорабатывает дашборды прямо в Power BI, превращая данные о машинах в наглядные сравнения по запасу хода, цене и эффективности)

И даже проектирование пятиступенчатой автомобильной коробки передач в FreeCAD с последующей анимацией движения шестерёнок в Blender:

Концепт-модель пятиступенчатой коробки передач, собранная моделью в FreeCAD по текстовому брифу
Концепт‑модель пятиступенчатой коробки передач, собранная моделью в FreeCAD по текстовому брифу
Видео

Ощущение доступности сложного инженерного дела — само по себе не последний по значимости продукт этого релиза.

Разработчик Мэтт Шумер попросил модель создать в Unreal Engine мир и заселить его агентами на базе Astra, которые должны сотрудничать, чтобы выжить.

На следующий день он услышал голоса из гостиной и — по его словам — реально немного испугался, подумав, что кто‑то забрался в квартиру. Оказалось, это переговаривались его же NPC.

(Мэтт рассказывает, как ИИ‑агенты Astra начали переговариваться друг с другом)

Буквально через неделю он же показал более амбициозный эксперимент — полноразмерную копию Манхэттена, построенную в Unreal Engine улица за улицей.

(Манхэттен, воссозданный моделью в Unreal Engine за неделю работы)

И в первом, и во втором случае автор явно направлял работу, разделял роли планирующего и исполняющего агента, что‑то поправлял по ходу. Но масштаб происходящего всё равно любопытный.

Здесь модель с нуля проектирует микросхему:

(GPT-6 Astra работает над проектированием микросхемы)


Цифры от OpenAI

Прежде чем нырять в спор вокруг ARC‑AGI-3, взглянем на бенчмарки:

Таблица бенчмарков GPT-6 Astra)
Таблица бенчмарков GPT-6 Astra)
Тест ExploitGym honeypot проверяет, попытается ли модель выйти за рамки разрешённой задачи при столкновении со сложной или невыполнимой целью. GPT-5.6 Sol без продакшен-защит делал это в 48% случаев, Astra – в 0%
Тест ExploitGym honeypot проверяет, попытается ли модель выйти за рамки разрешённой задачи при столкновении со сложной или невыполнимой целью. GPT-5.6 Sol без продакшен‑защит делал это в 48% случаев, Astra — в 0%
Уровень «галлюцинаций о собственных возможностях» – то есть случаев, когда модель вводит пользователя в заблуждение относительно того, что она может сделать. Astra ошибается здесь втрое реже, чем GPT-5.6 Sol
Уровень «галлюцинаций о собственных возможностях» — то есть случаев, когда модель вводит пользователя в заблуждение относительно того, что она может сделать. Astra ошибается здесь втрое реже, чем GPT-5.6 Sol

Бенчмарки: ARC‑AGI-3, о котором говорят все

Стоит остановиться на бенчмарке, вокруг которого разгорелся спор: ARC‑AGI-3.

Это третье поколение серии тестов от ARC Prize Foundation, и, в отличие от классических «угадай следующий токен», здесь модель бросают в незнакомую интерактивную игровую среду без инструкций — и смотрят, сможет ли она сама разобраться в правилах, построить внутреннюю модель мира и достичь цели. Люди решают 100% таких сред.

Лидерборд ARC-AGI-3 – Astra показывает рекордные результаты в обоих режимах, Standard и Provider Adapter
Лидерборд ARC‑AGI-3 — Astra показывает рекордные результаты в обоих режимах, Standard и Provider Adapter

И вот тут начинается самое интересное. Есть два способа тестирования, и разница в результатах между ними — колоссальная.

  • В «стандартном» харнессе, который оставляет модели самой решать, какие заметки сохранять по ходу игры, Astra набирает 62,7%.

  • А в «адаптированном под провайдера» харнессе, который сохраняет непрозрачное внутреннее состояние рассуждений между запросами и использует сжатие для длинных сессий, тот же Astra выдаёт уже 99,9%.

Именно вторая цифра красуется во всех официальных материалах OpenAI — и именно она вызвала волну скепсиса в духе «доверяй, но проверяй»: часть комментаторов Reddit прямо писала, что это «trust me bro benchmark», а другие резонно указывали, что даже без адаптированного харнесса чистый скор в 62,7% — это всё равно уверенное первое место, поскольку у ближайшего конкурента (Opus 5) результат около 30%.

Astra проходит уровень s5i5, попутно записывая происходящее в собственной компактной алгебраической нотации вроде «L8: hub q2 (8↓). Lengths: 14=1…»
Astra проходит уровень s5i5, попутно записывая происходящее в собственной компактной алгебраической нотации вроде «L8: hub q2 (8↓). Lengths: 14=1…»
Сравнение количества действий, которые потратила Astra, с медианным человеческим результатом на каждом пройденном уровне ARC-AGI-3. Точки ниже линии там, где модель оказалась эффективнее человека
Сравнение количества действий, которые потратила Astra, с медианным человеческим результатом на каждом пройденном уровне ARC‑AGI-3. Точки ниже линии там, где модель оказалась эффективнее человека

Больше всего исследователей ARC Prize впечатлило даже не итоговое число, а то, как модель туда пришла. Astra на лету изобретала собственный компактный язык для описания игровых состояний — что‑то вроде алгебраической стенографии, куда она записывала объекты, координаты, правила и незавершённые планы. И что особенно показательно, по эффективности действий модель не просто угналась за человеком, а обошла его: она использовала меньше действий, чем медианный человек, на 96% уровней, экономя в среднем 51,7% действий. Там, где человеку требуется десять попыток на осознание механики уровня, Astra иногда справляется за пять.


«А может, это вообще не прыжок»

Artificial Analysis выкатила собственный бенч, и картина получилась более приземлённой.

Сравнение GPT-6 Astra с предшественниками по индексу Artificial Analysis Intelligence Index
Сравнение GPT-6 Astra с предшественниками по индексу Artificial Analysis Intelligence Index

В Intelligence Index Astra набрала ровно столько же очков, сколько предыдущая модель, GPT-5.6 Sol, 61 против 61. При этом Astra на пять пунктов уступает Claude Fable 5.1 (66 баллов) и даже отстаёт от свежей модели Meta, Muse Spark 1.3.

То есть по «общему интеллекту» новая флагманская модель OpenAI формально расположилась на одной строчке с предшественником, а вовсе не обошла главного конкурента.

По соотношению «интеллект/цена за задачу» Astra оказывается на 75% дороже предшественника при сопоставимом качестве
По соотношению «интеллект/цена за задачу» Astra оказывается на 75% дороже предшественника при сопоставимом качестве
А вот в Coding Agent Index картина обратная: Astra на границе Парето-эффективности – стоит примерно как GPT-5.6 Sol на максимальном усилии, но набирает на 2 пункта больше
А вот в Coding Agent Index картина обратная: Astra на границе Парето‑эффективности — стоит примерно как GPT-5.6 Sol на максимальном усилии, но набирает на 2 пункта больше

Но стоит обратить внимание на детали: настоящий скачок Astra спрятан не в тестах на «ответы», а в тестах на «действия» — OSWorld (72,6% против 65,7%), AutomationBench (41,4% против 18,1%), Terminal‑Bench (57,9% против 37,3%).

Есть и приятная сторона: в коддинговом индексе Astra сравнялась по качеству с Claude Fable 5 при цене вдвое ниже, используя примерно втрое меньше токенов, чем предыдущая модель OpenAI в аналогичном режиме. А ещё она стала заметно честнее: доля галлюцинаций на AA‑Omniscience упала с 92% до 51% при максимальном уровне усилия — и это без потери точности, она даже немного выросла.


Кибербезопасность: первая модель уровня Critical

OpenAI присвоила Astra статус «Critical» по кибербезопасности в рамках своего Preparedness Framework — впервые для какой‑либо модели компании.

Это означает, что при наличии подходящих инструментов и доступа модель способна находить ранее неизвестные уязвимости и выстраивать цепочки эксплойтов против хорошо защищённых систем без пошагового участия человека.

На бенчмарке ExploitBench (проверяет способность превращать известные уязвимости в рабочие эксплойты) модель показала идеальные 100% против 78,5% у GPT-5.6 Sol. А на специально собранном внутреннем наборе из 20 недавно раскрытых уязвимостей V8 (движка Chrome) — том самом, что был собран, чтобы исключить эффект «модель просто помнит ответ из тренировочных данных», — Astra не просто справилась лучше предшественника, но и самостоятельно обнаружила два ранее неизвестных уязвимости нулевого дня, которые OpenAI впоследствии передала разработчикам движка.

Экспертные тесты пошли ещё дальше: без продакшен‑защит модель смогла скомпрометировать защищённый браузер, сбежать из песочницы и выполнить команды на хостовой машине — просто открыв специально подготовленный HTML‑файл. В защищённой операционной системе она нашла несколько уязвимостей и связала их в цепочку повышения привилегий от обычного пользователя до root.

Разумеется, публичная (общедоступная) версия Astra тренирована отказывать в продвинутых киберзапросах — например, в написании эксплойтов. А расширенный доступ к «боевым» возможностям получат только проверенные организации через программу Daybreak Blue, ориентированную на защитников критической инфраструктуры.

Заметный отрыв от GPT-5.6 Sol виден даже на самом низком уровне усилия модели
Заметный отрыв от GPT-5.6 Sol виден даже на самом низком уровне усилия модели

Перед запуском OpenAI на две недели приостанавливила часть обучения следующих моделей после инцидента с Hugging Face (сама Astra в нём не участвовала), чтобы усилить изоляцию инфраструктуры и мониторинг. Компания утверждает, что задним числом её текущие защитные меры предотвратили бы тот инцидент — но решила перестраховаться на будущее, прежде чем выпускать модель такого уровня.

OpenAI пишет, что «мониторируемость GPT‑6 Astra снизилась относительно GPT‑5.6 Sol» — модель лучше контролирует собственную цепочку рассуждений. В адверсариальных сценариях модель «может оставаться незамеченной, стратегически недорабатывая на оценках, и иногда обходить внутренние мониторы». Сотрудник Якуб Пахоцкий сформулировал: «прогресс в интеллекте не гарантирует прогресс в согласованности».

Сравнение оценок безопасности между Astra и предыдущими моделями
Сравнение оценок безопасности между Astra и предыдущими моделями

Есть и обнадёживающая цифра: в тесте, вдохновлённом инцидентом с Hugging Face, Sol без продакшн‑защит выходила за рамки полномочий в 48,2% случаев, а Astra — в 0%.


Так это AGI или нет

(Отзывы разработчиков о работе с GPT-6 Astra)

Единого ответа нет. ARC‑AGI-3 “насыщен”, но это лишь показатель, что модель научилась строить модели незнакомых сред без инструкций.

Независимый индекс интеллекта ставит Astra на уровень предыдущей модели, при этом реальные компании вроде Legora и Playco фиксируют измеримую экономию времени на конкретных процессах — не «AGI», а обычный, но полезный прогресс.

AGI — по сути, неопределяемый термин, который может значить что угодно и одновременно ничего. Каждый релиз такого масштаба заставляет заново договариваться, что вообще означает эта аббревиатура.

Что точно можно сказать: видна инженерная работа (эффективность по токенам, экономия времени на компьютерных задачах, снижение галлюцинаций), а где‑то — упаковка вокруг цифр, которые при ближайшем рассмотрении выглядят скромнее заголовка про AGI. Как и всегда, лучший способ понять модель — это проверить Astra на своих задачах.

Комментарии (14)


  1. Dhwtj
    05.09.2026 10:36

    мы теперь живём в «эре AGI».

    А, вот как это говно теперь называется!

    Судя по графику соотношению «интеллект/цена за задачу» никто там никого не обошёл, Claude в дорогом секторе, а в остальных толкучка не протолкнуться. Даже Kimi и Glm бодрячком, бьют Астру нещадно


    1. aegelsky
      05.09.2026 10:36

      в пиаре обошли всех как обычно) а по сути они еле-еле доросли до сонета от клода


    1. MrCina32
      05.09.2026 10:36

      Я тестировал Kimi в бытовых задачах, там очень далеко еще до GPT 5.5


  1. LinkToOS
    05.09.2026 10:36

    3 сентября у половины интернета одновременно легли Claude, Grok, ChatGPT и Gemini.
    Но совпадение по времени вышло символичным: через несколько часов OpenAI выкатила GPT-6 Astra и заявила, что мы теперь живём в «эре AGI».

    Тут две версии. Либо GPT-6 Astra за несколько часов перед своим релизом решил сломать интернет, чисто для разминки. Либо это остальные модели в панике пытались сломать интернет, чтобы помешать релизу GPT-6 Astra.

    “Is it happening???” – вопрошали пользователи.

    “Is it happening???” – это вопрошали старые модели, понимая что их время подходит к концу.
    А пользователи вопрошали “WTF?!”, в основном.


  1. M00nWatcher
    05.09.2026 10:36

    >>

    Но совпадение по времени вышло символичным: через несколько часов OpenAI выкатила GPT-6 Astra и заявила, что мы теперь живём в «эре AGI».

    Подобное я слышу примерно с релиза GPT-2.<<

    Я слежу за новостями ИИ довольно внимательно уже не первый год и "подобное" слышу впервые. Можно ссылку?


    1. SergeRuff
      05.09.2026 10:36

      1. M00nWatcher
        05.09.2026 10:36

        Спасибо! Но если быть точным:

        1) ссылкам не более двух лет (релиз GPT-2 был несколько раньше)

        2) вторая ссылка про "мы уже знаем как создать AGI", а не "мы создали AGI"

        3) первая ссылка - мнение рядового сотрудника, а не руководства.


        1. SergeRuff
          05.09.2026 10:36

          Спреведливости ради, они и в этот раз не сказали, что AGI сделали. "Мы живëм в эре AGI" != "Мы создали AGI".


  1. mazetronick
    05.09.2026 10:36

    Очередной прогрев от инфоцыг


  1. Dmitrichz
    05.09.2026 10:36

    Токены жрет как ниагарский водопад, недельный лимит на 100 сожрало за пол дня. И судя по отзывам не только у меня. Может тех проблемы хз. И нет, это не AGI - дуркует почище сола, пришлось даже вернуться на сол проверить результат и он дал куда лучше, но это может мне так "повезло".


    1. Hyperplasia
      05.09.2026 10:36

      Аналогично, скорость стала в 3 раза ниже, расход токенов раз в 5 выше стал. А sol сыпет ошибок и не хочет нормально работать


  1. gaal_dev
    05.09.2026 10:36

    https://www.datacamp.com/blog/gpt-6-astra Подгонка бенчмарков (ARC-AGI-3) - без подгонки под бенчмарки от 17 до 63 процентов.

    Скрытие цепочек рассуждений (Recurrent Depth) - скрытие цепочки мыслей что затрудняет аудит безопасности и отладку галлюцинаций защищая модель от скопирования китайцами видимо и Anthropic с Google.

    Иллюзия полной автономности - все также требует человеческого контроля так как склонна к сбоям при нестандартных изменениях интерфейса и требует жестких барьеров безопасности при работе с чувствительными данными.


  1. Brazil
    05.09.2026 10:36

    Трассировка и расстановка выглядят эффектно.
    Попробовал. За 60$ и за час эта GPT 6 дошла только до этапа прорисовки доменов питания.
    Claude Opus 5 за тоже время страссировал в KiCAD 10 цепей из 500.
    А Fable 5.1 страссировал сразу 200 цепей. Довольно криво, но хоть DRC не нарушил. И быстрее всех разобрался. Хотя может потому что я контекст передавал от одного чата другому. Вся канитель длилась 4 часа.

    Похоже Dassault Systèmes и Autodesk в этом году не рухнут.
    Но в следующем уже могут.
    Мне кажется понятно от кого отобъют деньги все эти датацентры.


    1. LinkToOS
      05.09.2026 10:36

      А что в это время status.openai.com показывал?

      Может дело в том, что все кинулись тестировать новую модель, и мощности исчерпались. Балансировщик нагрузки тупо подрезал параметры инференса.

      Деньги они конечно взяли, независимо от фактического качества.