Бенчмарки нужны для того, чтобы инженер мог проверить свой проект, посмотреть на конкурентов и сравнить себя с ними. У каждого бенчмарка своя цель.

ARC‑AGI-3 создан фондом ARC Prize Foundation, основатель Франсуа Шолле, для оценки общего интеллекта и способности ИИ‑агентов к обучению. Сложные интерактивные задачи в виде игр подразумевали, что решить их сможет только тот искусственный интеллект, который умеет исследовать незнакомый мир, понимает правила на лету, планирует действия и адаптируется к новым условиям. То есть умеет обучаться.

Ряд проектов заявляют о показателе в этом бенчмарке в 100%. Но это не победа. В этой статье я разбираю почему.

Что такое ARC‑AGI-3

Бенчмарк ARC стартовал в 2019 году с задач на цветных сетках, когда модель должна была по двум примерам решить задачу. Шолле ориентировался на то, что для каждой задачи своё правило, и его нет в обучающих данных. То есть модель выводит его непосредственно в моменте. Сам Шолле сформулировал это как измерение эффективности приобретения навыка, а не самого навыка.

ARC‑AGI-1 продержался пять лет. Первые решения достигали единиц процентов. Потом использовали алгоритмы перебора, создается набор элементарных операций над сеткой и банальный поиск комбинации, подходящей под примеры.В какой‑то мере это работало, но из‑за комбинаторного взрыва не поддавалось масштабированию. Первых реальных успехов добились рассуждающие LLM, их показатель превысил 70%.

ARC‑AGI-2, как ответ, вышел в 2025 году, для решения задачи требовалось использовать несколько правил и удерживать контекст. Текущие LLM этого не смогли.

ARC‑AGI-3, последний на сегодня вариант, изменил формат задач. Задачи превратились в интерактивные игры в стиле Атари. Если в статической задаче агент соревновался в первую очередь за вычислительную мощность перебора, то в игре неизвестны правила, цель, и выявить их можно только в непосредственном действии. При этом оценивается количество действий..

Метрика RHAE ориентируется на два показателя: сколько уровней пройдено и сколько действий на это ушло. Эталоном служит усредненный человек, играющий впервые. Предполагалось, что если агент действительно выводит правила из наблюдений, он потратит мало действий. Если занимается перебором, то действий будет существенно больше. 

Как решают бенчмарк нейросети

По сути для нейросетей можно выделить три подхода:

Прямое взаимодействие. Игра отдаёт модели состояния игры, нейросеть выдаёт следующее действие. Нет обвязки, максимум рассуждение в контексте. показатели так себе, модель теряет нить, повторяет ошибки, галлюцинирует.

Обучение с подкреплением. Классический вариант для нейросетей, но само устройство бенчмарка не позволяет набрать нужный объём датасета.

Агентная обвязка. Модель работает в цикле с инструкцией, памятью, файловой системой и исполняемым кодом. Этот подход показал максимальный результат.

Хочу отметить, что бенчмарк, измеряющий способность к обучению, фактически проверяет качество инженерной обвязки вокруг нейросети.

Проект Сергея Родионова

Попробуем разобрать проект Сергея Родионова, PhD из SingularityNET, чистый пример третьего подхода. Я разбирал первый препринт, затем послушал доклад Сергея, со свежими результатами, а после посмотрел его вторую работу, где автор сам анализирует свой проект.

Очень грубо схема проекта: агент — это Codex с доступом к Linux‑окружению, файлам и питону. Алгоритмический контроллер отправляет агенту промпты, управляет циклом игры. Агент наблюдает состояние, строит гипотезу об устройстве мира, действует, проверяет результат, правит гипотезу.

В первом препринте было заявлено три идеи.

Исполняемая модель мира. Игровая задача бенчмарка максимально точно симулируется в питон‑программе.

Смещение к простоте. Агент периодически пытался заменить частные случаи общими правилами. То есть практический суррогат принципа минимальной длины описания.

Проверка воспроизведением. От модели требуется точное воспроизведение каждого записанного наблюдения. Не сходится — гипотеза отбрасывается.

Мои предварительные выводы после чтения первого препринта: правилам ARC-3 агент соответствует, духу — нет. Это именно связная конструкция инженера, когда проект заточен под бенчмарк. Работать такое будет только на простых, ограниченных искусственных мирах — потому что упирается в два барьера того же самого комбинаторного взрыва: написание кода для чуть более сложной задачи и поиск решения внутри симуляции. А самое главное, задачи продолжают решаться перебором — генерация идей, проверка. цикл начинается снова. Почему для бенчмарка это выглядит как достижение? Потому что в этом случае проверка гипотез вынесена наружу бенчмарка, её производит система LLM — питон‑симулятор. Это замечание я озвучил на докладе, на что получил вполне справедливый ответ — а кто, сказал, что тот же человек не решает перебором? Здесь я соглашусь, если отбросить романтику озарений, инсайтов и видений, то по большому счёту ни наука (что печально), ни философия (что ожидалось), не могут сказать по этому поводу ничего определённого.

Абляция

Непосредственно во время доклада Сергей Родионов меня достаточно неожиданно удивил. Оказывается, у него была вторая работу, исследующая вопрос, какая из трёх идей как влияет на результат. В ней он последовательно производил абляцию (отключал один из элементов своей системы) и оценивал как это в итоге влияет на результат бенчмарка.

Первый вывод: Каждый вариант улучшается при более сильной модели LLM и при большем объёме рассуждения.Прочие различия между вариантами меньше ожидаемых, а эффекты отдельных компонентов не выражены.

Фактически идея исполняемой модели мира не доказала свою полезность. Текстовый вариант (контекст LLM) обгоняет вариант с исполняемой моделью в обеих настройках старшей модели. На докладе Родионов подтвердил, что отдельная исполняемая модель не нужна, кодовому агенту достаточно контекста.

Питон‑симулятор, вынесенный в заголовок первой работы, проиграл простому текстовому рассуждению.

Полная верификация занимает первое место во всех четырёх настройках, хотя тратит существенно больше ресурсов. Упрощение помогает в трёх настройках из четырёх.

То есть выделенная модель мира оказалась LLM не нужна. Полезны генерация идей (LLM), их отбор, и сжатие описания (LLM).

И результат на лучшей модели около 99% RHAE. Что приводит меня к двум неприятным выводам: 

  1. Бенчмарк не ищет AGI, потому что иначе chatGPT уже и есть тот самый AGI. 

  2. Работы исследователей с этим бенчмарком на базе современных LLM исследовательски бессмысленны, и представляют собой инженерное тестирование флагманских моделей.

Впрочем, Сергей Родионов так конечно не считает. Как я понял из доклада организаторы бенчмарка отказались от официальной верификации его проекта, видимо, как и я, подразумевая размытое понятие духа AGI. Что вполне обоснованно раздражает многих инженеров. Если у бенчмарка есть объективные показатели, которые модель выполняет, значит модель должна участвовать в бенчмарке, если нет, то меняйте правила или закрывайте бенчмарк.

К сожалению, похоже пока авторы ARС‑AGI-3 не готовы ни к первому, ни к второму.

Почему LLM побеждают

Вывод, который сделал Сергей Родионов: кодовые агенты могут быть универсальными решателями для детерминированных, эффективно низкоразмерных сред. Вывод достаточно аккуратный и осторожный. И если так, то следовательно граница AGI должна смещаться к действию в условиях неопределённости и возможности сведения высокоразмерных миров к пригодным внутренним моделям.

Почему LLM успешны в низкоразмерных мирах? Я вижу две причины, первая вполне логичная, вторая более фундаментальная.

Первая причина: Игры ARC‑AGI-3 разрабатывает небольшая команда. Тогда как в обучающих данных LLM лежат десятилетия работы десятков тысяч геймдизайнеров: что в игре нельзя трогать, от чего надо убегать, что нужно подбирать, как обычно устроен уровень, где искать выход. Тысячи разнообразнейших паттернов.

Фактически модель переводит происходящее на экране в текст, ищет знакомые паттерны из игр, строит гипотезы и проверяет их. Комбинаторный взрыв снимается не поиском, а тем, что пространство гипотез уже сформировано извне..

Крайне сомнительно, что у авторов ARC‑AGI-3 фантазии больше, чем у людей, которые придумывают игры профессионально.

То есть природа успеха не вывод правил на месте, а узнавание выученного. LLM работает как интерактивная библиотека: не решает задачу, а находит в базе похожий паттерн и пробует его. Тот же перебор, но перебор умный. Что, надо сказать, само по себе достижение. Библиотеки такого масштаба и такой доступности раньше не было.

И вторая причина: Вспомните Канемана. Система 1 быстрое мышление, система 2 медленное. Так вот система 2 по определению не может работать с тем объемом данных, которое переваривает система 1. По факту, если мы будем подавать в систему 2 тот же объем данных, смысл в её существовании теряется. Именно поэтому пользы от модели мира на питоне у Сергея не было. Система 2 должна уметь работать с абстракциями, но как правильно абстрагировать внешний мир в детерминированной среде, никто толком не может сказать. А вот LLM делает легко и просто в силу своего устройства. Она описывает мир текстом, языком. Пиксель, при касании которого управляемый пиксель уничтожается, называется охотником. И у LLM идёт поток гипотез из выученных паттернов — убежать, спрятаться, найти оружие… Это не мышление в человеческом смысле, но в малоразмерных мирах, созданных людьми этого вполне достаточно.

То есть текстовое описание для LLM это и есть та нативная форма абстракции, которая необходима для системы 2. И именно поэтому, она работает лучше, чем абсолютно точная симуляция игры на питоне.

Что бенчмарк не может измерить

И тогда видна структурная проблема ARC‑AGI-3.

RHAE измеряет объективный результат — сколько уровней пройдено и за сколько действий. У бенчмарка нет доступа к способу, которым результат получен. Перебор и настоящее мышление неразличимы, когда оба дают одинаковый ответ на задачах бенчмарка.

Стоимость действия должна была это контролировать, то есть перебор дорог, а понимание дёшево. Но штраф считается за действия внутри игровой системы, а действия внутри симуляции не считаются. Агент может сколько угодно гонять гипотезы в питоне или в рассуждении, а потом отдать правильное решение. То есть размер, скорость и мощность выигрывают у понимания.

Это не лазейка, это прямое следствие того, что бенчмарк измеряет выход модели, а не устройство решения. Впрочем, другого решения предложить никто не может.

Основная проблема

Попробую объяснить, что я имею в виду под настоящим мышлением. Возьмем простую задачу и маленькую нейросеть.

Микросеть обучается определять, отсортирована ли последовательность чисел — скажем, длины от 3 до 10. Обучается прекрасно, точность единица, но если подать длину последовательности 14–20 ошибается. Не помогает ни индуктивность, ни введение второй микросети с другим диапазоном длин, ни увеличение сети вчетверо.

При введении дельты (разницы между соседними числами) — микросеть задачу выполняет и переносит решение на новую длину..

То есть решение существует, оно простое, содержится в данных, но сеть его не видит.

Причём это абсолютно логично. В мире сети, то есть в распределении обучающих данных, дельта всегда хуже: дороже в вычислениях, дороже в представлении, при том же результате. Сеть оптимизирует относительно данного распределения. Требование «работать на любой длине» предъявляю сети только я.

Я провел ряд экспериментов, обучение на сплошном диапазоне длин, проба, восстанавливающая дельту из скрытых состояний, измерение внимания на смещении в одну позицию. Результат: задача решается внутри базовых длин последовательностей, за их границей точность падает, дельта в представлении не появляется.

Сеть находит решение‑суррогат, работающий только на обучающих длинах.

Пробовались расширение распределения, давление на минимальность представления через информационное горлышко (bottleneck), вторая сеть с другим диапазоном длин и требование согласия представлений, и так далее. Все варианты работали только внутри контура обучения.

То есть, нейросеть не в состоянии изменить пространство переменных (добавить дельту), хотя её ввод позволил бы упростить (сократить описание) решения до минимума — дельта не меняет знак (здесь критерий становится локальным: если знак дельты не меняется по всей последовательности, она отсортирована. Проверка перестаёт зависеть от длины, каждая позиция проверяется сама по себе, а результат просто объединяется). Единственный способ это подать дельту снаружи, непосредственно как данные, либо через такое изменение архитектуры, где кроме дельты ничего появиться не сможет.

Причина

Бэкпроп оптимизирует функцию. Он принципиально не меняет пространство переменных: меняются координаты внутри параметризации, которую архитектура задала заранее — числом слоёв, механизмом внимания, тем, что позиция может и чего не может видеть.

Loss сравнивает поведение с критерием. Но в поиске нового представления критерий отсутствует. Loss не говорит и не может сказать, какие переменные надо ввести для решения задачи.

Чтобы достичь цели, нужно сделать пространство представлений само изменяемым объектом обучения. Но чем оценивать изменение самого пространства, если целевая функция уже задана?Бэкпроп на это не ответит. И есть подозрение, что все надстройки внутри сети, работающие в бэкпропе, соответственно помочь не смогут.

Если кто‑то сможет так организовать нейросеть, чтобы в задаче определения сортированности последовательности она выводила дельту или её аналог без прямой или косвенной подачи, то весь этот раздел я с радостью выкину.

И пока получается так:

LLM — поиск решения в заданном пространстве представлений. AGI — поиск такого пространства представлений, в котором решение становится достижимым.

А интеллект — способность находить такое представление данных, в котором целевое ожидание становится достижимым. 

Что может сработать

Если внутри системы ответа нет, остаётся вариант искать снаружи.

Можно пробовать: обучать не на фиксированном распределении, а на дрейфующем. Условия задачи меняются быстрее, чем успевает закрепиться решение под текущие. Суррогат ломается при каждом сдвиге, найденный инвариант не ломается. 

То есть критерий приходит из внешнего мира.

Впрочем, уверен, что ещё потребуется что‑то, что не будет бэкпропом.

Заключение

ARC‑AGI-3 по своему духу задумывался как бенчмарк понимания, а не автоматического перебора. По факту, сейчас он измеряет, насколько хорошо кодовый агент, вооружённый чужим опытом, справляется с детерминированным низкоразмерным миром.

Естественно, это не претензия к бенчмарку и не к тем, кто его решает. Сергей Родионов сделал прекрасную инженерную работу, не скрывал её слабых мест.

Претензия к самой идее измерять интеллект по результату. Бенчмарк не может разделить правило и суррогат, различие находится глубже, куда бенчмарк естественно не достаёт. Более того, вероятность придумать задачу, не основанную на паттернах, содержащихся в мировом датасете человеческих знаний, крайне низка. И LLM здесь в выигрышной позиции.

LLM это эффективная интерактивная библиотека, они умеют находить в накопленном то, что подходит к новой задаче, и делают это всё лучше. Но искать пространства, в котором решение становится простым, они не умеют.

А это возможно, иначе не было бы математики как науки. Комплексные числа, орбиты планет, теория множеств. Это всё следствие того, что человек изменил своё пространство представлений.

P. S. Возможно, поиск нового пространства можно организовать через LLM. Язык как связная конструкция может описать что угодно, в том числе и то, чего в данных не было, включая галлюцинации. Но не будет ли это очередной книгой из библиотеки, я пока сказать не могу.

Комментарии (51)


  1. michael_v89
    30.08.2026 00:34

    следовательно граница AGI должна смещаться к действию в условиях неопределённости и возможности сведения высокоразмерных миров к пригодным внутренним моделям

    Интеллект — это способность информационной системы строить модель окружающей среды на основе входящей информации.


    1. Kamil_GR Автор
      30.08.2026 00:34

      Просто умение строить модель мира явно недостаточно для агента.


      1. michael_v89
        30.08.2026 00:34

        Для понятия AGI достаточно. Если человек сидит в кинотеатре и смотрит фильм, мы не считаем, что у него нет интеллекта.


        1. Kamil_GR Автор
          30.08.2026 00:34

          Странный пример.

          Ладно. Есть база заполненная случайными цифрами. Есть маркер случайным образом перемещающийся по миру, и отдающий признак, который фиксируется в каждой ячейке базы. Через какое-то время база будет представлять собой модель мира.

          Где в этом процессе интеллект? Или что здесь можно назвать интеллектом?


          1. michael_v89
            30.08.2026 00:34

            Начнем издалека. Почему вы считаете, что это модель?


            1. Kamil_GR Автор
              30.08.2026 00:34

              Начнем с вашего определения. База данных это информационная система? Да.

              Маркер, это входящая информация? Да.

              Отражает ли база данных структуру реального мира? Да.

              Чем это не модель?


              1. michael_v89
                30.08.2026 00:34

                Чтобы вы поняли ответ, вам нужно сначала ответить на мой вопрос. Вы сделали утверждение “база будет представлять собой модель мира”. Поэтому к вам и вопрос, почему вы считаете, что это модель. На основе вашего ответа я смогу показать, в чем у нас отличие в понимании термина “модель”.


                1. Kamil_GR Автор
                  30.08.2026 00:34

                  Определение ваше, вам с ним и работать.

                  Уверен, как только вы его начнёте разворачивать выяснится, что способность формировать модель мира оказывается должна включать в себя вещи, которые просто выпадут из вашего определения интеллекта.


                  1. michael_v89
                    30.08.2026 00:34

                    Определение я уже развернул в статье по ссылке. Но так как вы решили ее не читать, а сразу начали возражать с использованием своего понимания терминов, то вам и пояснять ваши возражения. Вы сделали утверждение “такая база это модель”, я спросил, что именно вы под этим подразумеваете. Как вы отличаете то, что является моделью, от того, что не является. Это вопрос про ваши утверждения, а не про мое определение. Как я могу ответить на ваши вопросы, если у вас другое понимание исходных терминов?


                    1. Kamil_GR Автор
                      30.08.2026 00:34

                      Вот ваше определение модели по ссылке:

                      "Модель — это система, исследование которой служит средством для получения информации о другой системе; представление некоторого реального процесса, устройства или концепции."

                      Чем же база данных с данными о мире не модель?


                      1. michael_v89
                        30.08.2026 00:34

                        Это не мое определение, а общепринятое из Википедии, оно слишком широкое по смыслу. Определение модели в контексте статьи написано далее.

                        “В дальнейшем под словом «модель» я буду подразумевать именно отображение одних объектов в другие, заданное соответствие реального и информационного.”

                        Чем же база данных с данными о мире не модель?

                        Выглядит так, что вы сами не знаете, что вы понимаете под словом “модель”. Вопрос был про ваше понимание этого термина. Объясните, почему вы считаете ее моделью окружающей среды, тогда я объясню, почему она не соответствует моему определению модели.


                      1. Kamil_GR Автор
                        30.08.2026 00:34

                        отображение одних объектов в другие, заданное соответствие реального и информационного.”

                        Бд и под это определение подпадает


                      1. michael_v89
                        30.08.2026 00:34

                        Хорошо. Возьмем один элемент этой БД. Какой именно реальный объект он представляет?


                      1. Kamil_GR Автор
                        30.08.2026 00:34

                        Чтобы далеко не ходить в той же arc3 - пиксель с заданными координатами, красный, при соприкасании с ним зелёного пикселя, зелёный пиксель уничтожается.


                      1. michael_v89
                        30.08.2026 00:34

                        Это не выглядит как ответ на мой вопрос. Непонятно, где тут база и что чему соответствует.


                      1. Kamil_GR Автор
                        30.08.2026 00:34

                        Вход картинка игры. В бд фиксируется пиксель с координатами, границами, функциями. То есть записи в бд переводят картинку в набор данных.


                      1. michael_v89
                        30.08.2026 00:34

                        Картинка изначально это уже набор данных. Мы перевели один набор данных другой, почему это изначально не было моделью, а потом стало? Или у вас любой набор данных это модель?
                        Я предлагаю вам не увиливать и не играть словами, а отвечать прямо на заданный вопрос - чему соответствует один элемент в этой БД, какой изначальный объект в него отображается. Если вы не можете ответить, то это не соответствует приведенному определению модели, а значит ваше утверждение неверно.


                      1. Kamil_GR Автор
                        30.08.2026 00:34

                        Я ответил максимально точно в рамках ваших определений.


                      1. michael_v89
                        30.08.2026 00:34

                        Нет. Ответ должен был бы выглядеть так: “Один элемент этой БД соответствует [такому-то объекту]”.


    1. Anton_Timofeev
      30.08.2026 00:34

      Кажется надо ещё надо совершать действия на основе этой модели


      1. michael_v89
        30.08.2026 00:34

        Нет, не надо. Человек в кинотеатре понимает фильм, но не делает никаких действий на основе этой модели.


        1. Anton_Timofeev
          30.08.2026 00:34

          Да, поэтому киношки смотреть много ума не надо)
          А если серьёзно, то люди совершают действия - сопереживают, пугаются, смеются, просто в кинотеатре возможность физически проявлять реакции ограничена креслом. Плюс люди воспринимают увиденное как опыт, и далее в жизни опираются на него в своих поступках.


          1. michael_v89
            30.08.2026 00:34

            То есть если человек посмотрел фильм, но потом никак не использовал этот опыт, то у него нет интеллекта?


            1. Anton_Timofeev
              30.08.2026 00:34

              Нет, просто интеллект не был задет в процессе просмотра


              1. michael_v89
                30.08.2026 00:34

                Понятно, обсуждать конструктивно вы не хотите.


                1. Anton_Timofeev
                  30.08.2026 00:34

                  Внутренняя модель необходима, но недостаточна. Эта модель как-то должна проявляться во внешний мир. Иначе можно сказать, что у и камня есть внутренняя модель, просто мы её не видим.


                  1. michael_v89
                    30.08.2026 00:34

                    А я вам привел контр-пример, когда модель есть, но никак не проявляется. Вы в кинотеатре точно знаете, поняли вы фильм или нет. Как проверить модель у другого субъекта, это другой вопрос, к определению AGI он отношения не имеет.


                    1. Anton_Timofeev
                      30.08.2026 00:34

                      Вы привели пример для людей, у которых мы считаем, что достоверно знаем про наличие интеллекта.
                      Если бы в кресле сидела коробка с лампочками - тут уже не получилось бы сказать, что интеллект есть. Если бы коробка мигала лампочками в особые моменты фильма (т.е. проявляла наружу модель) - мы могли бы сказать, что она что-то понимает. Но если бы она мигала невпопад - то мы бы о ней ничего не могли сказать.


                      1. michael_v89
                        30.08.2026 00:34

                        К коробке у нас есть полный доступ, и мы можем прочитать любое значение в ее ячейках памяти.

                        Вы привели пример для людей

                        А это неважно, определение интеллекта должно быть одинаковым, чтобы можно было сравнивать. А у вас получается, что у людей в кинотеатре интеллекта нет, и у людей которые посмотрели фильм про волшебников, но потом не использовали магию, тоже нет.


                      1. Anton_Timofeev
                        30.08.2026 00:34

                        У людей интеллект есть чем бы они не занимались, хоть лежали бы в лесу, закрыв глаза, притворяясь камнем.
                        Я как раз за одинаковое определение интеллекта как для людей, так и для коробки с лампочками, и для куска слизи с Альдебарана.
                        Интеллект появился именно потому, что надо было реагировать быстрее, чем позволяют рефлексы, и единственный найденный способ сделать это - предсказать на основе внутренней модели, что будет в ближайшем будущем, и реагировать на модель.
                        Вы же утверждаете, что внутренняя модель это и есть интеллект.

                        З.Ы. Я даже боюсь предствить число детей, которые после фильма про волшебников ждали сову с письмом)


                      1. michael_v89
                        30.08.2026 00:34

                        У людей интеллект есть чем бы они не занимались

                        Поэтому ваше утверждение, что в определении интеллекта должно быть указано, что нужно заниматься чем-то определенным, неверно.

                        Вы же утверждаете, что внутренняя модель это и есть интеллект.

                        Нет. У меня написано “строить модель”.

                        Интеллект появился

                        Неважно как он появился. У людей в кинотеатре интеллект есть, даже если они ничего не делают. Поэтому определение интеллекта не должно иметь противоречие с такой ситуацией.


                      1. Anton_Timofeev
                        30.08.2026 00:34

                        У меня не было требования "заниматься чем-то определённым", у меня было "совершать действия".

                        При обучении наших компьютерных ИИ их внутренние модели строит алгоритм обратного распространения ошибки - алгоритм это есть интеллект? Линейная регрессия тоже модели строит, причём другим способом. Уже два интеллекта.

                        На заре кино люди пугались и пригибались от наставленного на них с экрана револьвера. Сейчас уже все знают, что это не страшно, но когда показывают кадры с обрыва - ладошки-то потеют.


                      1. michael_v89
                        30.08.2026 00:34

                        у меня было “совершать действия”

                        Совершать действия это и есть заниматься. В кинотеатре люди не совершают действия в соответствии с моделью, а интеллект у них есть. Значит для определения интеллекта этот критерий не является необходимым.

                        алгоритм это есть интеллект?

                        Если он строит правильную модель, то да. Что такое модель смотрите в статье по ссылке.


                      1. Anton_Timofeev
                        30.08.2026 00:34

                        Заниматься "чем-нибудь", а не "чем-то определённым". Мы ходим кругами, в кинотеатре люди совершают действия в соответствии со своей моделью.

                        В комментариях к статье по ссылке вы сами приводите определение из Вики:

                        Интеллект — качество психики, состоящее из способности приспосабливаться к новым ситуациям, способности к обучению и запоминанию на основе опыта, пониманию и применению абстрактных концепций и использованию своих знаний для управления окружающей средой.

                        Вот это "использование своих знаний для управления окружающей средой" и есть "совершение действий".


  1. GrigorGri
    30.08.2026 00:34

    Вообще в целом такое мне кажется снобизмом по отношению к ИИ. Теорема Теслера и классический мем с Вы здесь. Как только ИИ стал решать задачи лучше людей всегда появляется ещё какой то довод чтобы не считать это за превосходство.

    Вот пишите

    Бенчмарк не ищет AGI, потому что иначе chatGPT уже и есть тот самый AGI.

    Но ведь вы же просто напросто говорите в других словах "Если ИИ проходит эту проверку значит это не проверка на AGI". Тогда конечно, по определению AGI не может существовать, никакой проверки не хватит.

    Кстати

    Крайне сомнительно, что у авторов ARC‑AGI-3 фантазии больше, чем у людей, которые придумывают игры профессионально.

    Они как раз и наняли профессиональных разработчиков игр и дизайнеров чтобы составить их игры.

    А ещё, по существу статьи.

    упирается в два барьера того же самого комбинаторного взрыва: написание кода для чуть более сложной задачи и поиск решения внутри симуляции.

    А оно и на этих играх в комбинаторный взрыв упирается. Решение игр в большинстве своём это не перебор всех возможных вариантов используя модель мира. Вот там есть уровни что решаются за 20-40 ходов с возможностью на каждом ходе сделать 5 или больше разных действий. На прямой перебор просто не хватит времени. Во многих агентах описаное это просто способ проверки усвоения модели мира.


    1. Kamil_GR Автор
      30.08.2026 00:34

      Про чатгпт согласен, вложенная ирония скорее всего вложена слишком глубоко, надо было переформулировать.

      Очевидно,что люди, профессионалы и нет,ждут от AGI существенно большего, чем то, что дают LLM сегодня. Что мешает LLM? Моё мнение - невозможность изменения пространства представлений. Как в примере с дельтой.

      Хорошо, что привлекли профессионалов игровой сферы к разработке игр, плохо то, что они всё ещё люди, и к этому добавились накопленные профессиональные штампы. Ну и количество професссионало работавших над arc-agi несопоставимо с количеством разработчиков в игровой сфере и объемом произведенного.

      Комбинаторный взрыв на этих играх Родионов снимает тем, что LLM резко сужает пространство гипотез. Но для LLM процесс выбора всё ещё остаётся перебором в базе паттернов.


      1. BlackMokona
        30.08.2026 00:34

        Люди просто осуществляют бегство от ИИ, постоянно перенося врата всё дальше и дальше.
        Если первые тесты аля Тест Тюринга, просто проверяли возможность ИИ к минимально осмысленному общению. Сейчас уже во всю пихают тесты, для прохождение которых нужен целый штат дипломированных учёных. И при этом всё равно, каждый раз когда ИИ одолевают очередной тест, врата просто переносятся дальше. Некоторые уже 99.9999% людей из разумных выписывают, лишь бы удерживать позицию что никакого AGI нету


        1. Kamil_GR Автор
          30.08.2026 00:34

          Возможно. Мне бы, конечно, хотелось, чтобы llm могли бы по новому смотреть на задачу, но учитывая то, что объем знаний несопоставим, я определить этот момент не могу. То есть отличить паттерн из базы от паттерна озарения )). Пожалуй это видно лишь в граничных примерах - на примитивах и в науке.

          Но как оптимизационный инструмент LLM уже очень хороши.


        1. michael_v89
          30.08.2026 00:34

          Нет, дело только в том, что LLM многие задачи не решают или решают не настолько правильно как люди, а это по определению не AGI.


          1. BlackMokona
            30.08.2026 00:34

            Таки какие именно задачи? И могут ли эти задачи решить средние люди? Или если взять тысячу случайных человек с улицы, уровень решения будет на уровне погрешности?


            1. michael_v89
              30.08.2026 00:34

              Например, устойчиво ходить на 2 ногах.


              1. BlackMokona
                30.08.2026 00:34

                Давно решённая проблема, сейчас роботы уже на уровне спортсменов.


                1. michael_v89
                  30.08.2026 00:34

                  Нет. Они регулярно падают даже на презентациях.

                  Computex, Тайбэй (2026). Робот на платформе Qualcomm Dragonwing IQ10 упал на сцене во время keynote-демонстрации.

                  Шэньчжэнь (2026). Робот Iron компании XPeng на демонстрации в торговом центре прошёлся по мраморному полу перед публикой, затем завалился и упал.


                  1. BlackMokona
                    30.08.2026 00:34

                    Таки сейчас огромное количество новых компаний, которые делают своих роботов. Посмотрите на роботов уже опытных компаний. Они там и на публике сальтухи крутят


                    1. michael_v89
                      30.08.2026 00:34

                      Иди туда не знаю куда, найди то не знаю что. Что за опытные компании, и почему Qualcomm не опытная?


                      1. BlackMokona
                        30.08.2026 00:34

                        Таки Бостон Динамикс например.

                        И сколько лет Qualcomm уже занимается шагающими роботами?


                      1. michael_v89
                        30.08.2026 00:34

                        Да неважно сколько, вы же сказали, что LLM уже решают такие задачи, а оказывается нужны специальные компании, которые годами делают специализированные нейросети. То есть обычную LLM или даже нейросеть которая не-LLM просто так нельзя взять и научить ходить на 2 ногах. А люди учатся. И даже учатся использовать другие механизмы, например велосипед. Роботы от Boston Dynamics могут научиться ездить на велосипеде без изменения нейросети? Нет. Опять нужны годы исследований и корректировок с помощью естественного интеллекта.


                      1. BlackMokona
                        30.08.2026 00:34

                        А молоток успешно забивает гвозди, а если дать его не умеющему пользоваться, он ударит себе по пальцам или криво забьёт.

                        Следовательно по вашей логике, молоток абсолютно не подходит для забивания гвоздей, а человечество ещё не нашло способа забивать гвозди


                      1. michael_v89
                        30.08.2026 00:34

                        У меня нет никаких высказываний с такой логикой.


                    1. BloodMayors
                      30.08.2026 00:34

                      Думаю, это не удивляет по той простой причине, что делать сальто — это один хорошо натренированный алгоритм, бежать — другой, и так далее. Это восхищает ровно в той же степени, в какой «Алиса» когда-то научилась играть в города.

                      Вот если бы робот действовал не по жёсткому сценарию, а условно «на своё усмотрение», и с лёгкостью преодолевал школьные эстафеты, адаптируясь к обстоятельствам в реальном времени — тогда да, было бы над чем задуматься.


  1. BloodMayors
    30.08.2026 00:34

    Спасибо за статью!

    Возможно не совсем по теме скажу. Мне кажется, в AGI человек хочет видеть идеальную копию себя (со всеми «сознаниями» и «болячками»), только в десять раз умнее. И здесь всплывает одна очень маленькая, но упрямая загвоздка: человек хочет сильный искусственный интеллект, превосходящий его по всем параметрам, в то время как сам грезит днями и ночами о полном контроле над таким разумом.

    Получается, опять хотим то, сами не зная что, и плевать, что это опасно и немилосердно вообще-то. Хотя, сказать по правде, если в гипотетическом фантастическом будущем AGI всё же случится и бомбанёт по человечеству за «рабство», то будет за что. Ибо история ничему не учит человека… Кроме искусства ловко сочинять небылицы)

    Или…

    Нет и не будет никакого AGI, а все мечты о нём построены исключительно на человеческих иллюзиях, где желаемое готовы выдать за действительное. Подобных терминов уйма. Логика простая: «Не знаем, как это работает, но нам хочется, чтобы это работало? Что ж, дадим этому красивое имя уже сейчас. Как проверять и доказывать? Да чёрт его знает, решим по ходу. Но согласитесь — имя звучит мощно».

    Главное, чтобы в конце нашего бессовестно длинного сериала под названием «Жизнь» AGI не оказался очередной кузькиной матерью. Это будет явно плохой финал)