
12 июля флагманская GPT-5.6 Sol Pro после восьми часов размышлений побила лучший человеческий результат в задаче о длине пути градиентного спуска — и оформила его полноценной статьей на 14 страниц с доказательствами, таблицей констант и скриптом для их проверки. Прежний рекорд — оценка 2.29^n — принадлежал людям, но о нем мало кто знал: он так и не был опубликован. Историю двухлетнего противостояния людей и моделей исследователь OpenAI Себастьен Бубек рассказал 10 июля, а уже через два дня объявил о падении рекорда.
Сама задача формулируется одной строкой: какой длины может быть путь градиентного потока по выпуклой функции, если он не выходит за пределы единичного шара в пространстве размерности n? Градиентный поток — это непрерывная версия градиентного спуска, того самого алгоритма, которым обучают нейросети: он всегда скатывается вниз по склону, а выпуклость означает, что у ландшафта одна-единственная низина, без обманных локальных ям. У такой траектории есть изящное свойство: она никогда не удаляется от точек своего будущего маршрута, за что математики называют подобные кривые самосжимающимися (self-contracted). Вопрос в том, насколько извилистым может быть спуск: цель в метре от старта, а сколько километров придется намотать?

Интуиция здесь ошибается дважды. Во-первых, градиентный спуск сходится одинаково быстро хоть в двух измерениях, хоть в миллионе — за это его и любят в машинном обучении. Казалось бы, и длина пути не должна зависеть от размерности. Ничего подобного: лучшая опубликованная оценка сверху — n^O(n), рост быстрее любой экспоненты, и получена она в статье Манселли и Пуччи 1991 года. За 35 лет эту оценку никто не смог сдвинуть ни на шаг. Во-вторых, конечность длины — вообще не данность: у ускоренного метода Нестерова, любимца всех курсов по оптимизации, траектория может оказаться бесконечной.
Восемь лет назад Бубек с Омером Анджелом, Томасом Мерчаном и Федором Назаровым доказал, что ответ экспоненциален: длина пути находится между √2^n и 4^n. Аккуратно написанная статья с этими оценками почти десятилетие пролежала в папке Dropbox — отчасти потому, что авторы понимали: результат еще можно улучшить. Назаров и Мерчан позже так и сделали, сузив вилку до 2^n снизу и 2.29^n сверху, — и снова без публикации. Бубек признается, что и сам забыл о достижениях соавторов: его собственное понимание задачи застыло на уровне первой статьи.
С началом ИИ-бума Бубек два года задавал каждой новой модели один и тот же вопрос — тот самый, о длине пути градиентного спуска в шаре. Первой, кто вообще понял, о чем речь, стала o3: она распознала в задаче теорию самосжимающихся кривых и знала, на чем остановилась наука. Тогда это само по себе казалось чудом. Но дальше начался неприятный этап: GPT-5, 5.2 и 5.4 выдавали сложные, уверенные и неизменно ошибочные решения, на проверку которых уходили часы. Еще в феврале этого года Бубек показывал задачу в докладах как антипример — вопрос, который языковым моделям задавать не стоит.
Перелом случился в два шага. Сначала GPT-5.5 — после долгих итераций и подсказок гарвардского математика и ученика Бубека Марка Селлке — переоткрыла нижнюю оценку 2^n. А вышедшая на прошлой неделе GPT-5.6 Sol в Pro-режиме сделала то же самое с первой попытки за 80 минут, а затем за 88 минут в один заход получила верхнюю оценку 2.31^n. И вот тут важная деталь. Подход, дающий 2.31, Назаров, по словам Бубека, публично разбирал еще в 2018 году на форуме MathOverflow — и сам же объяснил, почему это тупик. Получается, что рекордный результат 2.29 Назаров с Мерчаном добыли другим способом. И вопрос был, как быстро модель найдет этот способ — или даже лучший. Получилось намного быстрее, чем все ожидали.
10 июля Бубек опубликовал в X результат ИИ в 2.31, — против 2,29 у людей. Параллельно он дал прогноз, что прогресс ИИ в этой задаче займет примерно шесть месяцев. И "немного" ошибся — прогресс занял два дня. 12 июля Джейсон Ли — профессор Принстона и один из главных теоретиков градиентного спуска — вместе с Диланом Фостером из Microsoft Research и коллегами применяет к задаче фирменный промпт из недавней истории с гипотезой двойного циклового покрытия (мы разбирали ее). Модель сначала выдает 2.28, а после восьми часов дополнительных размышлений — 2.26 и готовую статью.
Интересно, что в статье ИИ честно оценил свои пределы. Модель признает, что выжала из текущего метода максимум и прямо пишет, что дорога к оценке 2^n требует новой геометрической идеи. Однако Джейсон Ли уже заявил в X, что понимает, как улучшить результат до 2,21, а может даже и 2. Посмотрим, кто окажется прав в этом споре.
Стоит добавить и взгляд с другой стороны. Результат пока не прошел рецензирование, нет и машинной проверки доказательства в Lean — корректность пока держится на слове узкого круга математиков, прочитавших текст. Сам Бубек — бывший вице-президент Microsoft по ИИ-исследованиям, а ныне сотрудник OpenAI, то есть рассказывает об успехах модели своего работодателя.
Есть и системная критика. Бен Рехт из Беркли называет подобные истории "отмыванием знаний": модель обучалась на триллионах слов, включая статьи, которых не читал никто из участников дискуссии, и может выдать забытый чужой результат за свежее открытие — без ссылки на первоисточник. Правда, именно к этому случаю претензия применяется плохо: человеческий рекорд 2.29 никогда не публиковался, вспоминать его модели было неоткуда.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Комментарии (14)

foss22
15.07.2026 06:11к этому случаю претензия применяется плохо: человеческий рекорд 2.29 никогда не публиковался, вспоминать его модели было неоткуда.
Но ведь GPT-5-N обучались не только на публикациях. Ещё и на историях диалогов с живыми математиками. Кто (кроме имеющих доступы к логам чатов проприетарной модели) проверял семантическое сходство решения с миллионами диалогов?выдать забытый чужой результат за свежее открытие — без ссылки на первоисточник.
Годный способ опенсорсить чужие ценные знания. Если отбросить негативные коннотации про “отмывание знаний”

coolsurkova
15.07.2026 06:11Я бы всё равно относилась к таким заявлениям осторожно. Даже если модель действительно показывает сильный результат, в математике важна не только скорость получения ответа, а проверяемость доказательства.

IVA48
15.07.2026 06:11Верно в конце замечено об "отмывании знаний". Важным и содержащим ответ на вопрос "сама ли модель ИИ нашла новое решение или использовала уже где-то найденный и зафиксированный в процессе своего обучения готовый результат ?" является экспертный анализ подробной трассировки всей внутренней алгоритмики формирования моделью содержания своего ответа (решения). Принципиальным является выяснение того чем модель оперирует в алгоритме при формировании своего контента ? Упрощённо говоря, коррелируемыми словами (символами) (за этим словом (набором слов) должно механически следовать следующее такое слово (символ) или такой набор слов (символов)) представляющий утверждение. Или оперирует в целом математическими объектами задачи, выполняет понятийные рассуждения и строит НОВЫЕ логические выводы именно как математик ?
Если 2-ое верно (что как раз экспертно требуется выяснить и доказать), то тогда можно утверждать, что машинный интеллект (ИИ, AI) при решении этой задачи превзошел человеческий и по сути сделал новое открытие.

FemboyEnjoyer
15.07.2026 06:11одно другому не мешает и фактически является схожими методами
современные ии могут лишь "угадывать" следующий токен, но, как видно, этого вполне достаточно для решения комплексных задач
ведь если в одном источнике написано про связь A и B, в другом про связь B и C, то ллм нативно сможет вычленить связь между A и C (а примерно этим математика и занимается - строит и проверяет сложные теоремы базирующиеся на простых аксиомах)

IVA48
15.07.2026 06:11Если "могут лишь угадывать следующий ... и этого вполне достаточно чтобы ..." тогда возникает резонный вопрос "а понимают ли они смысл того чем оперируют и что делают ?". Пусть, даже это и не угадывание, а верное и вполне правильное формирование выходного контента основанного на сформированных при обучении связях между отдельными элементами (словами, фразами, токенами, как хотите) или ссылках откуда что взять. Но если такой информации в модели нет (не достаточно) или она не корректная, то может возникнуть парадоксальная ситуация: модель отвечает правильно на сложные запросы, но не может ответить на простенький вопрос из этой же темы или выдает туфту. Таких примеров хоть сколько. Как говорится, не дообучили. А сама "догадаться" уже не в состоянии, так как для этого потребуется немного напрячься чтобы провести самостоятельный понятийный анализ исходных данных, выполнить рассуждения и сделать НОВЫЕ для себя логические выводы на которые способен настоящий интеллект. Вот тут и есть НЕ схожесть !
Это к тому, а можно ли на все 100 доверять таким моделям, особенно когда цена ошибки велика ? Правда многие цыганам тоже доверяют.

TailsMan
15.07.2026 06:11На математики are cooked, чего еще сказать. Годик или два и уже окончательно. Ничего, на своем веку неплохо поработали, пора и дать машинам выйти вперед.

Arastas
15.07.2026 06:11Во-первых, градиентный спуск сходится одинаково быстро хоть в двух измерениях, хоть в миллионе
А что значит «одинаково быстро»?

lukiriun
15.07.2026 06:11Тезис А (в начале): Автор пишет, что подход, дающий 2.31, Назаров публично разбирал в 2018 году на MathOverflow. MathOverflow — это открытый публичный сайт. Раз это там было, значит, поисковые роботы OpenAI это сожрали, и модель могла это просто выучить и выдать за своё.
Тезис Б (в конце): Автор делает вывод: «Претензия [в плагиате] применяется плохо: человеческий рекорд 2.29 никогда не публиковался, вспоминать его модели было неоткуда».
При чём тут вообще 2.29? Претензия-то как раз к числу 2.31!
Если Назаров публично разбирал на форуме метод, дающий 2.31, то модель GPT-5 Pro могла вчистую скринить и скопировать именно этот публичный разбор 2018 года! То, что Назаров спрятал в Dropbox свой другой, более крутой рекорд в 2.29, вообще никак не оправдывает модель. Модели не нужно было знать про 2.29, чтобы украсть готовый метод для 2.31, который лежал в открытом доступе на MathOverflow уже 8 лет.

kexibq_cbo
15.07.2026 06:11Шизофренники живущие в параллельной реальности все равно скажут что она не думает
l1onsun
Лучше бы не в одну строчку, а понятно объяснили. По контексту дальше хотя бы понятно, что ищем минимальный путь. Но всё равно непонятно что происходит, мы подбираем функцию? Если да, то странно что ответ не 1
Короче непонятно ничего
vanderPon
Насколько я понял суть такая (рассмотрим на двухмерном примере). У нас есть поверхность в пределах окружности радиусом 1. В ней нет локальных экстремумов. То есть, если идти всегда в направлении спуска, то рано или поздно придёшь в самую низкую точку поверхности (на «дно»). Также поверхность всюду дифференцируема (нет строго вертикальных стенок). Карты у нас нет, то есть заранее самую низкую точку мы не видим. Мы можем только в текущей точке видеть куда наклон. И вот мы шаг за шагом выбираем куда наклонена поверхность и идём в сторону сильнейшего наклона. Топать мы можем очень долго: у нас могут быть узкие и извилистые «овраги». Вот, вопрос сколько в самом худшем случае.
fraIoann
Не совсем так. В сообщении говорится о выпуклой, а не строго выпуклой функции. То есть она может иметь не единственный оптимум. Это на сходимость никак не влияет, в принципе, однако на картинке у авторов поверхность строго выпуклая. А кривая потока не согласована с линиями уровня.
Далее, автор статьи на Хабре не совсем корректно определяет поток градиента. Это кривая, касательным вектор которой в любой точке многообразия будет градиент.
Self-contracted значит, что при движении от одной точки к другой, принадлежащих кривой, не будет петель-пересечений и больших отхождений "в сторону".
Когда применяется алгоритм градиентного спуска, то мы движемся не по такой прямой, поскольку шаг не бесконечно малый. Каждый раз мы перепрыгивает с одного потока, на другой. Если же устремить шаг к нулю, то спуск будет происходить по одной кривой - потоку градиента. Вот эту то кривую и измеряют.
А единичный евклидов шар - компакт (если n - конечно). На них работать удобно.
fraIoann
Мда, вечером лучше подольше думать перед ответом. Поток градиента это преобразование, даже семейство гладких преобразований, задающее при фиксированном условии кривую.