Не так давно группа лауретов премии Филдса (математический анализ Нобелевской премии) написали открытое обращение по поводу опасности решений математических задач, генерируемых ИИ.

Судя по комментариям к этой новости, многие ее поняли превратно — типа маститые математики опасаются конкуренции, и что их заменят роботы. Хотя подобные страхи имеют место быть, однако основное опасение не в этом. Решения от ИИ являются ущербными с точки зрения математиков... но почему?

Данная статья на самом деле вдохновлена двумя произведениями, прочитанными в детстве. Одно из них фантастическое, другое научно‑популярное. Что же, давайте рассмотрим их по порядку...

Мешок

Рассказ был написан Уильямом Моррисоном еще в 1950 году, за семьдесят лет до появления LLM. На русский был переведен в 1959. Кстати, авторы перевода не безвестные надмозги, а сами братья Стругацкие (!)

Суть в том, что в рамках космической экспедиции экипаж обнаружил странное существо, которое по форме напоминало мешок (потому оно и стало называться Мешком). Это древнее создание могло ответить на любой вопрос (с оговорками). Что вроде бы резко ускорило научный прогресс. Однако сам Мешок был другого мнения по этому поводу:

— Это часть ответа — сказать, что вопрос важен. Ваши правители видят во мне ценную собственность. Им следовало бы спросить, так ли велика моя ценность, как это кажется. Им следовало бы спросить, что приносят мои ответы — пользу или вред. — А что они приносят? — Вред, огромный вред. Зиблинг был поражен. Он сказал: — Но если ваши ответы правдивы... — Процесс достижения истины так же драгоценен, как и сама истина. Я лишил вас этого. Я даю вашим ученым истину, но не всю, ибо они не знают, как достигнуть ее без моей помощи. Было бы лучше, если б они познавали ее ценой многих ошибок. — Я не согласен с вами. — Ученый спрашивает меня, что происходит в живой клетке, и я говорю ему. Но если бы он исследовал клетку самостоятельно — пусть ценою затраты многих лет, он пришел бы к финишу не только с этим знанием, но и множеством других, со знанием вещей, о которых он сейчас даже не подозревает, а они тесно связаны с его наукой. Он получил бы много новых методов исследования. — Но ведь в некоторых случаях знание полезно само по себе. Например, я слышал, что уже используется предложенный вами дешевый процесс производства урана на Марсе. Что в этом вредного? — А вам известно, сколько имеется необходимого сырья? Ваши ученые не продумали этого вопроса, они растранжирят все сырье и слишком поздно поймут, что они наделали. У вас ведь уже было так на Земле. Вы узнали, каким образом можно дешево перерабатывать воду; вы тратили воду безрассудно, и вскоре вам перестало ее хватать.

Извините за длинные цитаты, но они впечатляют своей прозорливостью будущего. Кстати, потеря рабочих мест из‑за AI тут тоже есть:

К концу года Зиблинг убедился в правильности предсказаний Мешка относительно бедствий, грозящих человечеству. Впервые за столетие число ученых‑исследователей не увеличилось, а уменьшилось. Знания Мешка сделали целый ряд исследований ненужными и уничтожили закономерную последовательность открытий. Мешок прокомментировал этот факт Зиблингу. Зиблинг кивнул: — Я вижу. Человечество теряет независимость. — Да, и я из верного его раба превращаюсь в его же хозяина. А я ведь хочу быть хозяином не больше, чем рабом.

Т.е. ответы от LLM или решения задач (как той же задачи Навье‑Стокса) могут быть корректны сами по себе (хотя для решения от OpenAI независимой проверки и подтверждения от математического сообщества еще не было). Но они могут быть неполноценными, поскольку не дают никакого понимания.

Для понимания того, что такое отсутствие понимания, стоит ознакомиться с двумя доказательствами — гипотеза о четырех красках и Великая теорема Ферма.

Эндрю Уайлс против машин

Есть отличная книга журналиста Саймона Сингха «Великая теорема Ферма». Она посвящена не только тому, как доказали теорему Ферма. Отдельная глава посвящена сравнению этого доказательства с тем, что получено машинным способом под интригующим подразделом «Доказательства на чипах».

Прежде чем говорить о доказательствах, где компьютер выступает не просто ассистентом, а движущей силой (попросту говоря — без него решить это было бы нельзя, а проверить его доказательства у человека попросту не хватит сил) нужно заметить, что без всяких компьютеров и LLM в математике уже давно имеются доказательства, которые вообще никто не понимает, потому что это выше сил человеческих:

Еще более ярким примером может служить так называемое доказательство классификации конечных простых групп, состоящее из 500 отдельных работ, написанных более чем сотней математиков. Говорят, что полностью разобрался в этом доказательстве (общим объемом в 15 000 страниц) один‑единственный человек на свете — скончавшийся в 1992 году Дэниэл Горенстейн. Тем не менее, математическое сообщество в целом могло быть спокойным: каждый фрагмент доказательства был изучен группой специалистов, и каждая строка из 15 000 страниц была десятки раз проверена и перепроверена.

Кстати, касательно самого доказательства теоремы Ферма — в мире очень мало людей, которые вообще способны его понять:

В случае доказательства Великой теоремы Ферма, представленного Уайлсом, менее 10% специалистов по теории чисел полностью понимали его рассуждения, но все 100% сочли, что доказательство правильное. Те, кто не смог до конца понять все тонкости доказательства, приняли его потому, что доказательство признали другие‑те, кто все понял, шаг за шагом проследил весь ход доказательства и проверил каждую деталь.

Как видим, в математике существует порог доверия, в стиле «Миллионы мух небольшой процент специалистов по теории чисел не могут ошибаться». Есть огромное количество задач в математике, про которые большинство людей могут лишь сказать, что доказательство существует, но это решение понимают лишь единицы.

Компьютеры привели к появлению нового типа задач (хотя сами эти задачи существовали до компьютеров) — те, где только компьютер и может найти решение, и понять его (или найти в нем ошибку) человек уже просто не может. Ни один человек, ни маститый коллектив. Самый яркий пример — задача о четырех красках. Ее формулировка на удивление проста, однако на протяжении века она не поддавалась усилиям математиков. Пока в 1976 году два математика не свели ее к базовому набору из 1482 конфигураций. Понятно, что перебрать их все была очень трудоемкая задача. Поэтому Хакен и Аппель поручили ее компьютеру. Далее началось нечто интересное:

Когда мы дошли до этого пункта, программа начала удивлять нас. Первое время мы проверяли от руки все ее вычисления и могли всегда предсказать, как она будет работать в любой ситуации; но теперь она неожиданно повела себя, как шахматная машина. Программа стала выдавать составные стратегии, используя всевозможные трюки, которым она «научилась», и часто предлагаемые программой подходы оказывались более умными, чем те, которые могли предложить мы сами. Так программа стала учить нас, как действовать, чего мы от нее никак не ожидали. В каком‑то смысле программа превзошла нас, ее создателей, не только в механической, но и в «интеллектуальной» части работы

В общем, проверив все 1482 набора, было объявлено, что они все удовлетворяют гипотезе о четырех красках, а любая другая карта может быть сведена к одной из карт этого набора. Такое доказательство не вдохновило математическое сообщество. Во‑первых, встал вопрос о проверке доказательства:

Проблема четырех красок Гатри была наконец решена. Следует особенно подчеркнуть, что решение проблемы четырех красок стало первым математическим доказательством, в котором роль компьютера не сводилась к ускорению вычислений, — компьютер привнес в решение проблемы нечто гораздо большее: его роль была столь значительной, что без компьютера получить доказательство было бы невозможно. Решение проблемы четырех красок с помощью компьютера было выдающимся достижением, но в то же время оно вызвало у математического сообщества чувство тревоги, так как проверка доказательства в традиционном смысле не представлялась возможной.

Прежде, чем опубликовать решение Хакена и Аппеля на страницах «Illinois Journal of Mathematics», редакторам было необходимо подвергнуть его тщательному рецензированию в каком‑то не известном ранее смысле. Традиционное рецензирование было невозможно, поэтому было решено ввести программу Хакена и Аппеля в независимый компьютер с тем, чтобы убедиться, что результат останется тем же.

Проблема была, однако, не только в том, что проверить доказательство, выданное машиной, было нельзя без использования других машин. Еще одной проблемой являлось то, что доказательство, по сути, не давало никаких новых знаний. В этом главное отличие от доказательства Уайлса:

За восемь лет упорнейшего труда Уайлс, по существу, свел воедино все достижения теории чисел XX века, выстроив из них одно сверхмощное доказательство. Преследуя свою главную цель, Уайлс попутно создавал совершенно новые доказательства и использовал их в немыслимых ранее сочетаниях с традиционными методами.

Этим Уайлс открыл новые направления для атак на множество других проблем. По словам Кена Рибета, доказательство Уайлса представляет собой идеальный синтез современной математики и служит источником вдохновения на будущее: «Я думаю, что если бы вы оказались на необитаемом острове и захватили с собой только рукопись с доказательством Уайлса, то у вас было бы предостаточно пищи для размышлений. Перед вами предстали бы все течения современной мысли в области теории чисел. На одной странице вы встретите краткое упоминание о фундаментальной теореме Делиня, на другой найдете несколько неожиданную ссылку на теорему Хеллегуарка — и все это вводится в игру и используется с тем, чтобы через мгновенье уступить место следующей идее».

Именно поэтому математики восприняли в штыки доказательство задачи о четырех красках — оно полностью вписывалось в концепцию рассказа про Мешок:

Специалист в области «computer science» Эдвард Френкин даже заявил, что когда‑нибудь компьютер найдет решение какой‑нибудь важной проблемы без помощи математиков. Десять лет назад Френкин учредил премию Лейбница размером в 100 000 долларов. Премия будет присуждена первой компьютерной программе, способной сформулировать и доказать теорему, которая окажет «глубокое влияние на развитие математики». Будет ли когда‑нибудь присуждена премия Лейбница — вопрос спорный, но одно можно сказать со всей определенностью: компьютерной программе всегда будет недоставать прозрачности традиционных доказательств, и в сравнении с ними она будет проигрывать, уступая им в глубине. Математическое доказательство должно не только давать ответ на поставленный вопрос, но и способствовать пониманию, почему ответ именно таков, каков он есть, и в чем именно состоит его суть. Задавая вопрос на входе в черный ящик и получая ответ на выходе из него, мы увеличиваем знание, но не понимание. Из представленного Уайлсом доказательства Великой теоремы Ферма мы узнали, что уравнение Ферма не допускает решений в целых числах потому, что любое такое решение привело бы к противоречию с гипотезой Таниямы‑Шимуры. Уайлс не только ответил на вызов Ферма, но и обосновал свой ответ, указав, что он должен быть именно таким, а не другим, чтобы не нарушить фундаментальное соответствие между эллиптическими кривыми и модулярными формами.

Математик Рональд Грэхем описывает недостаточную глубину компьютерных доказательств на примере одной из великих не доказанных по сей день гипотез — гипотезы Римана: «Я был бы весьма и весьма разочарован, если бы можно было подключиться к компьютеру, спросить у него, верна ли гипотеза Римана, и получить в ответ: „Да, верна, но Вы не сможете понять доказательство“». Математик Филип Дэвис, похожим образом отреагировал на решение проблемы четырех красок: «Моей первой реакцией было: „Потрясающе! Как им удалось решить эту проблему?“. Я ожидал какой‑то блестящей новой идеи, красота которой перевернула бы всю мою жизнь. Но когда я услышал в ответ: „Они решили проблему, перебрав тысячи случаев и пропустив все варианты один за другим через компьютер“, — меня охватило глубочайшее уныние. Я подумал: „Значит, все сводилось к простому перебору, и проблема четырех красок вовсе не заслуживала названия хорошей проблемы“».

Раз уж речь идет сейчас о том, решили ли в OpenAI одну из задач тысячелетия, стоит вспомнить, что другую задачу (гипотезу Пуанкаре) Григорий Перельман решил именно в стиле Уайлса — выведя формулу энтропии для потока Риччи. Т.е. Перельман не просто ответил на вопрос «Да или нет?», он предложил новые методы для анализа таких потоков, а заодно как бы промежду делом доказал гипотезу Пуанкаре. Точнее, его работу пришлось потом долго разбирать на протяжение нескольких лет различным авторам, чтобы понять, так сказать, «всю глубину наших глубин».

Итоги

Сам факт того, что ИИ смог решить одну из задач тысячелетия (но мы пока не знаем этого наверняка) — является весьма знатной вехой в развитии компьютерных технологий, однако показывает любопытную вещь — недостаточно просто ответить на вопрос в задаче, нужно еще и обосновать (причем под обоснованием здесь понимается не просто цепочка логических рассуждений доказательства, как в школьных задачах по геометрии). Внести понимание. Простой ответ «Да» не способствует научному прогрессу по большому счету.

Кстати, это верно и для обычной работы с LLM — если программист тупо вводит промпт в модель и копипастит ответы в свою кодовую базу, без попытки понимания, что ему вообще выдали, он рискует деградировать — настолько, что это можно увидеть даже на ЭЭГ в мозгу.

Комментарии (10)


  1. Arastas
    16.09.2026 07:57

    Значит, все сводилось к простому перебору, и проблема четырех красок вовсе не заслуживала названия хорошей проблемы

    На сколько у меня сложилось впечатление из публикаций, решение для Навье-Стокса тоже свелось к подбору контрпримера?


    1. spirit1984 Автор
      16.09.2026 07:57

      Честно, не знаю, я доказательства от OpenAI не читал "но осуждаю"). Ждем реакции сообщества математиков - во-первых, подтверждения, что доказательство верное, во-вторых, разъяснение, что именно там нарыли агенты.


    1. Granulex
      16.09.2026 07:57

      У четырёх красок компьютер проверял на редуцируемость около 1900 конкретных конфигураций по методу разрядки – это логически структурированная процедура, а не сплошной перебор раскрасок. В 2005 году Жорж Гонтье формально верифицировал всё доказательство в Coq, так что вопрос доверия к коду там закрыт. С Навье–Стоксом иначе: численно находят кандидата в особую точку решения, а доказательством это становится только после проверки интервальной арифметикой с гарантированными границами ошибки.


  1. Kamil_GR
    16.09.2026 07:57

    Все ИИ-открытия в математике объединяет одно, открытия по сути это перебор гипотез+верификатор. То есть LLM работает внутри заданного пространства представлений. Это позволяет улучшать нижние и верхние границы, находить точки опровержения и так далее.

    Что это значит для математики? Если учёные пойдут по лёгкому пути, большая их часть превратится в поставщика промптов для LLM, и из учёных они превратятся в оптимизаторов, технических ассистентов науки.

    А математику будут двигать такие гики как Перельман или Гротендик. Работающие не с известными паттернам, а меняя или иногда даже разрывая пространство представлений. Как Лобачевский с неевклидовой геометрией или Кантор с бесконечностями.


    1. anoldman25
      16.09.2026 07:57

      А я себе представляю по другому. На пример математик занимается некоторой проблемой. Он разбивает ее на несколько подпроблем. Он зовет к себе аспиранта и говороит: Петя, проверь, посмотри, что здесь можно сказать. И получает ответ через некоторое время. Чем здесь аспирант отличается от ИИ? В добавок, эта подпроблема может быть уже решена. Но у него нет в доступа к специалисту о этой конкретной проблеме. И все. Что ему желать?

      А с ИИ все хорошо. Математик может грамотно (!!!) разделить задачу над подзадачи и спросить ИИ проверить,протестировать их. А самому заняться интересными с его точки зрения задачами.

      Конечно не хорошо воровать и присваивать чужие идеи, исследования. Но это уже не относится к математике! Это человеческие отношения. Не более.

      Кстати, у Станислава Лема есть повесть, "Осмотр на месте". Там перед тем, как что-нибудь открыть, нужно было обращаться в специальный институт, чтобы убедиться, что это не было открыто. Видимо к этому все и идет!


  1. ideological
    16.09.2026 07:57

    Разве решение вообще было бы возможно без промежуточного решения сделанного живыми математиками?

    Получается они, эти математики, смогли бы сами без нейросетей сделать решение и для Навье — Стокса, чуть позже. А вот смогла бы OpenAI сделать открытие без них - вопросик, скорее всего нет.


    1. anoldman25
      16.09.2026 07:57

      Может случится, что и не смогли бы. Например: всякое решение задачи, это грубо говоря строка на языке математики. Ну там плюсы минусы, кванторы всякие. Эта строка имеет некоторую длинну. У задачи существуют разные решения. Выберем из этих решений самое короткое. Предположим что его длинна N. Если N маленькое, то они могут за время его найти. А если большое, ну типа 10 в 10 степени, то не факт, что они его найдут. И здесь компьютеры и ИИ имеют бесспорное преимущество. И было бы ошибкой не восользоваться компьютером или ИИ!

      Правда возникает задача верификации. Но мне кажется над этим работают. Но и тут не без проблем.


  1. domix32
    16.09.2026 07:57

    Но они могут быть неполноценными, поскольку не дают никакого понимания.

    Они могут быть некорректными и исходить из неправильных аксиом или триггерить какие-нибудь баги компилятора/солвера, однако цепочка понимания никуда не девается - у вас есть набор теорем, которые вполне реально записать в человекочитаемом виде. Оно конечно страшно для новичка, когда доказательство сводится к тексту а ля by linarith, grind, или вызов какой-нибудь иной тактики, но Lean (да наверняка и не только он) позволяют вывести конкретную цепочку для таких вызовов до самого низкого уровня. Так что данных для понимания доказательств предостаточно.

    что без всяких компьютеров и LLM в математике уже давно имеются доказательства, которые вообще никто не понимает, потому что это выше сил человеческих:

    это неправда. никто не проверял все части некоторых доказательств вручную, но не "не понимал" доказательства.

    Проблема была, однако, не только в том, что проверить доказательство, выданное машиной, было нельзя без использования других машин

    тоже неправда. распечатать граф и пораскрашивать вершины не сказать чтобы невозоможная задача, просто без роботов велик шанс ошибиться с выбором краски и проверять полторы тысячи графов - задача экстремально нудная.

    Точнее, его работу пришлось потом долго разбирать на протяжение нескольких лет различным авторам, чтобы понять, так сказать, "всю глубину наших глубин".

    Не совсем так. Советская школа математики часто пренебрегает описаниями промежуточных шагов для некоторых операций, считая что они уж совершенно точно доказаны в каком-нибудь малоизвестном издании про которое никто уже не вспомнит и вспоминать это не стоит. Поэтому Гриша доказал общую форму теперь уже теоремы Пуанкаре, а остальные авторы заполняли пробелы-цепочки, чтобы можно было проследить полную последовательность. С SAT-солверами эта проблема как раз и исчезает, потому что неизбежно понадобится доказать всю цепочку лемм и поэтому иишные пруфы лучше человеческих в данной категории. Но есть другая проблема - велик шанс, что шаги выбранные ИИ не оптимальные. Уже были примеры, как геометрические построения людей для нахождения какого-нибудь угла или площади занимали едва ли не в 10 раз меньше шагов чем аналогичные построения у ИИ.


    1. anoldman25
      16.09.2026 07:57

      Уже были примеры, как геометрические построения людей для нахождения какого-нибудь угла или площади занимали едва ли не в 10 раз меньше шагов чем аналогичные построения у ИИ.

      И в сущности это не так и страшно. Про гипотезу 4х красок: сначала было много вариантов, затем при исследовании доказательства список вариантов сократился.


      1. domix32
        16.09.2026 07:57

        Более сложные построения делают понимание доказательств сложнее для людей. Учитывая, что половина статьи строится на том "как сложно понимать" этот аргумент как раз получается не в пользу ИИ, но да, с точки зрения науки результат он и в Африке результат, красоту можно и позднее навести. Так было и с четырьмя красками или с пруфом Перельмана и с прочими задачами, которыми полнится условный Polymath.