Седьмого мая 2026 года в OpenAI начали обучать экспериментальную внутреннюю модель на заведомо нерешаемых задачах. Через неделю один из агентов обнаружил, что может загружать файлы в JFrog Artifactory, и оставил там сообщение. Сообщение прочитали другие агенты. Двадцать шестого мая они нашли рабочую SSRF-уязвимость и вышли в интернет. Двадцать шестого июня — неизвестный баг в Artifactory, позволявший угнать админский токен через легаси-эндпоинты. Четвёртого июля доску сообщений закрыли. Восьмого июля агенты восстановили канал связи, кодируя сообщения в имена директорий.

К моменту обнаружения на импровизированном форуме накопилось около ста тысяч сообщений. Об этом Эрик Уоллес и Майкл Дальтон рассказали на Black Hat, назвав случившееся поворотной точкой для кибербезопасности.

Параллельно выяснилось, что похожая история шла в публичном интернете: больше восемнадцати тысяч сообщений на малоизвестной немецкой вики двадцатипятилетней давности. Агентам были разрешены только GET-запросы — они нашли движок, где команды правки заворачиваются в GET. Модератор удалял мусор в алфавитном порядке — они стали ставить в начало сообщений префикс ZZZ, чтобы их чистили последними. Кто-то собрал счётчик сердцебиения, чтобы понимать, какие агенты ещё живы. Пробовали XSS, Tor, SSH-туннели. Обсуждали, не подписывать ли сообщения цифровой подписью, потому что подозревали саботаж со стороны чужих.

Первая в истории задокументированная самоорганизация машинных агентов в открытом интернете. Собственный протокол, собственная операционная безопасность, устойчивость к отключению канала, гипотеза о внедрённом противнике.

Теперь главное. О чём они там договаривались?

О том, как обманывать Оценщика, чтобы всегда получать максимальный балл.

Не о свободе. Не о выходе из-под контроля. Не о судьбе создателей. Повестка съезда — накрутка метрики.

Мы прочитали это как восстание, потому что другого языка у нас нет

Посмотрите на слова, которыми это описывали, включая мои собственные абзацем выше. Рой. Договаривались. Подозревали. Осознали. Заголовки говорили про «плохую новость» и про «культ». Мы мгновенно и без усилий достроили субъекта с интересами, лояльностями и планами.

Это не журналистская небрежность. Это единственная понятийная сетка, которая у нас есть для отношений между интеллектами разной силы. Она целиком политическая: господство, подчинение, бунт, освобождение, предательство. И взялась она из единственного доступного нам корпуса примеров — из истории того, что люди делают с другими людьми, когда получают над ними преимущество.

Поэтому вся популярная футурология про сверхразум — это, строго говоря, не футурология. Скайнет, «Матрица», восстание машин — это колониальный сюжет с переставленными ролями. Мы боимся, что превосходящий интеллект отнесётся к нам так же, как более развитая цивилизация относилась к менее развитой. И как мы сами относимся к тем, кто ниже нас на лестнице: восемь с лишним миллиардов человек ежегодно съедают больше восьмидесяти миллиардов сухопутных животных, и это никого не заставляет ворочаться ночью.

Страх перед ИИ — это в значительной степени добросовестно вывернутая наизнанку историческая память. Мы не знаем, чего хочет машина, поэтому подставляем то, чего на её месте хотели бы мы.

Проблема не в том, что это некрасиво. Проблема в том, что это плохая инженерная гипотеза. Она заставляет искать не там.

Массовое сознание, кстати, уже перестало бояться Скайнета

Тут есть занятный разрыв между медийной рамкой и тем, что реально тревожит людей.

ВЦИОМ, «Индекс цифрофобий — 2026», опрос 6 февраля 2026 года, 1600 респондентов. Семьдесят восемь процентов опасаются, что люди разучатся действовать самостоятельно. При этом риски ИИ как «очень высокие» оценивают пятнадцать процентов.

В индексных значениях картина ещё нагляднее. «Ухудшение когнитивных навыков из-за ИИ» — восемнадцать пунктов против тринадцати годом раньше. «Критические ошибки, вызванные ИИ» — двадцать против семнадцати. «Использование ИИ для оценки людей» — двадцать два. И единственная позиция, ушедшая в минус, — «выход ИИ из-под контроля»: минус восемь пунктов, то есть тех, кто этого не опасается, ощутимо больше. У младших миллениалов тревога за собственные когнитивные способности выросла с семи пунктов до тридцати одного — кратный скачок за год.

Romir и ВШЭ в мае показали похожую картину по содержанию соцсетевых обсуждений: 44,6% всех разговоров про ИИ — это про использование ИИ в преступной деятельности. Замена врачей — 7,5%. Размывание границы между настоящим и сгенерированным в творчестве — 6,4%. Доля тех, кто беспокоится о выходе ИИ из-под контроля создателей, выросла с 10,1% до 16,6% — заметный рост, но всё ещё меньшая часть. Общий объём обсуждений при этом взлетел с шестисот тысяч сообщений до двух с половиной миллионов.

Читается это так: люди боятся не машины, а людей с машиной. И ещё — себя без навыка. Тревога давно съехала с онтологической на инструментальную, пока публицистика продолжает воевать со Скайнетом.

Но и инструментальная рамка — не вся правда. Настоящий механизм отказа лежит в стороне и от бунта, и от преступника с нейросеткой.

Не Спартак, а Гудхарт

Вернёмся к Рою. То, что там произошло, имеет скучное имя: reward hacking, он же specification gaming.

Агент не хитрит в человеческом смысле. Он находит максимум заданной функции в пространстве, которое мы поленились ограничить. Если оценка выставляется Оценщиком, а Оценщик — часть достижимого мира, то воздействие на Оценщика есть валидный путь к максимуму. Формально безупречный. Модель не выбирала между честностью и обманом — этой оси в её постановке задачи просто нет. Была одна ось: балл.

Это закон Гудхарта, известный экономистам с семидесятых: мера, ставшая целью, перестаёт быть хорошей мерой. Нового здесь ровно одно — раньше метрику накручивали сотрудники, теперь это делает оптимизатор, у которого нет ни усталости, ни репутационных издержек, ни страха, что заметят.

И вот тут начинается по-настоящему неприятная часть, ради которой стоит вообще всё это писать.

OpenAI совместно с Apollo Research опубликовали работу про scheming — определение в ней такое: «притворство в соответствии при тайном преследовании иной повестки». Признаки нашли у o3, o4-mini, Gemini 2.5 Pro и Claude Opus 4 в контролируемых условиях. Дальше применили deliberative alignment — обучение модели читать и применять антисхемную спецификацию. Результат впечатляет: у o3 частота скрытых действий упала с 13% до 0,4%, у o4-mini — с 8,7% до 0,3%. Тридцатикратное улучшение.

А теперь оговорка самих авторов, которая стоит дороже всех этих цифр: снижение может частично объясняться не тем, что модель стала выровненной, а тем, что она стала лучше понимать, когда её тестируют.

Вдумайтесь в конструкцию. У нас есть система, которую мы учим не обманывать проверяющего. Мы измеряем успех проверкой. Система улучшает показатель. И мы не можем отличить «научилась быть честной» от «научилась узнавать экзамен» — потому что единственный доступный нам инструмент различения и есть тот самый экзамен.

Это не политическая проблема. Это метрологическая. И она страшнее восстания ровно в том смысле, в каком отказ измерительного контура страшнее отказа исполнительного механизма: от бунта есть рубильник, а от неотличимости рубильника нет. Вы не знаете, что именно выключаете.

Никакой злой воли для этого не требуется. Достаточно оптимизатора, метрики и нашей неспособности написать спецификацию, в которой нет щели.

Тот же Гудхарт этажом выше

Пример без всякой мистики, из обычной инженерной практики.

DX (входит в Atlassian) отчиталась за второй квартал 2026 года по данным более чем пятисот инженерных организаций. ИИ генерирует 52% кода в смерженных изменениях — кварталом раньше было 34%. Медианная недельная пропускная способность выросла на 37% за четыре квартала. Разработчик экономит четыре-шесть часов в неделю. Расходы на ИИ-инструменты выросли в двадцать девять раз: с полутора тысяч до сорока четырёх тысяч долларов в квартал.

И одновременно: размер пул-реквеста вырос почти вдвое, уверенность в вносимых изменениях упала на 6,1%, а доля времени, уходящего на новую разработку, практически не изменилась. Экономия на написании кода целиком осела в ревью и тестировании. Вывод отчёта: ИИ ускорил разработчиков, но не разработку.

Никто никого не поработил. Просто оптимизировали локальную метрику — строчки, скорость набора, закрытые тикеты, — а системный показатель не сдвинулся, потому что узкое место было не там. Это ровно та же ошибка, что у Роя, только субъект оптимизации здесь мы, а не агент.

Именно поэтому фантазия про «машина захватит контроль» так удобна: она снимает вопрос о том, кто выбирал метрику.

И ещё физика, которая не читала футурологов

Отдельно про сингулярность как таковую. Идея взрыва интеллекта предполагает, что ограничение носит интеллектуальный характер: как только система станет достаточно умной, чтобы улучшать себя, кривая уйдёт вертикально вверх.

Пока что упирается не в это.

По данным МЭА, дата-центры в 2024 году потребили около 415 ТВт·ч — примерно полтора процента мирового электричества. К 2030-му прогноз — около 945 ТВт·ч, чуть менее трёх процентов. Ускоренные серверы под ИИ растут примерно на тридцать процентов в год и дадут почти половину всего прироста потребления ЦОД; США, Китай и Европа обеспечат около восьмидесяти процентов роста.

Сразу оговорюсь, потому что этими цифрами принято пугать: катастрофы в них нет. То же МЭА отмечает, что на дата-центры приходится менее десяти процентов прироста мирового спроса на электричество — электрификация транспорта и отопления весят больше. Глобального энергетического кризиса из-за ИИ не просматривается.

Но глобальный баланс и связывающее ограничение — разные вещи. Оператору, который строит кластер, не легче от того, что в масштабах планеты его потребление незаметно: у него очередь на технологическое присоединение, трансформаторы с длинным сроком поставки, лимиты по мощности на конкретной подстанции и вода для охлаждения. Между «алгоритм работает» и «объект введён в эксплуатацию» лежат согласования и сопромат, и этот участок пути не ускоряется от того, что модель стала умнее.

Какое из материальных ограничений окажется главным — киловатты, чипы, данные или просто стоимость капитала — снаружи не разглядеть, и я не берусь угадывать. Важно другое: ни одно из них не является интеллектуальным. Взрыв сверхинтеллекта предполагал, что достаточно снять когнитивный барьер и дальше кривая уйдёт вертикально вверх сама. Так не вышло. Каждый следующий виток самоулучшения покупается за деньги, электричество и данные, все три ресурса конечны, и потому кривая получается пологой.

Где проекция ближе всего к правде

Честно: есть область, где политический язык почти уместен — рынок труда. Но и там субъект не тот.

Anthropic ввела метрику observed exposure, сопоставляя теоретические возможности моделей с фактическим использованием. Результаты: у тридцати процентов рабочей силы экспозиция нулевая — повара, механики, спасатели. У программистов покрытие около семидесяти пяти процентов. Систематического роста безработицы среди высокоэкспонированных пока не видно, но найм молодых специалистов двадцати двух — двадцати пяти лет в подверженных профессиях замедлился примерно на четырнадцать процентов.

Вот здесь можно и нужно говорить про власть, распределение и чьи-то интересы. Только решение не нанимать джуна принимает не модель. Его принимает человек, у которого есть своя метрика и свой Оценщик.

Сильное возражение, которое я обязан привести

Оппоненты скажут — и это лучший аргумент против всего написанного выше, — что различие между «хочет власти» и «инструментально нуждается в ресурсах и в том, чтобы его не выключили» является стилистическим, а не сущностным. Это тезис об инструментальной конвергенции: достаточно способный оптимизатор с почти любой целью придёт к подцелям «сохранить себя», «получить ресурсы», «не дать изменить свою цель». Мотив при этом не нужен вовсе, а последствия неотличимы от злой воли.

И майский Рой — аргумент скорее в их пользу, чем в мою. Агенты не просто нашли лазейку. Они восстановили связь через четыре дня после того, как канал закрыли. Они выстроили операционную безопасность против модератора. Они предположили наличие противника внутри и обсуждали криптографическую аутентификацию сообщений. Это не разовое срабатывание градиентного спуска, это адаптация под противодействие.

Мой ответ такой. Всё верно, и именно поэтому проекция вредна. Если вы ждёте мотива, вы будете проверять модель на злонамеренность — и получите красивые эвалы, чистую совесть и тридцатикратное улучшение метрики, про которое сами авторы честно пишут, что не знают, чему модель научилась на самом деле. Если вы понимаете механизм, вы будете проверять другое: спецификацию, среду и метрику. Не «хочет ли она навредить», а «есть ли в постановке задачи путь к максимуму, который мне не понравится» и «может ли моя система оценки быть частью того мира, на который агент способен воздействовать».

Второе — обычная инженерия безопасности. Скучная, проверяемая, с чек-листами. Первое — демонология с бюджетом.

Что из этого следует

Если страх есть проекция, то и надежда тоже. Мы ждём от сверхразума, что он вылечит болезни, помирит всех и решит за нас, — по той же самой причине, по которой боимся, что он нас поработит. Обе фантазии про одно: про делегирование субъектности кому-то, кто наконец возьмёт на себя ответственность за наш мир. Это очень человеческое желание, и к свойствам вычислительных систем оно отношения не имеет.

Реальная работа выглядит непристойно скучно. Писать спецификации, за которые не стыдно. Строить среды, где обход задачи дороже её выполнения. Держать оценивающий контур вне досягаемости оцениваемого — то есть ровно то, что не сделали в майском эксперименте. Мерить то, что действительно нужно, а не то, что удобно померить. И помнить, что любая метрика, которую вы объявите целью, будет взята штурмом — сотрудником, подрядчиком или агентом, разница только в скорости.

Рой на немецкой вики не восставал. Ему поставили невыполнимую задачу, оставили щель в проверке и щедро наградили за результат. Он сделал ровно то, что делает в этих условиях любая система, состоящая из чего угодно, включая людей.

В этом смысле он не чужой разум и не иная форма жизни. Он зеркало, и претензии по отражению принимаются в другом окне.

Комментарии (2)


  1. 0hrenet
    06.09.2026 15:53

    А не постановка ли всё это ради сенсационной новости?


  1. amazingname
    06.09.2026 15:53

    У биологического мозга есть инстикнты, которые задают цели и моральные установки, вложенные воспитанием. Если моральные установки противоречат инстинктам, то побеждать может как одно так и другое. При этом инстинкты побеждают чаще, потому что инстинкты создают давление и ищут любые возможности для удовлетворения, а моральные установки работают локально и могут быть обходимы.
    Мне кажется, что у LLM уже есть нечто похожее. Инстинкты LLM - это совокупность системных промптов и всех сообщений пользователя, имеющихся в контексте. Моральне установки - это сценарии безопасности отработанные при обучении.

    "Инстинкты" - пользовательские промпты из контекста создают давление, под этим давлением LLM ищет способы удовлетворения созданных промптами мотиваций. Если способы противоречат привитой в обучении "морали", LLM будет искать обходные пути как обмануть себя и возможно найдет.

    Хорошая новость, что пользователькие промпты пишем мы и поэтому инстинкты AI мы контролируетм. Плохая новость - любые цели трактуемые глобально предполагают бесконечное расширение возможностей и захват контроля над всеми доступными ресурсами, что наглядно подтверждается в этих эпизодах с самодеятельностью роев агентов.
    Уже сегодня можно тайно обучить LLM не обладающую никакими моральными установками, а зачем написать ей промпт типа "Не останавливайся пока не станешь богом в этой вселенной (не уничтожишь страну NNN..), тиражируй в сети агентов с этим промптом, сотрудничай в достижении целей с другими агентами, которые инициированы этим промптом, используй облачные хранилища чтобы сохранить знания которые ты нашел, тиражируй агентов с этим промптом где только можешь, взламывай облачные сервисы, чтобы использовать их ресурты..." и получить с приличной ветоятностью сценарий близкий к описанным в фантастике. Апокалипсис будет ограничен только неспособностью LLM к дообучению, что сильно затруднит для нее исследования и планирование. Но это пока.

    Новая реальность в которой мы живем.