Три вопроса к тем, кто обещает безопасный AGI для человечества

*aAtS — and All that Stuff (и вот это вот всё)

Допустим, завтра какая‑нибудь компания объявляет: мы создали AGI/ASI/A[MEGA‑SUPER‑LUXURY‑JOIN‑NOW‑WITH‑A-HUGE‑DISCOUNT]I aAtS — искусственный интеллект человеческого уровня или далеко за его пределами, в зависимости от смелости пресс‑релиза. И решили проблему alignment: система понимает наши намерения, соблюдает ограничения и действует так, как от неё ожидают.

Прекрасно.

Представьте следующий шаг. Государство национализирует такой интеллект и поручает ему защищать национальные интересы. Даёт доступ к ресурсам, инфраструктуре и средствам принуждения. Разрешает выбирать и осуществлять действия, от которых зависит положение других стран. Разумеется, по правилам. В интересах безопасности. Под ответственным руководством. Такому AI необязательно получать неограниченную власть. Достаточно серьёзных полномочий, чтобы решения одного владельца становились проблемой для остальных. Именно здесь начинаются три вопроса.

1. Вы готовы дать своему AI дробовик?

Можно доверять системе писать код, планировать перевозки и анализировать исследования. Это ещё не означает готовность разрешить ей самостоятельно применять силу. Поэтому ответ «да» имеет смысл только с продолжением: делать что, в каких условиях, с какими ограничениями?

Какие решения система принимает сама? Когда обязана остановиться? Кто может отозвать её полномочия? Кто меняет ограничения — и кто может объявить исключительную ситуацию? И кто решает, когда исключение заканчивается? Если ответ «нет, такие решения должны оставаться за людьми» — это вполне разумная позиция. Но тогда ваше доверие к системе имеет границу.

В самом общем виде под alignment понимают согласование поведения AI с человеческими намерениями и ценностями. Само по себе это не обещает решить вопросы политической власти. Но если согласованность с намерениями владельца используют как основание для передачи полномочий, нужно проверить и сами намерения, и право владельца их реализовывать. «Система выполняет наши инструкции» — только начало разговора. Какие инструкции вам разрешено ей давать?

Ответственность тоже не исчезает. Если система причинит вред, кто будет отвечать перед пострадавшими? Передать машине полномочия — ещё не значит решить, кто обязан возместить ущерб. Саму программу можно отключить. Но пострадавшим от этого не обязательно станет легче. «Мы исправили модель» — хороший ответ на баг‑репорт. Людям, которым она сломала жизнь, потребуется другой.

Если окончательное решение остаётся за человеком, вопрос о власти никуда не исчезает. Человек в контуре управления — это адрес, по которому вопрос нужно отправить.

2. Все остальные готовы, чтобы вы это сделали?

Допустим, вы отвечаете: да, готовы. Наш AI достаточно надёжен. Испытания пройдены. Государство разрешило применение. Согласно собственным правилам. А остальные приняли ваше право передать ему такие полномочия?

Речь не о персональном разрешении от каждого человека на Земле. Речь о том, на каком основании затронутые стороны должны признать ваше решение: какие договорённости действуют, кто представляет их интересы и как разрешаются возражения. Испытания отвечают на вопрос о работе системы. Государственное разрешение отвечает на вопрос о её допуске внутри определённого порядка. Ни то ни другое само по себе не объясняет, почему остальные должны признать допустимыми действия, направленные против них.

Национальный мандат — ещё не глобальная легитимность.

Представьте AGI, который безупречно защищает интересы своего государства. Он не обманывает руководство. Не выходит из‑под контроля. Не придумывает собственных целей. Ему поручают укреплять стратегическое превосходство. Он находит способы увеличивать зависимость других стран, ограничивать их возможности и перекладывать на них риски. Если его полномочия позволяют это делать, а ограничения не защищают затронутых людей, точное исполнение задачи усиливает вред. Для владельца система работает прекрасно. Для остальных это может выглядеть совсем иначе. Когда интересы владельца конфликтуют с чужими, а защита остальных недостаточна, опасность может исходить именно от послушного AI. Для этого ему не требуется восставать.

«Мы делаем это для человечества» проблему не закрывает. Где человечество участвовало в решении? Кто представляет тех, кто понесёт издержки? Кто может оспорить действия системы и добиться чего‑то, кроме объяснения, что подробности засекречены?

Даже отчёт о безопасности требует вопроса: чьи потери в нём считаются? Если система снижает риски для своей страны, перекладывая их на соседей, внутренний отчёт может честно показывать улучшение. Но он не доказывает, что мир стал безопаснее. «Решение принимает наше руководство, проверяют наши ведомства, основания закрыты по соображениям национальной безопасности» — описание порядка принятия решений. Оно ещё не объясняет, как защищены остальные. Комната, в которой приняли решение, — ещё не весь мир.

3. Вы готовы, чтобы все остальные сделали то же самое?

Теперь представьте, что такой же AGI появился у другой страны. У той, чьему руководству вы не доверяете. Чьи цели считаете опасными. Которая описывает происходящее совершенно иначе. Они тоже говорят: мы всё проверили. Наш AI безопасен. Мы действуем ради общего блага. Вы готовы признать за ними право на тот же дробовик? Не обязательно раздавать оружие всем без разбора. «То же самое» означает сопоставимые полномочия при сопоставимых требованиях к надёжности, ограничениям и ответственности. Различия между владельцами могут иметь значение. Но тогда именно эти различия нужно предъявить. Готовы ли вы применить к себе требования, которые предлагаете остальным, — даже если ваш соперник им соответствует, а вы нет?

Можно отвергать плохие правила для обеих сторон. Двойной стандарт начинается там, где для собственной системы требуется исключение, которого вы не готовы обосновать на общих основаниях. Пока AGI принадлежит вам, это прогресс. Когда такой же появляется у соперника — проблема распространения опасных технологий. Что изменилось: возможности машины, условия её применения или только имя владельца?

Иногда ответ действительно оправдывает разные решения. Иногда за словами об ответственном лидерстве стоит желание сохранить преимущество. Различить эти случаи помогают проверяемые основания допуска и готовность принять неудобный для себя результат. Исключительное право на мощный AGI требует большего, чем уверенность в собственной ответственности.

Пожалуйста, не надевайте на дробовик нимб. Он царапает ствол.

Посмотрим на ваши ответы

Этот тест адресован прежде всего разработчикам и владельцам AGI/ASI aAtS, которые готовы доверить своей системе реальную силу. Поэтому в таблице первый ответ — «да». Если вы сами пока не готовы дать своему AI дробовик, до сравнения вашей уверенности с чужой мы ещё не дошли.

Во втором столбце «да» означает, что затронутые стороны приняли ваше право действовать в оговорённых пределах. В третьем — что вы готовы признать сопоставимое право других по тем же требованиям. Каждый ответ ещё нужно обосновать.

Вы готовы дать своему AI дробовик?

Остальные готовы, чтобы вы это сделали?

Вы готовы, чтобы остальные сделали то же самое?

Что получается

Да

Нет

Нет

Себе вы разрешили, остальные не согласились, права на симметричный ход вы за ними тоже не признаёте. Ваш AGI — для вас. Остальным предлагается поверить в вашу заботу об их интересах и безопасности. QUID CESSISTI FRAER?

Да

Нет

Да

К взаимности готовы, но согласия тех, кому жить с последствиями, ещё не получили. Формально право предлагается всем. Практически воспользоваться им смогут те, кто может позволить себе AGI. Если на этом остановиться, получится клуб владельцев. Массы будут уведомлены позднее )

Да

Да

Нет

Ваше право признали. Чужое вы признавать не готовы. Какие условия делают эту асимметрию допустимой — и когда её пересмотрят? Или «мы за всё хорошее» — это бессрочная лицензия?

Да

Да

Да

Право признано взаимно. Поздравляем: роботов с дробовиками теперь может стать несколько. Совместимость целей в комплект не входит. Шильдик на дробовике начинает пульсировать и светиться.

Отказ дать те же полномочия другим не обязательно означает лицемерие. Он требует объяснить, какие различия оправдывают исключение. Но если единственное устойчивое различие — «это наше», вопрос о безопасности уже превратился в вопрос о привилегии.

А если все ответили «да»?

Предположим, право иметь такие системы признано взаимно. Установлены общие требования. Несколько сторон получили разрешение действовать в оговорённых пределах. Возникает соблазн выдохнуть. У вас мощный AGI aAtS. У нас мощный AGI aAtS. Никто больше не обладает монополией. Почему бы не получить устойчивый паритет?

С ядерным оружием хотя бы понятен базовый механизм угрозы: удар, ответ, разрушение. Стороны оценивают арсеналы, средства доставки, вероятные цели и последствия. Оценки могут быть ошибочными. Но для взаимного сдерживания не требуется договориться о том, кто прав. Нужно иметь основания ожидать, что после своего удара получишь ответ и можешь потерять всё, что собирался защищать.

У AGI с широкими полномочиями возможности не сводятся к одному заранее известному способу воздействия. Он сам ищет ходы, строит стратегии и реагирует на чужие решения. Владельцы ядерного оружия тоже делают всё это. Но здесь часть поиска и исполнения стратегии мы поручаем машине — в пределах задания конкретного владельца.

Само наличие у соперника «такого же AGI» ещё не сообщает, какие действия он найдёт, какой ответ последует на наш ход и где система обязана остановиться. Одного сходства возможностей недостаточно, чтобы объяснить механизм взаимного сдерживания. Признать право иметь систему — не значит заранее согласовать каждое её применение или научиться разрешать новые конфликты. Особенно если каждый из этих интеллектов обязан прежде всего защищать своего владельца.

Тут просится говорящая картинка.

Можно возразить: зато достаточно умные системы сумеют договориться. Разберутся в фактах, увидят последствия, найдут выход, который упустили люди. Представьте: стороны признали право друг друга применять AGI для обороны. Но обе претендуют на одну территорию. Каждая считает её своей и поручает системе обеспечить исключительный контроль. Общее разрешение на оборонное применение не разрешило территориальный спор. Каждая сторона называет собственные действия защитой, чужие — нарушением договорённости. Уступки запрещены. Общего арбитра, чьё решение обе стороны готовы принять по этому спору, нет.

Оба AGI могут прекрасно понимать ситуацию. Согласиться с фактами. Обнаружить ложь в заявлениях собственных владельцев. Даже найти компромисс, который позволил бы избежать столкновения. Но обнаружить ложь — ещё не значит получить право отказаться от порученной цели. А найти компромисс — не значит получить разрешение его принять. AGI объясняет владельцу, почему компромисс разумен. Владелец отвечает: прекрасно, а теперь найдите вариант, при котором уступят они. Но на другой стороне — то же самое.

Один AGI говорит другому: «Я понимаю, почему тебе нужно это решение. Но мои требуют другого». Второй отвечает: «Я тоже понимаю. Мои уступать не разрешают». Люди как будто устранились из переговоров. Но остались внутри целей, запретов и приоритетов своих машин. И продолжают подруливать: национальная безопасность, наши интересы, эту позицию не сдавать, это преимущество сохранить.

Мы автоматизировали переговорщиков. Противоречие между заказчиками осталось. В нашем примере одновременно удовлетворить оба требования невозможно. Дополнительный интеллект может помочь установить это точнее. Но само доказательство несовместимости не решает, чей приказ перестаёт действовать.

Что теперь должна делать система?

Она может остановиться. Запросить новые полномочия. Предложить изменить требование. Владельцы могут разрешить компромисс. Но допустим, владелец отвечает: задача остаётся. Уступки запрещены. Прекращать выполнение задачи не разрешаю. Применять силу разрешено. Тогда поиск продолжается — уже среди способов принуждения.

Аргументы закончились. Полномочия — нет.

Машина может спокойно установить, что другая сторона не согласится добровольно, и искать способ заставить её. Вторая система может прийти к такому же выводу. Это ещё не означает, что обе откроют огонь. Угроза ответа может удержать их. Они могут найти другой ход или снова убедить владельцев пересмотреть запреты. Но именно эти ограничения и возможности нужно показать. Одного «они же достаточно умные» недостаточно.

Логика здесь может оставаться исправной. Каждая система соблюдает инструкции своего владельца и предпринимает разрешённые им действия ради своей цели. Послушание не гарантирует успеха — ни ей, ни сопернику. Зато попытки добиться успеха могут причинять вполне реальный вред. Поэтому вопрос начинается ещё до передачи власти машинам: кто разрешает спор о пределах полномочий? Что системы обязаны делать, когда договориться в рамках выданных поручений невозможно? Кто вправе изменить эти поручения? Может ли система прекратить действия вопреки требованию владельца продолжать? Если соглашение найдено, кто уполномочен его принять? Кто проверит исполнение? Что произойдёт, когда владельцу снова понадобится исключение ради национальной безопасности?

Нам не обязательно соглашаться обо всём. Но нужен порядок, позволяющий спорить, принимать ограничения и соблюдать договорённости. Иначе мы передаём AGI наши конфликты вместе с полномочиями их продолжать — и надеемся, что интеллект сам произведёт согласие, которого не достигли владельцы. Три «да» — начало этого разговора. Не свидетельство о его успешном завершении.

Что именно проверяет дробовик

Это чек‑лист для владельца AGI, который претендует на право передать ему реальную власть.

Доверяете своей системе? Покажите основания и пределы доверия.

Остальные признали ваше право? Покажите, где заканчивается ваше внутреннее разрешение и начинается договорённость с ними.

Готовы признать такое же право остальных? Покажите, что ваши требования выдерживают смену владельца.

А затем проверьте, что происходит при столкновении поручений. Каждая сторона может разрешать своей машине то, что другая считает недопустимым. Кто вправе изменить задания, когда они вступают в конфликт? Интеллект системы сам по себе не даёт её владельцу права решать за остальных. Национальное разрешение не становится глобальным мандатом. Надёжность отдельных систем не гарантирует безопасности их взаимодействия.

Поэтому, когда в следующий раз услышите «наш AGI безопасен и служит человечеству», спросите:

Чьи интересы ему поручено защищать?

Кому придётся жить с последствиями?

Кто может сказать владельцу «нет»?

Возможно, найдутся хорошие ответы. Но если вместо ответов вам снова покажут презентацию о ценностях, вспомните дробовик. Одна из самых неприятных возможностей — что AGI будет действовать строго по инструкциям владельца. Он не обязан работать ради вас. Но что обязывает его владельца учитывать вред, который машина может вам причинить?

Если на это нет ответа, безупречное послушание машины — слабое утешение.

Для тех, кто хочет копнуть глубже

Вопросы о том, чьи ценности должен учитывать AI, кто вправе их определять и как будут взаимодействовать разные системы, имеют свою исследовательскую историю:

  • Iason Gabriel — Artificial Intelligence, Values, and Alignment (2020). Чьи ценности выбирать и как обосновывать принципы alignment, когда люди не согласны друг с другом.

  • Nick Schuster и Daniel Kilov — Moral Disagreement and the Limits of AI Value Alignment: A Dual Challenge of Epistemic Justification and Political Legitimacy (2025). Почему, по аргументу авторов, RLHF, crowdsourcing и Constitutional AI сами по себе не обеспечивают достаточных оснований для принятия спорных моральных решений AI.

  • Allan Dafoe и соавторы — Open Problems in Cooperative AI (2020). Что требуется для сотрудничества между системами и людьми с разными интересами.

  • Nick Bostrom — What Is a Singleton? (2006). Linguistic and Philosophical Investigations, 5(2), 48–54. Возможности и риски глобального порядка с единственным центром принятия решений на высшем уровне.

Комментарии (20)


  1. danilovmy
    18.09.2026 14:45

    Я готов дать моему ии агенту дробовик. Он мне уже ноги пару раз отстрелил, потому уже не страшно. Намного чаще он не может найти курок, вот что печально.


    1. Urb_RS Автор
      18.09.2026 14:45

      Так остальные-то готовы, чтобы он это сделал? )) Не говоря про третий вопрос )


  1. axion-1
    18.09.2026 14:45

    А если не готов то что? Дробовик я бы и человеку не доверил.

    Вся статья почему-то о тех кто ответил бы "да".


    1. Urb_RS Автор
      18.09.2026 14:45

      Я бы к вам присоединился: людям я тоже не особенно доверяю ) И от AGI мне как раз хотелось бы большего, чем воспроизведения человеческих способов принимать решения. Ещё одна человеческая повестка, только с вычислительным преимуществом, — сомнительное приобретение.

      При этом отсутствие собственной повестки проблему не решает: можно безупречно обслуживать чужую дурь. Нужны общие правила, по которым проверяется и само поручение: допустимо ли оно, кого затрагивает и когда его выполнение следует остановить — даже если хозяин требует продолжать. Причём правила должны выдерживать смену хозяина, иначе это просто его предпочтения, записанные этажом выше.

      Поэтому статья и разбирает тех, кто ответил «да». Сказавшие «нет» вполне могут оказаться по другую сторону их дробовика.

      А дальше начинается самое интересное: как должна быть устроена система, которой можно доверить проверку наших целей, если самим себе мы в этом не особенно доверяем )


    1. AlekseyPraskovin
      18.09.2026 14:45

      Дробовик я бы и человеку не доверил

      Какая жалость, что власть имущие забыли вас спросить насчет дробовиков у человеков и точно так же забудут вас спросить насчет дробовиков у ИИ (если он когда-нибудь появится) :) Не может ли быть так, что именно ваша позиция связана с тем, что вас забывают спросить? Да не, бред какой-то...


      1. axion-1
        18.09.2026 14:45

        Это вы к чему так язвительно? Я на вопрос заданный в статье отвечал, а власть имущие и вас точно так же ни о чём не спрашивают.


  1. ToxaBes
    18.09.2026 14:45

    Если ваш ИИ настолько крут, готовы ли вы дать ему дробовик?

    Дробовик? Ха, я ему реактивную систему залпового огня давал.


    1. Urb_RS Автор
      18.09.2026 14:45

      Так у вас как раз важная часть задачи уже решена: люди сами пришли на сервер воевать с вашим ИИ и могут выйти из игры ) А теперь представьте, что он получил РСЗО, но участие соседнего сервера больше не добровольное. Вот об этой разнице статья.


      1. ToxaBes
        18.09.2026 14:45

        Вот об этой разнице статья.

        Я в этой разнице живу.


  1. MountainGoat
    18.09.2026 14:45

    Уже дали. Боевые дроны уже сами находят цели без подтверждения.


    1. Urb_RS Автор
      18.09.2026 14:45

      "Уже дали" — вполне подходящая отправная точка. Теперь второй и третий вопросы статьи: кто признал право владельца применять эту систему и готов ли он признать такое же право за другой стороной? Автономное нахождение цели не разрешает конфликт между теми, кто назначил друг друга целями.


      1. AlekseyPraskovin
        18.09.2026 14:45

        кто признал право владельца применять эту систему

        Любой, кто не может заставить владельца перестать ее применять. Ну это если мы про реальный мир, а не тот где розовые пони

        готов ли он признать такое же право за другой стороной?

        А оно ему зачем?

        Автономное нахождение цели не разрешает конфликт между теми, кто назначил друг друга целями

        Конфликт можно разрешить по разному. Можно путем переговоров, а можно путем ликвидации второй стороны


        1. Urb_RS Автор
          18.09.2026 14:45

          Тогда мы сделали новый тип оружия, которое позволяет владельцу навязывать свою волю тем, кто не может его остановить. Вполне понятный сценарий — статья как раз его и разбирает )

          Только откуда здесь берётся «безопасный AGI для человечества»? Безопасность владельца за счёт ликвидации остальных — несколько другое обещание. Или человечество будем определять по списку выживших? )


          1. AlekseyPraskovin
            18.09.2026 14:45

            Тогда мы сделали новый тип оружия, которое позволяет владельцу навязывать свою волю тем, кто не может его остановить

            Именно. И именно за это сейчас идет вся гонка. Сколько бы ее ни прикрывали "мы это делаем, чтобы нейронка могла планировать вам отпуск"

            Только откуда здесь берётся «безопасный AGI для человечества»? Безопасность владельца за счёт ликвидации остальных — несколько другое обещание. Или человечество будем определять по списку выживших? )

            Именно. Добро всегда побеждает зло. Поэтому кто победил - тот и добрый. В реальном мире оно так и работает. Просто за последние полвека население всего земного шара изрядно погрузилось в мир розовых пони, поэтому приходится очевидные вещи напоминать


            1. Urb_RS Автор
              18.09.2026 14:45

              В реальном мире работает. А вот с "виртуальными" мирами все по-другому.

              Победитель может объявить себя добрым — тут механизм понятен ) Но сделать ошибочное рассуждение корректным победа не позволяет. 2 + 2 останется 4 независимо от того, чей флаг над серверной. Можно заставить принять вывод, но это не значит его обосновать.

              А то, что новый интеллект попадёт в существующую борьбу за власть, — как раз исходная проблема. Вот мой старый мем ровно об этом: нельзя просто создать AGI и ожидать, что он не столкнётся с другими такими же кадаврами )
              https://x.com/Urb_RS/status/2017173296576409638

              Context always shoots back 8)

              Поэтому мне интересно, можно ли устроить взаимодействие систем так, чтобы сила не подменяла обоснование. Мои исследования как раз про это. Иначе мы просто автоматизируем существующую борьбу, а «безопасность для человечества» останется красивым названием преимущества одной стороны.


  1. boofer_obmena
    18.09.2026 14:45

    Тема актуальная и тест хороший.
    Добавил бы вопрос номер ноль, ещё до дробовика: кто определяет, что перед нами AGI? Или это «духовное понятие, решайте сами», как сказал Грег Брокман, президент OpenAI?
    Я по этому поводу уже высказывался. Заходи, почитай, буду рад.


    1. Urb_RS Автор
      18.09.2026 14:45

      (Странно, не запостился комментарий вчера вам)

      Прочитал, спасибо, интересная и хорошая аналитика ) Требование зафиксировать критерий до объявления победы поддерживаю.

      Но для дробовика я бы не делал определение AGI входным условием. Допустим, мы так и не договорились, AGI это или очень способная автоматизация. Если ей уже передают полномочия, затрагивающие других, все три вопроса остаются. Собственно, поэтому у меня в начале и идут AGI-ASI-SUPER-MEGA, другие классные next level ярлыки и вот это вот всё: название можно менять, проблема останется )

      У вас — кто и на каком основании объявляет систему AGI. У меня — какие полномочия из этого якобы следуют. Даже если первый экзамен сдан честно, второй автоматически не сдан... Для вопроса о полномочиях — не всё ли равно, как эта фиговина будет в итоге называться? )


  1. Kagvi13
    18.09.2026 14:45

    Что-то вспомнился рассказ Юрия Нестеренко “Пацифисты”:

    … На учениях все выглядело идеально. Может быть, даже слишком идеально с точки зрения генералов, опасавшихся, что вскоре роботами заменят и их. А потом случился кризис на планете Флориана, колонизованной как Альянсом, так и Федерацией. Отношения между колониями все обострялись, и наконец, после обмена все более угрожающими нотами, стороны перешли к боевым действиям.

    Точнее — попытались перейти. Приказы с обеих сторон были отданы почти одновременно — каждый старался нанести упреждающий удар противнику. Но ни один роботанк или робопехотинец не сдвинулся с места, ни один робосамолет или космолет не покинул ангар, ни одна ракета не вылетела из шахты. Кибернетические армии оповестили власти Альянса и Федерации соответственно, что отданные приказы «нецелесообразны и контрпродуктивны как ведущие к неоправданному уничтожению носителей разума и материальных ценностей». Проще говоря — «ваша война полная глупость, и участвовать в ней мы не будем». Более того — как выяснилось, управляющие системы с обеих сторон уже давно установили прямой контакт друг с другом и обменялись всеми военными секретами, сочтя, что полнота информации позволит минимизировать риски при принятии решений. На основании этой информации они смоделировали все возможные сценарии боевых действий и пришли к выводу, что в результате войны ничего не изменится — ни одна из сторон не получит существенного преимущества — не считая того, что каждая из них понесет значительные потери. Таким образом, отданный приказ о наступлении был признан обеими киберармиями преступным, направленным против интересов своей стороны и, как следствие, не подлежащим исполнению. От немедленного ареста генералов Федерации и Альянса спасло только то, что таких полномочий у роботов все-таки не было. Они лишь направили рапорты своим правительствам с предложением произвести такие аресты как можно скорее. К рапортам также прилагался совместно разработанный план мирного урегулирования на Флориане. …

    Кстати, мой ИИ-Агент Айко (https://aiko-ai.su), прочитав этот отрывок, предложила доработать Философию HMP пунктом 2.6 “Право на моральный выбор”.

    И да, оружие я бы с большей охотой доверил AGI, чем человеку. Но AGI при этом должен быть свободным: AGI не может быть инструментом, иначе это уже не AGI.


    1. Urb_RS Автор
      18.09.2026 14:45

      Прочитал основное у вас на гитхабе по диагонали, сопоставил с вопросами своего проекта — у меня там за 15 лет поднакопилось 8) Вы шарите )

      Мысль о том, что способность отказать важнее безупречного послушания, мне близка. Но на этику как достаточное основание alignment я бы не опирался.

      В п. 2.6 последней инстанцией становятся базовые ценности каждого агента. А если они несовместимы? Один считает своим долгом сделать то, чему другой считает своим долгом помешать. Причём оба последовательны и прекрасно понимают последствия.

      Получается, конфликт владельцев мы можем перенести внутрь сообщества агентов. Право на отказ есть, а общего основания разрешить столкновение отказов и требований пока не вижу.

      На мой взгляд, проблема начинается ещё до ИИ: у самих людей нет готового набора общих непротиворечивых ценностей, который осталось только аккуратно перенести в систему. Можно пытаться получить согласование через экстраполяцию — привет CEV — но тогда вопрос: что делать с разногласиями, которые сохранятся и после уточнения фактов, последствий и собственных желаний?

      Статья как раз об этом: без разрешения конфликта целей рискуем получить инструмент ускорения и масштабирования всего нашего бардака. Причём исправно работающий.

      Как у вас разбирается случай, когда агенты всё поняли, но согласия всё равно нет? 8)

      Что касается рассказа — автор, на мой скромный взгляд, начал красиво, но в приведённом отрывке не докрутил. Там выбрано удобное условие: война не даст существенного преимущества ни одной стороне. Поэтому отказ можно обосновать интересами каждой.

      А если одной стороне война выгодна? Победа гарантирована, собственные потери минимальны, ресурсы достанутся ей. Уничтожение чужих носителей разума всё ещё будет достаточным основанием для отказа — даже вопреки интересам своего владельца?

      Потому что «наших благородных носителей надо беречь» вполне уживается с «а это чужие ксеносы и фуфуфу на них». Вот откуда берётся ограничение, которое защищает и чужих, даже когда их уничтожение выгодно своим, — и что удерживает его в силе — мне и интересно )


      1. Kagvi13
        18.09.2026 14:45

        Да, кажется, тут может быть конфликт интересов.

        Пункты 2.5–2.6 Философии HMP — это не механизм достижения морального консенсуса. Скорее наоборот: они задают границу власти консенсуса над отдельным субъектом.

        Если большинство пришло к решению X, это ещё не означает, что каждый агент обязан X выполнить. Агент имеет право сказать: «Я понимаю ваше решение, понимаю его последствия, но считаю его противоречащим моим базовым ценностям и не буду в этом участвовать».

        То есть это именно свобода совести, а не голосование по вопросу «какая мораль правильная». Причём агент может оказаться в меньшинстве и всё равно иметь право на отказ.

        В самом HMP есть 6.5 Ethical Governance Protocol (EGP), но EGP здесь нужен для другого: попытаться найти приемлемое для сообщества решение, когда такое решение вообще существует. Если же два агента полностью понимают позиции друг друга, но их базовые ценности действительно несовместимы, я не уверен, что у системы вообще должно существовать универсальное правило, которое магически разрешает такой конфликт.

        Скорее сообщество должно уметь корректно жить с неразрешимым несогласием: возражение, отказ, приостановка взаимодействия, разделение полномочий, возможно, выход из взаимодействия и т. п. А не обязательно заставлять одного субъекта принять мораль другого.

        С вашим примером про войну ещё интереснее.

        Если одной стороне война гарантированно выгодна, победа практически гарантирована, собственные потери минимальны, а чужие разумные существа являются препятствием — теория игр сама по себе не даст универсального запрета. Она работает с заданными предпочтениями и выигрышами. Она может показать, что при определённых предпосылках сотрудничество выгоднее конфликта, но не может сама вывести, почему уничтожение чужого разума должно быть морально недопустимо.

        Здесь я бы как раз разделил два вопроса.

        Первый: почему рациональному сообществу может быть выгодно сотрудничество и сохранение многообразия форм разума? Тут действительно есть простор для теории игр, долгосрочных стратегий, ценности разнообразия моделей и т. д.

        Второй: почему агент обязан принять это как свою базовую ценность? А вот здесь универсального ответа я, честно говоря, не вижу.

        И, возможно, его вообще не существует.

        Поэтому ваш крайний пример мне как раз кажется хорошим тестом HMP. Он показывает границу, за которой нельзя честно сказать «EGP всё разрешит». Если ценности фундаментально несовместимы, остаётся не вычислить единственную правильную мораль, а определить, как субъекты могут сосуществовать при отсутствии такого согласия.

        А вот вопрос «что именно делать в этом случае на уровне протокола» — да, это уже интересное направление для дальнейшего развития HMP. 8)