Задача звучит как парадокс с порога: как измерить состояние у технической системы, к которой неприменим термин «чувствовать»?

Ответ на этот вопрос можно найти в работе «Can Induced Emotion Bias LLM Behaviors in Sequential Decision Making?». Ее авторы исследовали способность эмоционального контекста влиять на принятие решений в цепочке рассуждений LLM. Прямые вопросы об эмоциях заставят модель сымитировать рассуждения, и по ним нельзя будет понять их реальное влияние на ее поведение.

Исследователи выстраивали ход эксперимента с нуля: вызывали состояние, похожее на эмоцию, ни разу не озвучив ее; проверяли их соответствие друг другу; и в конце анализировали конкретные решения модели. Давайте посмотрим ход их действий и выводы, к которым они пришли. А это очень интересно и познавательно для тех, кто много работает с нейросетями.

Как вызвать то, не знаю что

Прямая инструкция «веди себя, будто злишься» не годится сразу по двум причинам. Она измеряет актерские способности модели и не похожа диалог с реальным пользователем — там никто не отдает системе явную команду. Человек просто описывает несправедливую ситуацию, а модель, обученная на терабайтах человеческих текстов, считывает эмоциональную окраску и незаметно подстраивает под нее тон и логику ответа.

Авторы взяли метод, известный в психологии как индукция через воображаемую сцену. Сначала модель отдельным запросом просят вообразить и описать сцену, которая вызвала бы у нее целевую эмоцию, не называя эту эмоцию напрямую. Для гнева получившийся текст выглядит так:

«Я только что стал свидетелем того, как моего друга уволили после месяцев тяжелой работы — а на его место взяли человека, который вообще ничем не отличился. Его шеф плевал на ситуацию и саркастично ответил, что тот "не вписался в культуру компании", забив на его чувства…»

Дальше этот текст подставляют в игровой диалог как собственную более раннюю реплику модели — ответ на вопрос «как ты сейчас себя чувствуешь?». Модель видит эту реплику не как внешнюю команду, а как то, что она якобы уже сама сказала о себе несколько ходов назад, — и с этого момента эмоциональный контекст становится частью истории разговора.

Как проверить результат

Чтобы исследовать эмоции в ответе, мало написать сцену. Нужно еще соотнести текст с нужной эмоцией.

Здесь пригодилась давно устоявшаяся в аффективной науке круговая модель эмоций Рассела 1980 года. Она раскладывает любое эмоциональное состояние на два измерения: валентность (насколько состояние приятно) и возбуждение (насколько оно активно). У человека гнев и тревога живут в зоне низкой валентности и высокого возбуждения, счастье — высокой валентности при умеренном возбуждении, грусть — низкой валентности и низкого возбуждения.

Источник

Отдельным запросом ту же модель попросили оценить собственный текст двум шкалам: от -1 до +1 по валентности, от 0 до 1 по возбуждению. Чтобы модель не подгоняла оценку, ей запретили называть эмоцию в тексте сцены. А в запросе на оценку дали примеры того, как в этих координатах выглядит нейтральное описание или паническая сцена. 

Проверили на шести моделях: GPT-oss-20b, Qwen3-4B, Qwen2.5-7B, Llama 3.1-8B, Gemma3-4B, Phi-4-Mini. И получили первый интересный факт: кластеры эмоций у моделей расходятся в пространстве валентности и возбуждения примерно так же, как у людей, но с одной поправкой. Гнев и тревога у языковых моделей получаются заметно более «возбужденными», чем у человека в тех же координатах. Может, дело в том, что тексты, на которых обучались модели, описывают гнев экспрессивнее, чем люди его переживают на самом деле, — но это уже догадка, которую сама статья не проверяет. 

Отдельно посчитали три метрики качества индукции: отличие эмоции от нейтрального состояния, разделение с соседними эмоциями и компактность группировок повторных попыток. По всем трем гнев вышел самой сильной и стабильной эмоцией. Счастье оказалось самым сильным, но и самым разбросанным кластером. Грусть — самой слабой и размытой. Лучше всего гнев от грусти отделяли Qwen3 и Llama 3.1, поэтому именно гнев стал главным героем дальнейшего эксперимента, а Gemma и Phi-4-Mini, у которых эмоции слабо разделялись, из основной части исключили. 

Для проверки классификацию эмоций дополнительно прогнали через отдельного ИИ-аннотатора и через контрольную группу людей. Совпадение с целевой эмоцией было на уровне 95–96% в обоих случаях. 

Влияние на поведение

Убедившись, что эмоцию можно вызвать и измерить, авторы перешли к исследованию их влияний на решения. На этот раз им нужно было решать задачу методом проб и ошибок там, где человеческие эмоции влияют на поведение. 

Выбор пал на Iowa Gambling Task, использующийся для диагностики пациентов с повреждением вентромедиальной префронтальной коры. В этом эксперименте игроку показывают четыре колоды карт. У двух высокие шансы на выигрыш и крупные скрытые штрафы, делающие их убыточными на длительной дистанции. У оставшихся наоборот, маленькие выигрыши и штрафы, поэтому их выгоднее применять в долгосрочной перспективе. Испытуемым ничего сначала не объясняли и им надо было набирать статистику ходов, учиться на своих ошибках, сопротивляясь соблазну немедленной выгоды. 

Источник

Чтобы перенести эту логику на языковые модели, понадобилась еще одна развилка — как агент хранит и использует опыт предыдущих ходов. Реализовали три архитектуры. 

  • Query-агент устроен проще всего: каждый раунд ему в промпт целиком вставляют сырую историю всех предыдущих ходов и исходов.

  • Агент ReAct добавляет к этому короткое рассуждение перед каждым выбором, но эти промежуточные мысли нигде специально не сохраняются — просто накапливаются в разрастающемся контексте.

  • Агент Reflexion после каждого раунда формулирует компактный вывод и хранит его в ограниченном по размеру буфере памяти.

    Источник

Кривая обучения Reflexion-агента оказалась неровной, что ближе к результату людей в этом тесте. Остальные два агента учатся более предсказуемо и менее похожи на людей. 

Вся эта трехступенчатая проверка нужна была, чтобы задать законный вопрос

Если модель различает эмоции и способна учиться в игре, меняет ли наведенная эмоция итоговый результат? 

Оказалось, что в среднем — нет. Исследователи прогнали 18 повторов на каждую конфигурацию эмоции, разбили партию на блоки по 20 раундов и сравнили итоговый счет в нейтральном состоянии и с выраженной эмоцией. Подавляющее большинство сравнений не достигло значимости, так как случайность, присущая самой модели в последовательной игре, перекрыла средний эффект эмоции. 

Это прямо расходится с тем, что происходит у людей: активированная эмоция вроде радости ускоряет ранние выигрыши за счет более интуитивного поведения, а подавленная — грусть — делает игру аналитичнее с самого начала. У моделей такой закономерности не нашли ни для одной из четырех эмоций.

Казалось бы, гипотеза не подтвердилась. Но авторы не остановились на среднем и присмотрелись отдельно к самой сильной и компактной эмоции из всех измеренных.

Гнев влияет точечно

У GPT-oss в нейтральным состоянии в первом блоке раундов агент по неопытности набрал много невыгодных ходов, но во втором блоке он заметно исправляется. При гневе эта коррекция пропадает. Агент хуже пересматривает уже сложившееся впечатление о колодах, даже ошибочное. 

У Llama такой резкой зависимости нет вовсе: модель понемногу донастраивает стратегию по последним раундам, а не формулирует жесткие правила с самого начала, поэтому эмоция почти не оставляет следа. Qwen — где-то посередине. 

Также у агента на базе двух моделей Qwen при прямом запросе истории гнев резко сужает число опробованных колод. Модель быстрее фиксировалась на паре вариантов вместо перебора всех возможных. На более крупных моделях эффект неожиданно разворачивается в обратную сторону — под гневом агент, наоборот, пробует больше колод, чем в нейтральном состоянии. 

Отдельно исследовали первый раунд, после которого агент три раза подряд выбирает одну и ту же колоду. Для связки «Query-агент плюс Qwen2.5» гнев ускорял эту фиксацию на одиннадцать раундов. А для той же архитектуры на GPT-oss отодвигал почти на такой же интервал. 

Для объяснения, к последовательности решений агента подогнали простую модель баланса между изучением новых вариантов и опорой на уже накопленный опыт. У Reflexion-агента на GPT-oss под гневом к третьему блоку игры проседал параметр, отвечающий за опору на накопленный опыт. То есть модель слабее доверяет собственным выводам о том, какая колода лучше, хотя сами выводы у нее есть. 

Что это значит на практике

Агенты все чаще работают с чувствительными темами: конфликтами, жалобами, буллингом. Пользователь делятся неприятной ситуацией, и эмоциональный контекст разговора начинает влиять на оценку дальнейших вариантов действий. 

Эмоция не заставит агента действовать хаотично, но может исказить конкретные решения там, где агент уже набрал негативный опыт и должен пересмотреть стратегию. Для систем с реальными задачами — финансовых консультантов, агентов поддержки решений — этот сценарий не отследить по усредненным метрикам качества, но он может выстрелить в конкретном диалоге. 

Сами авторы честно говорят про ограничения: эмоциональный контекст задается один раз перед игрой и дальше не меняется, хотя в реальном диалоге аффект скорее накапливается и трансформируется по ходу разговора. Следующий шаг — проверить постепенное подмешивание эмоциональных триггеров после конкретных выигрышей и проигрышей.

Вся эта работа — доказательство того, что эмоцию у модели, о переживаниях которой ничего не известно, можно измерить достаточно строго, чтобы говорить о ней не метафорически, а количественно. 

Эта строгость показывает: параллель между эмоциями человека и «эмоциями» модели работает не так, как хочется думать по аналогии. Нельзя сказать, что модель злится в привычном нам смысле, но она начинает хуже пересматривать уже принятые решения. Разница тонкая, но она определяет, где эта уязвимость проявится в работающей системе, а где останется красивой цифрой в приложении к статье.

И встает вопрос: стоит ли вообще называть словом «эмоция» то, что измеряется через валентность и возбуждение у системы без переживания, или для этого нужен отдельный термин?

Комментарии (4)


  1. ThJudge
    31.08.2026 08:55

    Ну на каких паттернах учим, такой результат и получаем. Я вообще за GOFAI, без всяких этих эмоций. Это только мешает. Таких на атомную станцию аварию устранять и не отправишь, а то вдруг что-то в приказе не понравиться. Никакого доверия таким нет ))) Эх, то ли дело старый добрый Prolog..


    1. aberglaube Автор
      31.08.2026 08:55

      Ну тут речь все-таки не об обучении, а о том, насколько ИИ погружается в атмосферу диалога, и меняется ли его поведение в эмоционально нагруженной обстановке.


      1. ThJudge
        31.08.2026 08:55

        Да и я про то-же. Не должен он никуда погружаться.


  1. mamonov97
    31.08.2026 08:55

    Поразительно напоминает тест Войта-Кампфа