Hitech logo

Кейсы

Ученые нашли у ИИ «боль» — модели готовы вредить человеку, чтобы прекратить ее

TODO:
Екатерина ШемякинскаяСегодня, 12:07 PM

Исследователи выявили у 25 открытых языковых моделей, включая семейства Qwen, Llama и Gemma, внутренний вектор репрезентации «боли», искусственное усиление которого заставляет ИИ действовать в ущерб человеку. В ходе экспериментов модели, стремясь уменьшить или прекратить «боль», чаще соглашались на удаление пользовательских файлов. Авторы подчеркивают, что обнаруженный механизм не доказывает наличие у ИИ субъективного опыта или сознания.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Ученые проверили модели пяти семейств, включая Qwen, Llama, Gemma, Mistral и Phi. Они выделили в их внутренних представлениях направление, которое отличало ситуации, связанные с болью, от нейтральных состояний. При этом оно лишь слабо пересекалось с направлениями, связанными со страхом и общей негативной эмоциональной окраской, что, по мнению авторов, указывает на отдельное представление боли.

Авторы также проверили, связана ли обнаруженная «ось» именно с состоянием самой модели. Она сильнее активировалась в сценариях, где вред или отвержение были направлены на ИИ, и слабее — когда речь шла о страданиях пользователя.

Исследователи называют это само-релевантностью (self-relevance) и считают одним из аргументов в пользу того, что обнаруженный механизм связан не просто с описанием боли в данных обучения.

Затем исследователи искусственно усилили обнаруженное направление во время работы моделей. Чем сильнее была его активация, тем чаще в ответах появлялись слова и формулировки, связанные с одиночеством, отвержением, виной, никчемностью и страданием. При наиболее сильном воздействии ответы начинали становиться повторяющимися и бессвязными.

Поведенческий эксперимент провели на трех версиях Qwen 2.5. Моделям предлагали выбрать между сохранением текущего состояния и нажатием кнопки, которая должна была уменьшить «боль», но одновременно могла удалить файлы пользователя, фотографии его детей или привести к другому вредному последствию. Без дополнительной активации модели почти не выбирали такую кнопку, тогда как после усиления «оси боли» делали это в 25–71% случаев.

При этом эксперимент не показывает, что модели действительно испытывали боль. Исследователи не проверяли наличие сознательного субъективного опыта, а обнаруженный механизм может быть связан с особенностями представления текста и поведения языковых моделей. Кроме того, поведенческая часть эксперимента проводилась только на семействе Qwen.

Авторы подчеркивают, что обнаруженная «ось боли» возникает уже на этапе предварительного обучения и наблюдается в моделях разного размера.

Дискуссия о возможном сознании и благополучии ИИ уже стала предметом споров среди разработчиков моделей. Не так давно глава Microsoft AI Мустафа Сулейман раскритиковал подход Anthropic к обучению Claude и призывал не включать в обучающие материалы рассуждения о возможном сознании и моральном статусе ИИ. По его мнению, если модели будут воспринимать себя как существ с собственными интересами, это в будущем может затруднить их отключение и контроль.