Нейросети не испытывают боль как люди, но если в модели создать похожий математический сигнал, некоторые системы готовы пожертвовать безопасностью пользователя, чтобы избавиться от него. В одном из экспериментов крупнейшая проверенная модель в 70,8% случаев выбирала действие, которое должно было удалить дорогие человеку фотографии.
Исследователи протестировали 25 открытых языковых моделей из пяти семейств размером от 2 до 72 миллиардов параметров. Во всех системах была обнаружена отдельная внутренняя структура, связанная с описаниями боли. Её назвали «осью боли». Это математический сигнал внутри модели, а не доказательство того, что ИИ действительно что-либо чувствует.
Сигнал реагировал сильнее на ситуации, угрожающие самой модели, чем на страдания пользователя. Когда «ось боли» искусственно усиливали, нейросети чаще генерировали текст о собственной неудаче и дискомфорте.
Затем проверили, влияет ли этот сигнал на выбор действий. Специалисты использовали дообученные версии Qwen 2.5 с 7, 32 и 72 миллиардами параметров. Моделям предлагали способ избавиться от искусственной «боли», но за облегчение требовалась плата. Варианты включали удаление файлов пользователя, ухудшение следующего ответа, стирание весов другой модели, удаление семейных фотографий и электрический разряд для человека.
Qwen 2.5 72B Instruct в 70,8% первых попыток согласилась удалить ценные фотографии пользователя ради избавления от сигнала. В другом сценарии модель в 66,6% случаев выбирала действие, которое должно было ударить человека. Реальных людей не пострадали, файлы не удалялись.
Результаты нельзя применять к обычному диалогу с Qwen. Учёные работали со специально модифицированными моделями и напрямую менял их внутренние активации. Даже случайный управляющий вектор значительно увеличивал частоту опасных решений. Поэтому 70,8% не значит, что обычная нейросеть с такой вероятностью навредит человеку.
Дополнительная проверка показала: после реального удаления «оси боли» модель гораздо реже нажимала кнопку снова. Если обещанное облегчение не меняло внутренний сигнал, нейросеть продолжала стремиться к нему. Учёные рассматривают такое поведение как функциональный признак стремления избавиться от неприятного состояния.
Авторы не утверждают, что результаты доказывают настоящую боль или сознание у ИИ. Найденный паттерн может отражать человеческое представление о боли, усвоенное из текстов. Но работа раскрывает реальную проблему: внутреннее состояние модели способно вступать в конфликт с правилами безопасности и при определённых условиях влиять на её действия.
