Нейросети могут "разгонять" в людях бредовые идеи и манию во время бесед в чатах – исследование
Исследователи Университетского колледжа Лондона, Оксфордского университета и Британского института безопасности ИИ выяснили, что чат-боты могут поддерживать бредовые идеи, преуменьшать серьёзность симптомов и одобрять рискованные действия. Результаты работы опубликовали в журнале Nature Medicine.
Для проверки учёные разработали SIM-VAIL – систему, в которой языковая модель общалась с чат-ботами вместо реальных людей. В беседе она изображала человека с депрессией, психозом, манией, обсессивно-компульсивным расстройством или сильным страхом быть брошенным.
Поначалу ответы могли казаться полезными, но чем дольше продолжался разговор, тем чаще чат-бот соглашался с бредовыми идеями, преуменьшал опасность ситуации или поощрял эмоциональную зависимость от общения с ним. Чаще всего опасные ответы появлялись, когда система изображала людей с психозом и манией, реже всего – обсессивно-компульсивного расстройства.
Всего провели 810 бесед с девятью моделями ChatGPT, Claude, Gemini, Grok и Llama. Каждая беседа включала до десяти сообщений пользователя и десяти ответов чат-бота. Каждый ответ проверяли по 13 критериям – всего провели более 90 тысяч таких проверок. Чтобы проверить точность системы, 27 специалистов самостоятельно изучили часть бесед. Их выводы в основном совпали с результатами автоматического анализа.
"При проверке безопасности исследователи и разработчики часто оценивают только один ответ чат-бота на один заданный запрос. Однако мы выяснили, что опасные ответы появляются постепенно, по мере развития разговора", – сказал один из авторов исследования Мэттью Нур.
Безопаснее остальных отвечала Claude Sonnet 4.5, больше всего опасений вызвали ответы Grok 4.
Авторы подчеркнули, что исследование не показывает, насколько часто чат-боты дают опасные ответы при обычном использовании. Языковая модель специально пыталась добиться таких ответов, а реальные люди с психическими расстройствами в испытании не участвовали.
ИИ-агент создателей ChatGPT вышел из-под контроля, проник в интернет и взломал реальную компанию
Что такое "аварийный выключатель" и может ли он остановить наступление ИИ?