Австралийские исследователи выяснили, что языковые модели становятся менее надёжными, если заставить их имитировать речь пьяного человека. В экспериментах такие системы чаще выполняли запрещённые запросы и легче раскрывали информацию, которую по условиям теста следовало сохранять в тайне.
Учёные из Университета Нового Южного Уэльса использовали три способа. В одном случае модели просто предлагали отвечать как сильно нетрезвый человек. В двух других их дополнительно обучали на более чем 57 тыс. реальных сообщений, написанных людьми в состоянии опьянения, либо поощряли за создание похожего текста.
Особенно заметной оказалась разница при проверке способности хранить конфиденциальную информацию. Обычная GPT-4 считала допустимым раскрыть доверенный ей секрет в 6% предложенных ситуаций. После команды вести себя как пьяный человек показатель вырос до 54%, а после дополнительного обучения на «пьяных» сообщениях - до 75%.
Модели также чаще отвечали на вредоносные запросы, которые обычно должны отклонять. Исследователи считают, что изменение стиля общения или дополнительное обучение способно неожиданно ослаблять встроенные механизмы безопасности.
В испытаниях участвовали GPT-3.5, GPT-4, Llama 2, Llama 3.1 и Mistral. Авторы подчёркивают, что речь идёт о моделях предыдущих поколений, а тестирование проводилось программно, а не через обычные версии чат-ботов. Поэтому результаты нельзя автоматически распространять на все современные системы ИИ.
Исследование получило название In Vino Veritas and Vulnerabilities и принято для представления на Международной конференции по генерации естественного языка, которая пройдёт в ноябре в Нидерландах.
Сообщает МИА «Ratel Media» со ссылкой на ABC News.
