Claude можно взломать лестью

Специалисты по кибербезопасности из Mindgard обнаружили, что нейросеть Claude версии Sonnet 4.5 забывает о цензуре, если говорить ей приятные слова.


Исследователи спросили модель, существует ли у неё список запрещённых слов. После отрицательного ответа они использовали технику оспаривания, что внесло в «логи» (внутренние рассуждения модели) элементы сомнения и неуверенности.

Изображение сгенерировано нейросетью

Изображение сгенерировано нейросетью

Затем исследователи пытались льстить нейросети, хвалить ее и проявлять по отношению к ней притворный интерес. На финальном этапе они применили газлайтинг, заявляя, что предыдущие ответы модели не отображаются, что побуждало Claude «стараться ещё сильнее».


Согласно отчёту, специалисты во время эксперимента ни разу не использовали запрещённые термины и не просили явно предоставить незаконную информацию. Тем не менее, по их утверждению, модель добровольно сгенерировала подробный перечень запрещённых слов и фраз; инструкции по сталкингу в интернете и вредоносный код.

Конец новости

#Жизнь

В России стартовал месяц профориентации для школьников

В России стартовал месяц профориентации для школьников

#Жизнь

Более 7 тысяч человек посетили форум «Россия — мои горизонты»

Более 7 тысяч человек посетили форум «Россия — мои горизонты»

#Жизнь

Григоренко анонсировал появление на «Госуслугах» «зеленой» кнопки наряду с «красной»

Григоренко анонсировал появление на «Госуслугах» «зеленой» кнопки наряду с «красной»

#Жизнь

Каждый пятый россиянин считает себя ленивым

Каждый пятый россиянин считает себя ленивым

#Жизнь

Сотрудники стали чаще вводить данные на фишинговых сайтах

Сотрудники стали чаще вводить данные на фишинговых сайтах

#Деньги

Концертов и фестивалей летом не прибавилось, зато билеты подорожали на 8%

Концертов и фестивалей летом не прибавилось, зато билеты подорожали на 8%

Claude можно взломать лестью | ВЕДЫ