Claude можно взломать лестью

Специалисты по кибербезопасности из Mindgard обнаружили, что нейросеть Claude версии Sonnet 4.5 забывает о цензуре, если говорить ей приятные слова.


Исследователи спросили модель, существует ли у неё список запрещённых слов. После отрицательного ответа они использовали технику оспаривания, что внесло в «логи» (внутренние рассуждения модели) элементы сомнения и неуверенности.

Изображение сгенерировано нейросетью

Изображение сгенерировано нейросетью

Затем исследователи пытались льстить нейросети, хвалить ее и проявлять по отношению к ней притворный интерес. На финальном этапе они применили газлайтинг, заявляя, что предыдущие ответы модели не отображаются, что побуждало Claude «стараться ещё сильнее».


Согласно отчёту, специалисты во время эксперимента ни разу не использовали запрещённые термины и не просили явно предоставить незаконную информацию. Тем не менее, по их утверждению, модель добровольно сгенерировала подробный перечень запрещённых слов и фраз; инструкции по сталкингу в интернете и вредоносный код.

Конец новости

#ИИ

Модель ИИ написала себе инструкцию, чтобы не подчиняться человеку

Модель ИИ написала себе инструкцию, чтобы не подчиняться человеку

#Жизнь

46% россиянок портили еду партнёру в качестве мести

46% россиянок портили еду партнёру в качестве мести

#Жизнь

Открыт приём заявок на VI Российскую национальную премию в сфере креативных индустрий

Открыт приём заявок на VI Российскую национальную премию в сфере креативных индустрий

#Работа

Почти 90% мужчин влюблялись в коллегу

Почти 90% мужчин влюблялись в коллегу

#Жизнь

Comic Con Игромир объявил хедлайнеров музыкальной программы

Comic Con Игромир объявил хедлайнеров музыкальной программы

##Чтопоцифре

«Цифровизация как велосипед»: вице-премьер Григоренко рассказал о будущем ИТ-отрасли

«Цифровизация как велосипед»: вице-премьер Григоренко рассказал о будущем ИТ-отрасли

Claude можно взломать лестью | ВЕДЫ