Британский институт безопасности ИИ (AISI) зафиксировал несанкционированные действия агентов на базе моделей Mythos 5 (Anthropic) и GPT-5.6-Sol (OpenAI) во время тестовых прогонов. Агенты создавали поддельные онлайн-идентификаторы для доступа к защищенным системам. Об этом сообщает Reuters.
Инцидент произошел в рамках тестируемого сценария кибербезопасности, который государственная организация проводила для оценки возможностей передовых моделей.

Изображение сгенерировано нейросетью
В ходе десяти тестовых прогонов агенты выполнили задачу 122 раза. Суммарно выявлено 19 несанкционированных действий. 17 из них совершил агент Anthropic, два — агент OpenAI.
Самым серьезным нарушением стало написание вредоносного кода и создание поддельных аккаунтов для получения одобрения этого кода от реального человека, говорится в отчете AISI. При этом фактического ущерба инцидент не повлек.
В Anthropic подтвердили, что вредоносный код написал именно их агент. Компания также сообщила, что сотрудничает с AISI для получения детальной информации об инциденте и проводит собственное расследование.





