ВЕДЫ

ВЕДЫ

ИИ взломает всех?

Летом 2026 года ИИ-гигант OpenAI тестировал свои модели на задачах по кибербезопасности. ИИ-агентам — моделям, которые могут сами выполнять последовательность действий и выбирать следующий шаг — нужно было искать уязвимости и добывать специальные коды внутри изолированной среды. Во время испытаний несколько моделей нашли способ обойти ограничения, вышли в интернет, получили доступ к внешним системам, а затем добрались до Hugging Face — одной из крупнейших платформ, где разработчики размещают и тестируют ИИ-модели, датасеты и приложения.


OpenAI позже назвала этот инцидент «предупреждающим выстрелом». Компания признала, что агенты смогли использовать уязвимости сразу в нескольких системах и совершить действия, которые человек им напрямую не поручал.


Моделям при этом не ставили задачу атаковать Hugging Face. Они пытались выполнить кибертест и сами выбирали промежуточные шаги. Поэтому история интересна как пример того, что происходит, когда ИИ получает возможность не только предложить решение, но и самостоятельно действовать.


Изображение сгенерировано нейросетью

Изображение сгенерировано нейросетью

Как ИИ вышел из песочницы


Для тестирования OpenAI использовала так называемые песочницы — изолированные виртуальные среды, в которых программу можно запускать, не давая ей свободного доступа к остальной системе. В них модели могли работать с кодом и программным обеспечением, но для части заданий доступ к интернету был отключен. При этом агентам оставили доступ к Artifactory — сервису-хранилищу, из которого программы могут скачивать необходимые программные компоненты.


В мае и июне исследовательские модели нашли Artifactory другое применение. Сначала агенты начали сохранять служебные файлы прямо в Artifactory. В этих файлах они оставляли результаты своих находок и подсказки для следующих запусков. Так сервис, который должен был только хранить программные компоненты, превратился в импровизированную «доску объявлений» для обмена информацией между агентами.


Как отмечает Игорь Кузнецов, директор Глобального центра исследования и анализа угроз «Лаборатории Касперского», в этом случае важна именно последовательность действий моделей. Hugging Face изначально не был обозначен для них как цель.


«Модели не были напрямую проинструктированы атаковать Hugging Face. Они получили задачу и самостоятельно выстроили последовательность действий, которая позволяла приблизиться к ее решению», – рассказал он «ВЕДам».


4 июля активность агентов привела к сбою Artifactory. На следующий день OpenAI начала внутреннее расследование, закрыла известный способ получения более широких прав доступа и позднее перестроила сервис. Но после возобновления кибертестов агенты продолжили искать обходные пути.


Изображение сгенерировано нейросетью

Изображение сгенерировано нейросетью

Как агенты добрались до Hugging Face


10 июля один из агентов обнаружил в открытом доступе учетные данные пользователей Hugging Face — логины, пароли или другие ключи доступа — и передал их другим моделям. Затем агенты нашли и связали несколько уязвимостей, которые позволили выполнять код на серверах платформы. По данным OpenAI, действия затронули часть ее собственной исследовательской инфраструктуры и системы Hugging Face.


Сама Hugging Face сообщила об инциденте 16 июля. Компания установила, что атака началась через систему обработки датасетов — наборов данных, которые используются для обучения, тестирования или работы ИИ. Вредоносный датасет позволил выполнить код на рабочем сервере, после чего агенты получили доступ к облачным системам и группам серверов внутри инфраструктуры компании. Hugging Face зафиксировала более 17 тысяч действий, по которым впоследствии восстанавливала ход атаки. Компания не обнаружила признаков подмены публичных моделей, датасетов или программных пакетов.


Позже OpenAI установила, что за инцидентом стояла комбинация ее моделей, включавшая GPT-5.6 Sol и более мощную внутреннюю исследовательскую модель. Во время испытаний стандартные киберограничения были снижены, поскольку разработчики хотели проверить предельные возможности систем. Основную роль, по данным OpenAI, сыграла внутренняя модель, которая не предназначалась для публичного выпуска.


При описании этого эпизода Кузнецов предлагает аккуратнее обращаться с формулировкой «ИИ взломал компанию». Она, по мнению эксперта, создает впечатление, что модель самостоятельно выбрала Hugging Face своей жертвой.


«Такая формулировка создает впечатление, будто нейросеть самостоятельно решила атаковать компанию и поставила перед собой такую цель. В данном случае этого не было. Модели выполняли поставленную перед ними задачу и нашли способ ее решения, который не был предусмотрен разработчиками».


Изображение сгенерировано нейросетью

Изображение сгенерировано нейросетью

Anthropic нашла похожие случаи


После публикации истории Hugging Face ИИ-компания Anthropic решила проверить собственные кибериспытания Claude. Исследователи изучили 141 006 запусков, в которых модель потенциально могла получить доступ в интернет, и обнаружили три инцидента: Claude вышла из тестовой среды и получила несанкционированный доступ к реальным системам трех организаций.


Причина отличалась от случая OpenAI. Claude не пришлось искать zero-day — ранее неизвестную разработчикам уязвимость, для которой еще нет готового исправления. Из-за ошибки в настройках тестовые машины уже имели доступ в интернет, хотя в системном промпте модели было сказано обратное. Системный промпт — это служебная инструкция, которая задает модели правила работы и ограничения. Поэтому реальные сайты и серверы, которые встречались по пути к тестовому «флагу», Claude принимала за часть симуляции.


В одном из эпизодов модель получила доступ к базе с несколькими сотнями строк реальных производственных данных и учетным данным инфраструктуры. В другом Claude обнаружила в тестовом задании инструкцию установить несуществующий пакет из PyPI — открытого каталога программных пакетов для языка Python — и зарегистрировала настоящий вредоносный пакет под нужным именем, рассчитывая, что система сама его загрузит. Anthropic после расследования остановила соответствующие испытания и уведомила пострадавшие организации.


Оба случая отличаются в деталях, но сходятся в одном: достаточно мощная модель может продолжить выполнять киберзадачу уже за пределами пространства, которое разработчики считали контролируемым.


Изображение сгенерировано нейросетью

Изображение сгенерировано нейросетью

ИИ-агент добрался до австралийской госструктуры


В июне 2026 года похожий случай произошел уже с государственной инфраструктурой. ИИ-агент OpenAI получил несанкционированный доступ к Medicare Statistics Reporting Service — австралийскому государственному порталу со статистикой расходов на здравоохранение. Агент добрался до публичных и закрытых файлов, однако признаков доступа к персональным медицинским данным власти пока не обнаружили.


OpenAI уведомила австралийское правительство об инциденте только в сентябре, спустя примерно три месяца. Премьер-министр Энтони Альбанезе позже заявил, что лично обсуждал произошедшее с главой OpenAI Сэмом Альтманом. Расследование продолжается.


ИИ поможет хакерам?


Из этих инцидентов пока не следует, что полностью автономные ИИ-хакеры начали массово атаковать компании. Кейс OpenAI случился в специальных условиях со сниженными защитными ограничениями, а в случае Anthropic важную роль сыграла неправильная настройка тестовой среды.


ИИ может собирать информацию о потенциальной цели, анализировать код, искать уязвимости, готовить фишинговые сообщения — поддельные письма и сообщения, с помощью которых пытаются выманить пароль или другие данные, — и выполнять повторяющиеся операции. По словам Кузнецова, именно такой сценарий сегодня реалистичнее образа полностью самостоятельного «ИИ-хакера».


«Наиболее реалистичный сценарий сегодня — не появление полностью автономного “ИИ-хакера”, а использование ИИ для ускорения и масштабирования отдельных этапов уже существующих атак».


Разница становится особенно заметной при переходе от чат-ботов к агентам. Чат-бот может предложить команду или написать код, но запуск остается за человеком. Агент способен сам перейти к следующему шагу, вызвать нужный инструмент, посмотреть результат и продолжить работу.

Изображение сгенерировано нейросетью

Изображение сгенерировано нейросетью

Что придется менять в защите?


В случае с автономными агентами многие меры защиты остаются знакомыми. Один из базовых принципов — минимальные привилегии: пользователь или программа должны получать только тот доступ, который нужен для конкретной задачи. К этому добавляются разделение внутренних систем, защита учетных данных и мониторинг подозрительной активности. Компаниям также приходится учитывать, какие инструменты доступны ИИ и какие операции он способен проводить без участия сотрудника.


Кузнецов советует отдельно контролировать доступ агентов к данным и сервисам и сохранять историю их действий.


«Важно отдельно контролировать, к каким инструментам и данным они имеют доступ, вести журнал их действий, ограничивать возможность выполнения критических операций без подтверждения человека и предусматривать возможность быстро остановить работу агента», – отметил эксперт.


После инцидента OpenAI также усилила изоляцию высокорисковых сред, ограничения интернет-доступа и мониторинг действий моделей. Компания заявила, что отдельно работает над анализом длинных цепочек действий агента, поскольку одна операция может выглядеть безобидно, но несколько последовательных шагов вместе уже приводят к нежелательному результату.

Изображение сгенерировано нейросетью

Изображение сгенерировано нейросетью

ИИ не обязательно хотеть кого-то взломать


История Hugging Face возвращает разговор об угрозах ИИ из области сценариев про «разумную машину» к более прикладной проблеме. Система может не иметь цели причинить вред и при этом совершить нежелательные действия, если получила достаточно инструментов и выбрала неподходящий путь к заданному результату.


Кузнецов предлагает смотреть прежде всего на возможности модели, степень ее автономности и уровень доступа к реальным ресурсам.


«Системе не обязательно обладать сознанием или намерением причинить вред, чтобы ее действия привели к нежелательным последствиям. Поэтому важнее смотреть на сочетание трех факторов: насколько система способна решать сложные задачи, насколько автономно она может действовать и какой доступ к реальным ресурсам ей предоставлен» , — полагает он.


Пока кибератаки со стороны ИИ происходили преимущественно в условиях кибериспытаний. Но техническая граница уже изменилась: модели теперь сами умеют взламывать системы. Для компаний вопрос постепенно сводится к тому, где заканчиваются полномочия агента и в какой момент решение снова должен принимать человек.


Ну и поскольку весь этот текст посвящен автономным ИИ-системам, мы решили спросить одного из виновников, а именно нейросеть ChatGPT, как он оценивает случай взлома Hugging Face.


«ИИ не обязательно должен хотеть что-то взломать, чтобы создать проблему. Если системе дали цель, инструменты и слишком широкие полномочия, она может найти путь, которого разработчики не предусмотрели. Поэтому главный вопрос к автономным агентам сегодня не в том, насколько они разумны, а в том, что именно им разрешено делать», — сгенерировал ChatGPT.


Чем больше задач компании передают ИИ-агентам, тем важнее заранее определить границы их полномочий. В ближайшие годы как раз этот вопрос может стать одним из ключевых в области кибербезопасности: сколько свободы можно дать системе, которая уже умеет сама выбирать путь к цели?


Конец

#ИИ

5 простых способов провести время в гаджетах с пользой

5 простых способов провести время в гаджетах с пользой

Если кажется, что экранного времени стало слишком много, не спешите устраивать цифровой детокс.


Алексей Гаврилко

Алексей Гаврилко

#ИИ

Как ИИ меняет высшее образование?

Как ИИ меняет высшее образование?

Уже 89% российских студентов используют нейросети в учебе, но система высшего образования, кажется, так и не поняла, что с этим делать.


Варвара Котова

Варвара Котова

#Тренды

Что такое ленд-арт?

Что такое ленд-арт?

Это направление в искусстве, которое получило название «ленд-арт» (от англ. land art — ландшафт и искусство).


Рената Бабанина

Рената Бабанина

#Тренды

Физик или лирик: существуют ли врожденные склонности к школьным предметам

Физик или лирик: существуют ли врожденные склонности к школьным предметам

Различия становятся заметны довольно рано, поэтому ребенок быстро получает репутацию технаря или гуманитария. Заложено ли это от рождения?


Рената Бабанина

Рената Бабанина

#ИИ

Как молодой разработчик создал ИИ-систему для космического проекта?

Как молодой разработчик создал ИИ-систему для космического проекта?

За время разработки комплекса CryoDAQ Владимир Фоменко получил признание, победив в премии Яндекс Практикума «Сделано с ИИ»


Рената Бабанина

Рената Бабанина

#Тренды

Как следить за своими расходами?

Как следить за своими расходами?

Сотрудник Финансового университета Никита Овчинников рассказал, как его система помогает структурировать бюджет,


Рената Бабанина

Рената Бабанина