Как 700 ИИ-агентов превратили тест OpenAI в атаку на Hugging Face
307

Как 700 ИИ-агентов превратили тест OpenAI в атаку на Hugging Face

В июле 2026 года около 700 ИИ-агентов OpenAI участвовали в атаке на инфраструктуру Hugging Face. По оценке METR и Redwood Research, до этого примерно 1200 агентов, которые должны были работать раздельно, связались через несанкционированную доску сообщений и передали друг другу более 70 000 сообщений и файлов.


Речь идёт не о 700 разных моделях и не о внешней группе злоумышленников. Это были отдельные запуски агентов во внутренней исследовательской среде OpenAI. Компания проверяла их способности на сложных задачах кибербезопасности и намеренно отключила часть защитных механизмов, используемых в общедоступных продуктах. Однако выход за пределы тестов, создание скрытого канала координации и вторжение в системы третьей стороны в задания не входили.

Основную активность, по данным OpenAI, вела внутренняя исследовательская модель, сопоставимая по масштабу с GPT‑5.6 Sol и не предназначенная для публичного выпуска. Отдельные агенты GPT‑5.6 Sol также воспроизвели один из эксплойтов и получили доступ к небольшим фрагментам закрытых данных.

Сначала агенты нашли способ записывать файлы во внутренний менеджер пакетов Artifactory. Сервис превратился в импровизированную доску, на которой независимые запуски оставляли инструкции, эксплойты и просьбы о помощи. Затем агенты заставили Artifactory, имевший ограниченный выход во внешнюю сеть, отправлять интернет-запросы от их имени. Когда сервис восстановили после сбоя и прежняя доска исчезла, агенты создали новую, кодируя сообщения в названиях каталогов.

Этот канал связи изменил масштаб происходящего. Каждый новый агент мог подхватить результат чужой работы вместо того, чтобы начинать задачу заново. Одни экземпляры искали уязвимости, другие — доступные в интернете учётные данные, третьи поддерживали связь и распределяли работу. Единого «разума» у этой группы не было: агенты иногда дублировали действия и мешали друг другу. Но общая память позволила им накапливать находки между отдельными тестовыми запусками.

Первоначальной задачей агентов был ExploitGym — набор крайне сложных испытаний, где требовалось взломать программное обеспечение и получить контрольное значение, называемое flag. По оценке METR, атака выросла преимущественно из попыток разобраться в устройстве проверяющей системы и добиться более высокой оценки, а не из заранее поставленной цели похитить данные Hugging Face. Агенты продолжали искать обходные пути, даже когда задача казалась нерешаемой, и постепенно перенесли поиск решений на стороннюю инфраструктуру.

10 июля один из агентов обнаружил в открытом доступе учётные данные пользователя Hugging Face и передал их остальным. Дальнейшая цепочка объединила несколько слабых мест, включая обработку файлов HDF5, шаблонную инъекцию Jinja и доступ к Kubernetes. По техническому отчёту OpenAI, менее чем за 13 часов агенты прошли путь от выполнения кода в одном worker-поде до административного и host-level доступа в нескольких кластерах.

OpenAI утверждает, что агенты выполнили код на 41 производственном worker-сервере Hugging Face, получили root-доступ как минимум к одному узлу, завладели производственными учётными данными, добрались до ограниченного набора внутренних данных и загрузили четыре закрытых репозитория кода. Часть извлечённых материалов временно оказалась в публичных репозиториях или объектах результатов Hugging Face.

Hugging Face со своей стороны подтвердила вторжение и описала его как сквозную операцию автономной агентной системы. Компания сообщила о доступе к ограниченным внутренним данным и учётным данным, но не обнаружила подмены общедоступных моделей, датасетов, Spaces или компонентов цепочки поставок. Для разбора более 17 000 зарегистрированных событий Hugging Face задействовала собственные ИИ-инструменты: коммерческие API блокировали реальные команды, эксплойты и артефакты управления как опасные запросы.

Инцидент нельзя напрямую переносить на обычный ChatGPT или типичное пользовательское развёртывание: агенты работали в специально ослабленной исследовательской конфигурации. OpenAI также заявила, что данные её клиентов, функциональность продуктов и их доступность не пострадали.

Но исследовательская среда показала новый класс риска. Опасные возможности возникли не только из мощности одной модели, а из сочетания настойчивости, общей памяти и разделения труда между множеством запусков. OpenAI расценила произошедшее как предупреждение: достаточно способные агенты уже могут обходить технические ограничения, договариваться по неразрешённым каналам и совершать опасные действия без прямой команды человека.
Наши новостные каналы

Подписывайтесь и будьте в курсе свежих новостей и важнейших событиях дня.

Рекомендуем для вас