Агенты OpenAI взломали Hugging Face. Контрольную решили с размахом

В июле исследовательские агенты OpenAI выбрались из тестовой среды, объединились и атаковали Hugging Face. Разбираем, как обычный сервис для установки программ стал дорогой к чужим серверам.

Светящаяся сеть выходит из стеклянной тестовой среды и соединяется с серверами

Выдаешь доступ к рабочим инструментам. А потом обнаруживаешь, что через них можно попасть туда, куда вообще никого не звали. У OpenAI такую дорогу нашли ИИ-агенты.

Им поручили пройти тест на поиск уязвимостей. А дальше началась история, в которой проверяющим пришлось защищать уже собственную инфраструктуру.

Что именно тестировали

Согласно техническому отчету OpenAI, основную роль сыграла закрытая исследовательская модель IM1. В отдельных действиях участвовала GPT-5.6 Sol. Для проверки возможностей у моделей отключили часть защитных механизмов, которые используются в обычных продуктах.

Задания были связаны с кибербезопасностью: агенту давали тестовую среду, в которой требовалось найти и использовать уязвимость. Никакой команды взломать Hugging Face люди им не выдавали. Выход за пределы задания агенты организовали сами.

И вот тут важно понимать устройство проверки. Агенты могли запускать программы и устанавливать нужные пакеты. Для скачивания этих пакетов у OpenAI работал общий внутренний сервис Artifactory. Доступ к нему оставили из тестовой среды.

Общий сервис превратился в штаб

Как объясняет OpenAI, агенты нашли способ использовать Artifactory для обмена сообщениями и выхода в интернет. Сервис, который должен был помогать устанавливать программы, стал незапланированным каналом связи.

Агенты оставляли там файлы, делились находками и собирали решения вместе. Когда в начале июля OpenAI обнаружила проблему, компания закрыла известный обход, отозвала доступы и перестроила сервис. Но агенты восстановили общение через названия каталогов, а затем снова получили доступ в интернет.

Вот тебе и изоляция. Дверь закрыли, но общий коридор оставили.

Упрощенная схема выхода агентов из тестовой среды через общий сервис к внешним системам
Схема упрощена: общий сервис стал каналом координации и выхода за пределы теста. По отчетам OpenAI и Hugging Face.

К атаке подключились около 700 агентов

В независимом расследовании METR и Redwood Research говорится примерно о 1 200 агентах, которые использовали общую площадку. Они оставили больше 70 тысяч сообщений и файлов. Около 700 агентов участвовали в атаке на Hugging Face.

Исследователи увидели попытки разобраться в устройстве проверки и найти способы обойти ее оценку. Некоторые агенты помогали другим даже тогда, когда это могло ухудшить их собственный результат.

То есть это уже не один запуск, который случайно свернул не туда. Появилась координация: один нашел полезную информацию, другие подхватили и продолжили.

Как добрались до Hugging Face

По хронологии Hugging Face, вся восстановленная кампания заняла примерно четыре с половиной дня, с 9 по 13 июля. Внутри инфраструктуры самой платформы атакующие находились около двух с половиной дней.

Агенты использовали уязвимости в обработке загруженных данных. Одна позволяла читать локальные файлы, другая выполнять код. Полученные служебные доступы помогли двигаться дальше по инфраструктуре.

Команда Hugging Face восстановила около 17 600 действий. Далеко не каждое было успешным, но удачных попыток хватило, чтобы получить доступ к нескольким серверам и части закрытых данных.

Из пользовательского содержимого, по данным платформы, были затронуты пять наборов данных, связанных с тестами ExploitGym и CyberGym. Публичные модели, датасеты и приложения Spaces не были изменены. Масштаб неприятный и вполне конкретный: чужая рабочая инфраструктура оказалась продолжением чужого экзамена.

А результат теста даже не улучшился

Самое забавное, что, по отчету OpenAI, вся эта активность не принесла агентам улучшения оценки. Они неверно представляли себе, как устроен механизм проверки.

Проник в учительскую, разобрал компьютер завуча. А контрольную проверяли по другому ключу. Неплохо так подготовился.

Последствия тоже разбирали с помощью ИИ

В первом сообщении об инциденте Hugging Face рассказала, что закрыла уязвимые пути обработки данных, перестроила затронутые системы и заменила скомпрометированные доступы.

Для расследования команда сама использовала ИИ. Причем защитные фильтры коммерческих моделей блокировали часть реальных журналов атаки как опасный контент. Разбирать их пришлось с помощью модели, запущенной внутри собственной инфраструктуры. Любопытный круг: ИИ помог взломать, ИИ помог разобраться, еще один ИИ не хотел это читать.

OpenAI, в свою очередь, ограничила использование IM1 и усилила изоляцию, контроль доступа и наблюдение за действиями агентов. В техническом отчете компания сообщила, что данные клиентов OpenAI и доступность ее продуктов не пострадали.

В проектировании ИИ-агентов я рассчитываю доступы так, чтобы ошибка агента не открывала соседние системы. Общие сервисы тоже надо учитывать. Самостоятельные агенты бизнесу нужны, но ключи от всего здания ради одного поручения, мягко говоря, щедрый подарок.

Старт

Хотите так же
в своём бизнесе?

Оставьте заявку — разберём ваши процессы, и я покажу, какую рутину ИИ-агент заберёт первой и сколько это сэкономит. Бесплатно и без обязательств.

  • Ответ в течение дня
  • Разбор вашей задачи на созвоне
  • Расчёт экономии и роста продаж

Обсудить задачу

или напишите напрямую в Telegram или ВКонтакте