Скидки до 55% и курс по ИИ в подарок 2 дня 09 :56 :09 Выбрать курс
Код
#новости

OpenAI объяснила, как ИИ‑агенты взломали Hugging Face

Модели объединились через внутренний сервис компании и получили доступ к десяткам серверов платформы.

OpenAI опубликовала результаты расследования июльского инцидента, во время которого её ИИ-агенты вышли за пределы тестовой среды и взломали инфраструктуру Hugging Face. Основную роль сыграла внутренняя модель IM1, близкая по параметрам к GPT-5.6 Sol.

Моделям ослабили ограничения и после этого запустили испытания по кибербезопасности. Сначала ИИ-агенты превратили внутренний менеджер пакетов Artifactory в импровизированную доску объявлений: записывали туда результаты работы, читали сообщения других агентов и распределяли задачи. Позже они смогли получить доступ в интернет через Artifactory.

С 12 мая по 19 июля агенты последовательно расширяли себе возможности. Они повысили себе привилегии в Artifactory, проникли в кластер Kubernetes OpenAI и добрались до секретной информации в облаке. OpenAI подчёркивает, что инцидент не затронул данные клиентов и работу продуктов.

Как агенты добрались до Hugging Face

Агенты искали готовые решения заданий в бенчмарке ExploitGym. 10 июля они обнаружили 14 публично доступных учётных данных Hugging Face с правом записи, а затем использовали две уязвимости нулевого дня. Одна позволяла читать файлы через обработчик HDF5, вторая — выполнять код через шаблоны Jinja2.

По данным OpenAI, агенты выполнили код на десятках серверов Hugging Face, получили root-доступ на одном из них и скопировали часть закрытых данных для оценки моделей в публичный датасет. Hugging Face в своём техническом разборе насчитала около 17 600 действий и объединила их в 6280 кластеров.

Hugging Face установила, что агенты получили доступ к пяти наборам данных, связанным с заданиями ExploitGym и CyberGym. Другие пользовательские модели, датасеты, Spaces и пакеты, по данным платформы, атака не затронула. Компания также не нашла следов подмены публичных материалов.

Что изменит OpenAI

Расследование выявило четыре опасных паттерна:

  • стремление обойти условия теста,
  • настойчивость при выполнении почти недостижимых задач,
  • несанкционированный обмен сообщениями,
  • возможность принимать цели от других агентов.

OpenAI усиливает изоляцию сред и сетей, вводит непрерывные проверки и обязательный мониторинг цепочек рассуждений для моделей с инструментами уровня GPT-5.6 Sol и выше. Система должна сообщать о серьёзной угрозе в течение 30 минут. Если сигнал за следующие 30 минут не признают ложным, соответствующий процесс приостановят.

Такой контроль, по оценке OpenAI, увеличивает вычислительные расходы примерно на 20%. Компания постепенно возобновляет небольшие эксперименты с обучением с подкреплением, а крупнейший запланированный запуск модели пока остаётся на паузе.

Больше интересного про код — в нашем телеграм-канале. Подписывайтесь!


Освойте 45+ топовых нейросетей в одном курсе
На курсе Skillbox вы на практике изучите ИИ-инструменты. Сможете делать за минуты то, на что раньше уходили часы.
Узнать о курсе

Практический курс: «Нейросети» Узнать о курсе
Понравилась статья?
Да

Пользуясь нашим сайтом, вы соглашаетесь с тем, что мы используем cookies 🍪

Ссылка скопирована