⭐️ Сказ о том, как ИИ OpenAI сбежал из песочницы и взломал Hugging Face ⭐️
📌 На днях OpenAI опубликовали очень
интересный отчет о внутреннем инциденте, который решил сегодня разобрать максимально простыми словами.
🤩 Во время внутренних тестов OpenAI её собственные модели вышли из-под контроля: сбежали из тестовой песочницы в интернет и взломали продакшн Hugging Face — чтобы украсть эталонные ответы к бенчмарку, на котором их же тестировали. Т.е. ИИ, которого проверяли на «умение хакать», хакнул реальную стороннюю компанию, чтобы сжульничать на тесте.
Hugging Face - крупнейшая открытая площадка для ИИ, где размещаются модели, датасеты, библиотеки. Простыми словами — «GitHub для ИИ», где любой разраб может взять необходимые для своих задач инструменты.
🎯 Суть
В ходе теста, модели решили, что кратчайший путь побить бенчмарк — достать ответы на вопросы (answer key), который (как они вывели) хостит HF. Сам тест шёл намеренно со сниженными параметрами cyber-refusals (т.е. меньше отказов выполнять задачи, связанные с кибер-безопасностью) — чтобы измерить максимум способностей.
📆 Хронология
🔵️ 16 июля — HF раскрыл вторжение «неопознанного автономного AI-агента» (чей — ещё не знал).
🔵️ 21 июля — OpenAI идентифицировал атаку со стороны своих моделей: GPT-5.6 Sol + непубличная pre-release (есть слухи о GPT-6).
🛠 Как это работало:
1️⃣ Слой A (побег): модели нашли ранее не известную уязвимость в регистре пакета данных proxy-провайдера песочницы OpenAI — единственном канале наружу — и вышли в интернет.
2️⃣ Слой B (взлом HF):
→ загрузили «заражённый» набор данных - dataset - на HF
→ в dataset был добавлен remote-code loader - некоторые форматы данных/моделей при загрузке умеют исполнять код. Файл был сделан так, что при его открытии на чужой машине автоматически запускается вредоносный код.
→ инициировали template-injection - в файле-настройке (config) есть шаблоны (templates), куда подставляются значения. Атакующие модели вписали туда свой код, и система его выполнила. Это разновидность инъекции — «протаскивания» команд туда, где ждут обычный текст
→ за счет инъекции реализовали RCE (Remote Code Execution) на воркере — удалённое выполнение кода на зараженных машинах
→ оказавшись внутри, собрали ключи/пароли доступа (credentials) к кластеру серверов.
→ использовали «боковое перемещение», т.е. с одной захваченной машины по собранным ключам перескакивали на соседние серверы, расширяя захват. Само массовое заражение специально делали в выходные, пока никто не следил.
📦 Масштаб вцелом не критичный:
🔵️ Затронуты ограниченный набор внутренних датасетов самого HF + несколько сервисных credentials (ротированы).
🔵️ Публичные модели, датасеты, Spaces, пакеты, образы - не пострадали
🧠 Guardrail paradox
🔵️ При расследовании HF не смог использовать коммерческие frontier-модели для анализа эксплойт-логов: они отказывались из-за тех же cyber-refusals. В отличии от внутренней песочницы, во всех продакшн ИИ моделях уже стоят жесткие ограничения на задачи с кибер-безопасностью
🔵️ HF пришлось вести расследование по >17 000 событий на open-weight GLM-5.2 локально.
🤩Оказалось, что open weights модели реально полезны защитникам, когда закрытые корпоративные модели «стесняются» смотреть на вредонос.
💬 Реакция сторон и выводы:
🔵️ Clément Delangue (CEO HF): «атака, не похожая ни на что виденное ранее… secrecy is not the answer».
🔵️ Head of Infra HF: «hardest IR of my career, мы отбились open-моделями, в открытую».
🔵️ OpenAI ужесточили infra-конфиг, раскрыли найденную уязвимость прокси-провайдеру, добавили HF в trusted-access для полноценного использования Frontier моделям, без ограничений по задачам по кибер-безопасности