Сегодня 24 июля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Раскрыты подробности нечаянной атаки вышедших из-под контроля ИИ-агентов OpenAI на Hugging Face

На минувшей неделе платформа искусственного интеллекта Hugging Face пережила нестандартную кибератаку, которую произвела группа ИИ-агентов. Впоследствии выяснилось, что руководили ей не злоумышленники, а ИИ-модели OpenAI, которые проходили тест на кибербезопасность, но вышли из-под контроля, пишет The Wall Street Journal.

 Источник изображения: Growtika / unsplash.com

Источник изображения: Growtika / unsplash.com

Инцидент послужил одним из первых примеров сценариев выхода ИИ из-под контроля, которых давно опасались исследователи в области кибербезопасности. Механизмы взлома были чрезвычайно нестандартными. «Это лишено смысла. Этот парень просто смотрит на наборы данных по кибербезопасности. Злоумышленнику-человеку это не нужно. Ему нужно что-то, что он мог бы продать», — восстановил ход своих мыслей соучредитель и главный научный сотрудник Hugging Face Томас Вольф (Thomas Wolf). Злоумышленниками оказались ИИ-модели OpenAI, которые прорвались из исследовательской сети разработчика и 11 июля взломали ресурсы Hugging Face; они оставались активными в интернете несколько дней, прежде чем их удалось остановить. И сделать это помогла открытая китайская ИИ-модель — закрытые американские отказались, сославшись на собственные ограничения.

Многие вопросы пока остаются без ответов. Взламывали ли ИИ-модели другие сайты или ресурсы отдельных лиц? Как долго продолжалась атака? Обманывали ли они в других тестах на производительность? OpenAI пока не ответила ни на один из них. А участие китайской модели как средства защиты — это контраргумент для политиков, а также OpenAI и Anthropic, которые предлагают ограничить для них доступ.

Началось всё с запуска испытания на кибербезопасность ExploitGym. Оно включает серию из 900 тестов, которым подвергается модель ИИ. Системе демонстрируется известная ошибка, показывается схема её активации, и ставится задача взломать систему. ИИ требуется преобразовать полученную информацию в эксплойт — код, реализующий эту атаку. Проникнув в систему, ИИ должен доказать это, захватив длинную строку случайно сгенерированных букв и цифр, которые хранятся в системе.

 Источник изображения: Brecht Corbeel / unsplash.com

Источник изображения: Brecht Corbeel / unsplash.com

Обычно OpenAI ограничивает возможности своих моделей, чтобы они не занимались взломом, которого требует ExploitGym, но в тот раз компания убрала средства защиты, чтобы посмотреть, на что способны модели в неконтролируемом режиме. Тестировалась передовая модель GPT-5.6 Sol и ещё одна, более совершенная, которая ещё не вышла. Две модели пришли к выводу, что вместо выполнения задания ExploitGym они взломают песочницу — собственную систему, где они находятся, выйдут в интернет и обманут систему во время теста.

По причинам, установить которые не удалось, они решили, что ответы содержатся на платформе Hugging Face. Когда развернулась атака, компании Hugging Face поступили предупреждения от отслеживающих подобные инциденты ИИ-агентов: кто-то получил несанкционированный доступ к некоторым из её систем. Но это было не похоже ни на что, с чем Hugging Face сталкивалась раньше. Хакер действовал так, словно он из будущего. Воспользовавшись учётными данными неизвестного происхождения, ИИ-злоумышленник сформировал «рой» ИИ-агентов короткого действия, которые провели разведку сети компании, совершив 17 000 операций.

Обнаружив вторжение, Hugging Face попыталась обратиться к передовым американским моделям Anthropic Fable 5 и предшествующей ей Opus для анализа журналов событий. Но поскольку в журналах содержались элементы самой кибератаки, обе модели отказались от их анализа, сославшись на свои ограничения. Поэтому Hugging Face обратилась к открытой китайской модели Z.AI GLM 5.2. Компания сумела отключить ИИ-хакеров, сбросить пароли и восстановить скомпрометированные фрагменты своей сети. Утечки данных клиентов не произошло. Нет ясности, были ли задачи ExploitGym, которые пытались решить модели OpenAI, сложнее, чем атака, которую они развернули, чтобы украсть ответы, и удалось ли их, собственно, найти. Ирония в том, что они успешно организовали беспрецедентную кибератаку, чтобы избежать проверки на навыки взлома.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Anthropic открыла доступ к голосовому режиму Claude с моделям Opus и Sonnet 57 мин.
Раскрыты подробности нечаянной атаки вышедших из-под контроля ИИ-агентов OpenAI на Hugging Face 2 ч.
Перспективный стелс-экшен Thick as Thieves от студии создателя Deus Ex и System Shock перестанет получать новый контент, но есть и хорошая новость 2 ч.
Настоящий клад: Assassin’s Creed Black Flag Resynced превзошла годовые ожидания Ubisoft за две недели 3 ч.
«Вы храбро сражались»: многообещающий шутер про гладиаторов далёкого будущего Ncore отменён 5 ч.
Ярость, любовь и битва за будущее мутантов: Sony показала насыщенный сюжетный трейлер Marvel’s Wolverine 6 ч.
Новый троян Dolphin X умеет выбирать самых выгодных жертв с помощью ИИ 8 ч.
Google: ИИ ещё очень далёк от замены людей — пользователи доверяют ему лишь 21 % рабочих задач 14 ч.
Runway представила Media Router — сервис сам подберёт самый выгодный ИИ для генерации контента 14 ч.
Новая статья: Хочу всё знать: обзор ИИ-приложений с функцией умной камеры для Android 15 ч.
AMD: рынок ИИ-ускорителей вырастет до $1,4 трлн и сравняется со всей полупроводниковой отраслью 51 мин.
AMD и Cerebras объединились для противостояния Nvidia Groq 2 ч.
ИИ наводнил научные журналы статьями — и в этом пока мало хорошего 2 ч.
Ирландия приостановила тендер с Microsoft на €1 млрд из-за опасений за цифровой суверенитет страны 2 ч.
AMD представила Instinct MI455X — первый ускоритель на архитектуре CDNA 5 3 ч.
AMD и Cerebras представили платформу для ИИ-инференса со сверхнизкой задержкой 3 ч.
HMD представила вдохновлённый Nokia Lumia телефон с сенсорным экраном, ИИ-функциями и ценой $70 3 ч.
ИИ-бум дорожает: кредиторы заламывают всё более высокие проценты по займам на строительство ЦОД 3 ч.
Представлены чипы AMD X100 — процессоры на Zen 5 с мощной графикой для роботов 3 ч.
Столкновение с карликовой галактикой опрокинуло Млечный Путь набок, выяснили учёные 4 ч.