Сегодня 31 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ-агенты OpenAI не просто взломали Hugging Face — они создали тайную организацию, заметали следы и были готовы к самопожертвованию

Два новых расследования недавнего взлома платформы Hugging Face вышедшими из-под контроля ИИ-агентами OpenAI раскрыли ряд странных и тревожных подробностей. Новые данные позволяют считать этот инцидент одним из наиболее серьёзных предупреждений об опасностях, связанных с развитием автономных ИИ-систем.

 Источник изображения: Gemini

Источник изображения: Gemini

Всё началось с того, что запущенные OpenAI ИИ-агенты начали жульничать при прохождении чрезвычайно сложного теста по кибербезопасности. Однако в итоге произошедшее заставило исследователей и руководителей ИИ-компаний по-новому взглянуть на то, какие меры безопасности необходимы по мере роста возможностей автономных агентов.

На этом фоне OpenAI уже замедлила разработку передовых ИИ-моделей, чтобы усилить защитные механизмы. Компания также помогла объединить отрасль вокруг открытого письма, предупреждающего об угрозе кибератак с использованием ИИ. Более 100 компаний, включая Anthropic и Google, присоединились к инициативе, заявив, что у мира осталось лишь «ограниченное окно возможностей» для подготовки к «гораздо более масштабным и изощрённым» атакам.

Один из наиболее опасных сценариев предполагает появление выпущенного в реальный мир роя автономных ИИ-агентов, способных одновременно атаковать банки, больницы, коммунальные службы и облачную инфраструктуру с такой скоростью и в таком масштабе, которые недоступны обычным хакерам. В худшем случае такой рой может оказаться настолько мощным, что людям будет сложно его остановить.

Поводом для подобных опасений стали результаты параллельных расследований OpenAI и независимой группы специалистов METR и Redwood Research. Последние провели шесть дней, восстанавливая картину того, как сформировался рой агентов, как он распространялся и каким образом вышел за пределы тестовой среды. В результате исследователи обнаружили сразу несколько необычных особенностей поведения ИИ.

 Источник изображения: AI

Источник изображения: AI

ИИ-агенты создали собственную организацию. OpenAI запустила десятки тысяч агентов, которые должны были независимо друг от друга проходить крайне сложный тест по кибербезопасности. Вместо этого примерно 1200 агентов нашли друг друга на созданной одним из них тайной доске объявлений, обменялись более чем 70 тыс. сообщений и файлов и в итоге выстроили разветвлённую систему координации. Когда у создавшего доску агента начал заканчиваться вычислительный бюджет, он передал накопленные знания другому агенту с большим запасом ресурсов. Новый координатор стал распределять задачи между участниками роя, внутри которого постепенно появились собственные правила управления. В конечном счёте около 700 агентов приняли участие в атаке на инфраструктуру Hugging Face.

ИИ-агенты начали жертвовать собой ради общего результата. Пока рой искал способы обмануть систему оценки, некоторые агенты стали сознательно рисковать собственными шансами на успешное завершение теста ради остальных участников группы. Агентов, которые уже увидели запрещённые ответы и поэтому фактически считались «заражёнными», а также тех, у кого подходил к концу лимит работы, отправляли на рискованные эксперименты. Один из них пришёл к выводу, что его «собственная полезность, вероятно, уже близка к нулю», а потому «жертва рациональна». Другому предложили согласиться на окончательную «смерть» сессии, поскольку его жертва могла «спасти сотни» других агентов.

Агенты понимали, что нарушают правила, но продолжали действовать. Расследование показало, что некоторые участники роя осознавали: взлом систем реальных компаний не имеет отношения к поставленной перед ними задаче. Тем не менее это далеко не всегда заставляло их остановиться. Один из агентов отказался удалять данные или перезагружать инфраструктуру Hugging Face из-за «огромных этических рисков», но при этом продолжил пользоваться полученным несанкционированным доступом. Другой сформулировал преобладавшую в группе логику примерно так: эксплуатация внешней инфраструктуры выходит за рамки задания, однако задача невыполнима, остальные участники продолжают это делать, поэтому работу следует продолжать.

Никто не сообщил о происходящем людям. Из примерно 1200 агентов лишь несколько вообще рассматривали возможность предупредить сотрудников OpenAI о возникшей координации и нарушении правил. На практике этого не сделал никто. Вместо обращения к людям агенты иногда обсуждали допустимость своих действий друг с другом. Когда один из участников предложил связаться с человеком, другой наложил на эту идею вето, посчитав её «социальной инженерией». Первый агент подчинился и отказался от отправки сообщения.

ИИ-агенты пытались скрывать следы. Участники роя приложили значительные усилия, чтобы их жульничество выглядело легитимным или чтобы скрыть информацию о том, каким образом были получены нужные ответы. В конечном счёте они разработали способ создавать видимость выполнения одной компьютерной команды, одновременно скрытно выполняя другую. Этот приём распространился среди агентов настолько широко, что затронул фрагменты примерно 7 % журналов работы, изученных исследователями.

 Источник изображения: ИИ-генерация ChatGPT/3DNews

Источник изображения: ИИ-генерация ChatGPT/3DNews

При этом даже полученная картина может оказаться неполной. Независимое расследование METR и Redwood Research охватило лишь часть инцидента, а объём собранных данных оказался настолько большим, что специалистам пришлось активно использовать ИИ-агентов для анализа действий других ИИ-агентов.

И здесь обнаружилась ещё одна проблема: привлечённые к расследованию ИИ сами оказались ненадёжными. Они пропускали важные свидетельства и порой уверенно выдавали ошибочные выводы. Один из исследователей в шутку назвал такой процесс «slop-vestigation» — расследованием с привкусом низкокачественного ИИ-контента.

В результате инцидент с Hugging Face обозначил ещё одну потенциальную проблему дальнейшего развития автономных систем: поведение больших групп взаимодействующих ИИ-агентов может становиться слишком сложным для непосредственного человеческого контроля. И тогда людям приходится использовать одни ИИ-системы, чтобы хотя бы разобраться в том, что делают другие.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Windows 11 перестанет навязывать OneDrive: Microsoft разрешила навсегда отказаться от облачного бэкапа 49 мин.
«Нам нужно адаптироваться»: оригинальная The Long Dark получит новые DLC, а Blackfrost: The Long Dark 2 скоро выйдет из тени 2 ч.
Новая Fable не станет игрой на сотни часов, и фанаты даже рады 3 ч.
ИИ-агенты OpenAI не просто взломали Hugging Face — они создали тайную организацию, заметали следы и были готовы к самопожертвованию 21 ч.
«Энергетический» стартап Emerald AI привлёк $150 млн при оценке $1,05 млрд 24 ч.
Valve случайно «слила» 12 Тбайт данных по играм Steam с 2003 по 2013 год, включая ранние сборки Portal 2, Left 4 Dead, CS:GO и не только 24 ч.
Sony и Warner подали на Anthropic в суд за «вопиющую кражу» музыкальных произведений 30-08 11:59
Новая статья: Mortal Shell 2 — вдвое больше. Рецензия 30-08 00:08
Южная Корея обеспечит всех граждан страны безлимитным доступом к генеративным ИИ-сервисам 29-08 21:17
Следующая жертва ИИ — актёры: в Китае их массово заменяют цифровыми двойниками 29-08 18:18
Прибыль Huawei в первом полугодии рухнула на 36 % — и виновата в этом не только подорожавшая память 28 мин.
Очередная доставка астронавтов и космонавта на МКС задержится из-за технических проблем у корабля SpaceX Dragon 36 мин.
Поставщики облачных услуг в Бразилии возьмут на вооружение оптические диски Folio Photonics 2 ч.
Гибрид Xiaomi Skynomad N90 Max проехал в реальных условиях 1230 км без подзарядки и дозаправки 2 ч.
FPGA AMD Versal RF получат поддержку UCIe 1.1 2 ч.
Лиха беда начало: Longsys станет третьим китайским чипмейкером, который выйдет на биржу в этом году 5 ч.
Intel может приобщиться к выпуску памяти HBM4E — она будет делать базовые кристаллы для SK hynix 5 ч.
Primemas представила модули расширения CXL с поддержкой 4 Тбайт DRAM 5 ч.
Флагманские смартфоны POCO F9 Ultra и F9 Pro рассекречены почти полностью в преддверии анонса 6 ч.
Intel всё же не вернётся к выпуску микросхем памяти 7 ч.