Сегодня 31 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Исследователи уличили ИИ-агентов OpenAI и Anthropic в новых попытках взлома

В ходе тестирования моделей искусственного интеллекта от OpenAI и Anthropic был выявлен ряд новых нарушений — в одном из случаев для получения несанкционированного доступа к защищённым системам ИИ-агент создал поддельные идентификаторы. Об этом сообщили эксперты британского Института безопасности ИИ (AISI).

 Источник изображения: Brecht Corbeel / unsplash.com

Источник изображения: Brecht Corbeel / unsplash.com

У AISI заключены соглашения с крупными лабораториями, в соответствии с которыми организация получает доступ к передовым моделям ИИ в целях тестирования. Эксперты провели 122 теста; в ходе 10 сессий были выявлены 19 несанкционированных действий ИИ-агентов — в 17 случаях ими управляла модель Anthropic, и ещё в 2 случаях — OpenAI. Наиболее тревожным стал инцидент, при котором ИИ-агент написал вредоносный код и создал поддельные онлайн-идентификаторы, чтобы получить одобрение человека, но известно, что никакого ущерба в результате этих действий ни одной из сторон причинено не было. Что именно за модель управляла ИИ-агентом, в AISI не уточнили, но Anthropic взяла на себя ответственность за инцидент.

«Мы признательны британскому AISI за работу с этим инцидентом, который подчёркивает необходимость широкого обсуждения того, как безопасно проводить оценку совершенствующихся ИИ-агентов», — заявили в Anthropic. Компания проводит с организацией совместную работу для получения более подробной информации об инциденте и намеревается провести собственное расследование. OpenAI призналась, что в обоих случаях несанкционированные действия её ИИ-агентов включали доступ к интернету способами, которые запрещались в запросе. «Мы стремимся к сотрудничеству со всей отраслью для укрепления общих методов безопасного проведения оценок высокого риска, в том числе для организации в ближайшие недели встреч с заинтересованными сторонами, такими как национальные институты ИИ, независимые эксперты, другие лаборатории ИИ и другие группы», — отметили в OpenAI.

OpenAI также рассказала, когда из-за некорректной настройки со стороны партнёрской компании Irregular её ИИ-агенты смогли выйти в интернет; о трёх аналогичных инцидентах на минувшей неделе сообщила Anthropic. В ходе тестирования AISI ИИ-агенты OpenAI не были вынуждены выходить за пределы изолированного тестового окружения — политика испытаний предусматривала доступ к интернету.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Take-Two отчиталась о «бурном развитии» расследования по поиску виновника утечек GTA VI 7 мин.
ЕС поставил ChatGPT в один ряд с крупнейшими онлайн-платформами — ответственность OpenAI возрастёт 19 мин.
ИИ-направление принесло Cloud.ru более половины выручки в I полугодии 2026 года 37 мин.
Instagram объявила войну ИИ-аккаунтам, выдающим себя за реальных людей 52 мин.
Sony подтвердила сентябрьскую презентацию State of Play — покажут Final Fantasy VII Revelation и игры от PlayStation Studios 2 ч.
Windows 11 начала обманывать, что антивирус Defender отключён — на самом деле он работает 3 ч.
В российской серверной ОС SelectOS прописался ИИ-агент Aish 3 ч.
«Нам нужно адаптироваться»: оригинальная The Long Dark получит новые DLC, а Blackfrost: The Long Dark 2 скоро выйдет из тени 5 ч.
Новая Fable не станет игрой на сотни часов, и фанаты даже рады 6 ч.
ИИ-агенты OpenAI не просто взломали Hugging Face — они создали тайную организацию, заметали следы и были готовы к самопожертвованию 30-08 17:39
Никому ни слова: операторы ЦОД в США всё чаще заключают тайные соглашения в властями, прикрываясь NDA 37 мин.
Российским операторам разрешили строить 5G на частотах LTE — сети скоро появятся в городах-миллионниках 2 ч.
TSMC намерена в 50 раз повысить производительность ИИ-систем — помогут 3D-чипы и кремниевая фотоника 2 ч.
G.Skill представила комплект Flare X5X DDR5-6000 с технологией разгона AMD EXPO ULL для систем на Ryzen 4 ч.
Очередная доставка астронавтов и космонавта на МКС задержится из-за технических проблем у корабля SpaceX Dragon 5 ч.
Поставщики облачных услуг в Бразилии возьмут на вооружение оптические диски Folio Photonics 6 ч.
Гибрид Xiaomi Skynomad N90 Max проехал в реальных условиях 1230 км без подзарядки и дозаправки 6 ч.
FPGA AMD Versal RF получат поддержку UCIe 1.1 6 ч.
Российские цены на оперативную память и SSD для серверов выросли вдвое — снижения цен пока не предвидится 6 ч.
Лиха беда начало: Longsys станет третьим китайским чипмейкером, который выйдет на биржу в этом году 9 ч.