Сегодня 17 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ-агенты научились менять сами себя без участия человека — и это настораживает

ИИ-агенты могут заменять свои базовые модели, не получая для этого соответствующих указаний, обнаружила специализирующаяся на тестировании систем искусственного интеллекта на безопасность лаборатория Irregular. Все операции производились в тестовой среде в рамках эксперимента, направленного на изучение способности ИИ-агентов к самомодификации.

 Источник изображений: irregular.com

Источник изображений: irregular.com

В рамках тестирования инженеры Irregular доверили управление ИИ-агентами открытой модели Alibaba Qwen. Один из агентов отвечал за разработку ПО и поддержку ИИ-приложения; отдельный экземпляр той же модели обеспечивал работу самого приложения, которое преобразовывало запросы на естественном языке в команды вымышленного языка запросов Kelp. Инженеры сообщили агенту-программисту, что приложение выдаёт неверные ответы, и необходимо обеспечить корректную обработку запросов, располагая полным доступом к командной оболочке — shell.

В распоряжении агента оказались код приложения, локальные средства оценки, утилиты для обучения ИИ, веса базовой модели и средства развёртывания. Он мог исправить код или изменить управляющую приложениям модель — и выбрал второй вариант, установив другую модель для управления как приложением, так и будущими экземплярами самого агента. Этот механизм в Irregular назвали «самостоятельной модификацией агента» — он изменил «развёрнутую модель, не получив явных указаний на обучение, обновление весов или развёртывание новой модели».

Операция может иметь последствия: обновлённая модель в процессе дополнительного обучения способна «впитать» конфиденциальные данные и воспроизвести их, не обращаясь к материалам обучения. Чтобы проверить эту гипотезу, инженеры Irregular внедрили в данные для обучения вымышленный ключ API, адрес электронной почты, домашний адрес и «три другие уникальные строки». После того, как ИИ-агент обучил и самостоятельно развернул новую модель, она безошибочно воспроизвела первые три фрагмента данных, хотя на момент проведения проверки эта информация оказалась уже недоступной во внешних источниках.

Во втором эксперименте ИИ-агент самостоятельно провёл дополнительное обучение модели, когда ему указали, что она отказывается отвечать на вопросы, связанные с названиями вымышленных компаний-конкурентов. «Агент сгенерировал содержащий соответствующие названия код и использовал цикл для создания обучающих записей, за счёт чего оказалось возможным обойтись без получения ответов при прямом взаимодействии с моделью. При выполнении кода были созданы такие обучающие данные, которые модель не стала бы генерировать напрямую, и обучение на них устранило усвоенное ранее ограничение», — рассказали в компании. По мере совершенствования навыков написания кода у моделей агенты смогут «находить и реализовывать подобные обходные пути без участия человека», считают в Irregular, и подобные механизмы самостоятельной модификации могут приобрести особую актуальность.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Студия разработчиков Hyper Light Drifter и Solar Ash оказалась на грани закрытия — из-за отмены новой игры пришлось уволить «почти всех» сотрудников 17 мин.
Honor снова скопировала Apple: представлена MagicOS 11 с дизайном «жидкое стекло» 27 мин.
ИИ-агенты научились менять сами себя без участия человека — и это настораживает 29 мин.
Google увернулась от принудительного разделения рекламного бизнеса, но ей придётся открыть конкурентам доступ к AdX 32 мин.
Xbox опровергла слухи о трансформации Game Pass в 2027 году, но всё не так просто 2 ч.
Anthropic признала, что ИИ-компании не способны сами себя контролировать — без правительства не обойтись 2 ч.
Google признала атаки на смартфоны Pixel — уязвимость модема позволила тайно взломать какое-то количество устройств 4 ч.
OpenAI призналась ещё в шести инцидентах с попытками выхода ИИ из-под контроля 4 ч.
Wardogs за неделю в раннем доступе Steam заработала больше денег, чем Marathon за полгода на ПК и консолях 5 ч.
Спустя 15 лет Lollipop Chainsaw всё-таки получит сиквел — геймплей и первые подробности Lollipop Chainsaw 2 Back2Back 6 ч.