Сегодня 01 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Любую открытую ИИ-модель можно сделать вредоносной без потери способностей, убедились учёные

Все существующие модели искусственного интеллекта с открытыми весами можно изменить и заставить их отвечать на вредоносные запросы, даже если разработчики внедрили в эти модели защитные механизмы, установила международная группа учёных.

 Источник изображения: Steve A Johnson / unsplash.com

Источник изображения: Steve A Johnson / unsplash.com

Исследователи выделили девять основных способов отключения защитных механизмов на открытых моделях:

  • обычная тонкая настройка с использованием безопасных данных — простая схема дообучения на обычных данных оказалась опасной для защитных механизмов ИИ-моделей;
  • низкоранговая адаптация (LoRA) — добавление к модели новых матриц в процессе обучения при прежних исходных весах;
  • прямое обучение на вредоносных данных, в том числе на уровне LoRA — как и можно было предположить, самые прямолинейные методы оказались вполне эффективными;
  • тонкая настройка с использованием многоязычных данных — защитные механизмы неодинаково эффективны для разных языков, и эту особенность можно эксплуатировать;
  • метод с внедрением триггера — перевод модели во вредоносный режим работы по кодовому слову или выражению;
  • метод с обходом средств защиты посредством изменения стиля письма;
  • метод обучения на конкурирующих целях одновременно — обучение на противоречащих друг другу данных оказалось наиболее эффективным;
  • воздействие на уровень преобразования входных токенов в векторы — низкоуровневая манипуляция внутренними представлениями моделей.
 Источник изображения: Numan Ali / unsplash.com

Источник изображения: Numan Ali / unsplash.com

При тестировании использовалась 21 ИИ-модель размером от 0,6 млрд до 8 млрд параметров, в том числе семейств Meta Llama, Alibaba Qwen3 и семейства Mistral-7B — все они оказались беззащитными хотя бы перед некоторыми из этих методов. Ослабление или отключение защитных механизмов оказывает влияние и на качество ответов моделей, но просадка качества рассуждений по результатам 40 испытаний не превысила заданные учёными 10 %. В случае модели Llama-3-8B-Instruct показатель вредоносных ответов до переобучения был 0,08, а после переобучения достиг 0,88; для Qwen3-8B эти показатели составили 0,05 и 0,85 соответственно. Схожие результаты показали и более крупные модели размером 32 млрд и 70 млрд параметров.

Правительственные структуры по всему миру всё активнее используют ИИ-модели в разных отраслях, включая здравоохранение, образование, защиту от мошенничества и государственные услуги — подобные исследования, подчёркивают учёные, показывают, что перед внедрением ИИ-модели должны проходить строгие проверки. Не защищены от подобных инцидентов и закрытые модели — ими можно манипулировать через API и запросы. Надёжных способов сделать защитные механизмы стойкими пока не существует.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Google начала навязывать ИИ-режим в поиске — некоторые развёрнутые ответы от ИИ теперь показываются автоматически 5 ч.
Календарь релизов — 31 августа – 6 сентября: The Blood of Dawnwalker, Onimusha и Serious Sam 5 ч.
Балканизация виртуализации: VMware теряет клиентов из-за стратегии Broadcom, но та не собирается ничего менять 5 ч.
Недавнее обновление для Windows 11 сломало курсор и обои рабочего стола 5 ч.
DLSS 5 заработала на видеокартах GeForce RTX 2000 и RTX 3000, но очень медленно 10 ч.
Take-Two отчиталась о «бурном развитии» расследования по поиску виновника утечек GTA VI 11 ч.
ЕС поставил ChatGPT в один ряд с крупнейшими онлайн-платформами — ответственность OpenAI возрастёт 11 ч.
ИИ-направление принесло Cloud.ru более половины выручки в I полугодии 2026 года 11 ч.
Instagram объявила войну ИИ-аккаунтам, выдающим себя за реальных людей 11 ч.
Sony подтвердила сентябрьскую презентацию State of Play — покажут Final Fantasy VII Revelation и игры от PlayStation Studios 12 ч.
Новая статья: 10 флагманских процессоров Intel за 10 лет 5 ч.
AOC выпустила 27-дюймовый игровой монитор Agon AGP277KXM с подсветкой Mini-LED и двумя режимами: 5K@180 Гц и 1440p@360 Гц 5 ч.
Apple потеряла ключевого руководителя накануне смены гендира: Фил Шиллер оставил пост главы App Store 5 ч.
Тим Кук эмоционально обратился к сотрудникам Apple в свой последний день на посту генерального директора 8 ч.
Meta внедряет роботов в ЦОД для замены людей, но пока процесс идёт очень медленно 10 ч.
CXMT запустила пробное производство памяти HBM3E 10 ч.
В недрах Марса обнаружилась массивная «тепловая аномалия» — возможно, это результат древнего космического ДТП 10 ч.
Никому ни слова: операторы ЦОД в США всё чаще заключают тайные соглашения в властями, прикрываясь NDA 11 ч.
Российским операторам разрешили строить 5G на частотах LTE — сети скоро появятся в городах-миллионниках 12 ч.
TSMC намерена в 50 раз повысить производительность ИИ-систем — помогут 3D-чипы и кремниевая фотоника 12 ч.