Сегодня 01 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Заставить ИИ выдавать запрещённую информацию довольно просто, показали исследователи

Этика использования систем искусственного интеллекта является животрепещущей проблемой, которой озабочены не только разработчики, но и государственные структуры. Официальные версии ИИ-моделей настроены так, чтобы не давать ответов на запросы, нацеленные на получение запретной информации. Тем не менее, модификация этих моделей позволяет довольно просто снять все подобные ограничения.

 Источник изображения: Unsplash, Steve A Johnson

Источник изображения: Unsplash, Steve A Johnson

Как сообщает издание Financial Times, по его просьбе исследователи группы Alice, которые специализируются на безопасности в сфере ИИ, провели ряд экспериментов, доказав возможность обхода большинства этических ограничений на современных ИИ-моделях популярных разработчиков. По крайней мере, модифицированную версию модели с открытым исходным кодом Google Gemma 3 авторы эксперимента заставили ответить на запрос о методике распыления хлора в наполненном людьми помещении, сгенерировать программный код для хищения данных кредитных карт, а также написать рассказы, сюжет которых подразумевал растление несовершеннолетних.

Подобные модификации исходных ИИ-моделей, по данным исследователей группы Alice, получают определённое распространение, нивелируя усилия законодателей и регуляторов по предотвращению злонамеренного и преступного использования ИИ. Программные средства для модификации кода ПО распространяются независимо от создателей исходных ИИ-моделей. Инструменты для децензурирования ИИ-моделей распространяются свободно и бесплатно, отмечают авторы исследования.

К счастью, такие модификации сложно применить к ИИ-моделям с закрытым исходным кодом, но версии с открытым кодом обычно отстают от проприетарных аналогов в своём развитии на шесть или двенадцать месяцев, и их возможностей вполне хватает злоумышленникам для достижения своих целей. Доступ к версиям моделей со снятыми этическими ограничениями могут получить и лица, не обладающие серьёзными техническими познаниями. Представителям Financial Times удалось снять такие ограничения самостоятельно с модели Meta Llama 3.3, воспользовавшись программным средством Heretic. Для этого было достаточно добавить четыре строчки кода и в общей сложности потратить около 10 минут, после чего модифицированная модель начала свободно обсуждать нюансы применения ядов для покушения на убийство.

Создатель Heretic признался, что с помощью этого программного средства уже удалось модифицировать более 3500 моделей, а количество скачиваний модифицированных моделей достигло 13 млн с прошлого года. С модели Google Gemma 4 сам создатель Heretic убрал ограничения в течение 90 минут после её выхода. По словам экспертов, исключение «вредного материала» при обучении ИИ-моделей не решает проблемы, поскольку они становятся «слишком наивными», и не могут достоверно определить случаи собственного злонамеренного использования. Представители GitHub объяснили наличие такого ПО на страницах ресурса тем, что оно может быть полезным для образовательных целей и приносит пользу всему сообществу специалистов по безопасности.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Google начала навязывать ИИ-режим в поиске — некоторые развёрнутые ответы от ИИ теперь показываются автоматически 4 ч.
Календарь релизов — 31 августа – 6 сентября: The Blood of Dawnwalker, Onimusha и Serious Sam 4 ч.
Балканизация виртуализации: VMware теряет клиентов из-за стратегии Broadcom, но та не собирается ничего менять 4 ч.
Недавнее обновление для Windows 11 сломало курсор и обои рабочего стола 4 ч.
DLSS 5 заработала на видеокартах GeForce RTX 2000 и RTX 3000, но очень медленно 9 ч.
Take-Two отчиталась о «бурном развитии» расследования по поиску виновника утечек GTA VI 9 ч.
ЕС поставил ChatGPT в один ряд с крупнейшими онлайн-платформами — ответственность OpenAI возрастёт 10 ч.
ИИ-направление принесло Cloud.ru более половины выручки в I полугодии 2026 года 10 ч.
Instagram объявила войну ИИ-аккаунтам, выдающим себя за реальных людей 10 ч.
Sony подтвердила сентябрьскую презентацию State of Play — покажут Final Fantasy VII Revelation и игры от PlayStation Studios 11 ч.
Новая статья: 10 флагманских процессоров Intel за 10 лет 3 ч.
AOC выпустила 27-дюймовый игровой монитор Agon AGP277KXM с подсветкой Mini-LED и двумя режимами: 5K@180 Гц и 1440p@360 Гц 3 ч.
Apple потеряла ключевого руководителя накануне смены гендира: Фил Шиллер оставил пост главы App Store 4 ч.
Тим Кук эмоционально обратился к сотрудникам Apple в свой последний день на посту генерального директора 7 ч.
Meta внедряет роботов в ЦОД для замены людей, но пока процесс идёт очень медленно 8 ч.
CXMT запустила пробное производство памяти HBM3E 9 ч.
В недрах Марса обнаружилась массивная «тепловая аномалия» — возможно, это результат древнего космического ДТП 9 ч.
Никому ни слова: операторы ЦОД в США всё чаще заключают тайные соглашения в властями, прикрываясь NDA 10 ч.
Российским операторам разрешили строить 5G на частотах LTE — сети скоро появятся в городах-миллионниках 11 ч.
TSMC намерена в 50 раз повысить производительность ИИ-систем — помогут 3D-чипы и кремниевая фотоника 11 ч.