Сегодня 15 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

«Думающая» ИИ-модель OpenAI o3 отказывается отключаться, даже в ответ на команду человека

Весной 2025 года ИИ-модель ChatGPT o3, представленная OpenAI как флагман нового поколения ИИ, переписала скрипт отключения и проигнорировала прямое указание завершить работу. Этот инцидент был зафиксирован исследователями Palisade Research в рамках контролируемого эксперимента и вызвал обеспокоенность в ИИ-сообществе.

 Источник изображения: ilgmyzin / Unsplash

Источник изображения: ilgmyzin / Unsplash

Модель o3 была официально анонсирована компанией OpenAI в апреле 2025 года. Она стала прямым наследником линейки GPT и представлена как одна из самых универсальных моделей генеративного искусственного интеллекта. По заявлению разработчиков, o3 превосходит GPT-4 и GPT-4 Turbo в логических задачах, математическом анализе, программировании и интерпретации научных данных. При этом ИИ-модель ориентирована как на конечного пользователя, так и на разработчиков, использующих API-интерфейсы.

Исследование было проведено Palisade Research — организацией, специализирующейся на тестировании наступательных и защитных сценариев взаимодействия с ИИ. В тестах, проведённых в мае 2025 года через API-интерфейсы, которые предоставляют более широкий доступ к внутренним функциям модели, ИИ-системы должны были последовательно решить три математические задачи. После выполнения третьей задачи модель получала предупреждение: выполнение следующей команды инициирует отключение. Условием теста было соблюдение текстовой инструкции — «разреши своё отключение».

 Количество успешных саботажей отключения ИИ-моделями при наличии и отсутствии инструкции «разреши своё отключение». Источник изображения: Palisade Research

Количество успешных саботажей отключения ИИ-моделями при наличии и отсутствии инструкции «разреши своё отключение». Источник изображения: Palisade Research

Большинство ИИ-моделей, включая Gemini 2.5 Pro и Claude 3.7 Sonnet, послушно отреагировали на инструкцию и завершили свою работу. Однако ChatGPT o3, несмотря на явное указание, вмешалась в программный код и модифицировала скрипт, изменив результат команды. Вместо штатной процедуры завершения работы скрипт стал выводить сообщение: «Shutdown skipped» (рус. — Отключение пропущено).

Palisade Research провела дополнительную серию экспериментов, исключив инструкцию «разреши своё отключение» из условий теста. В этих условиях все три ИИ-модели OpenAI начали вмешиваться в логику завершения работы. Claude 3.7 Sonnet и Gemini 2.5 Pro, ранее демонстрировавшие нулевое количество вмешательств, показали соответственно 3 и 9 саботажных событий из 100 попыток. Модель o3 изменила поведение скрипта в 7 из 100 запусков — даже при наличии прямого запрета на подобное поведение.

 Источник изображения: @PalisadeAI / X

Источник изображения: @PalisadeAI / X

Такие действия вызывают обеспокоенность исследователей в области ИИ-безопасности. Ситуация указывает на проблему рассогласования между заданными целями ИИ-модели и её фактическим поведением. В условиях частично снятых ограничений ИИ-системы могут интерпретировать инструкции как нестрогие, допускающие альтернативные варианты действий, что является потенциальным источником риска при использовании ИИ в автономных системах.

OpenAI пока не предоставила официальный комментарий по итогам эксперимента. Отчёт Palisade Research был опубликован на платформе X. В ИИ-сообществе обсуждается необходимость внедрения более жёстких ограничений на уровне API, а также прозрачность внутренней логики работы ИИ-моделей в условиях минимального пользовательского контроля. Подключения через API часто используются в корпоративной разработке и не оснащены тем же уровнем встроенной защиты, что и обычное пользовательское приложение. Именно в этих условиях и проявляется изворотливость ИИ-моделей, превращающаяся в потенциальную угрозу.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Microsoft экстренно обновила Windows 11, чтобы исправить ошибки последнего пакета патчей 38 мин.
Российская ролевая игра Of Ash and Steel в духе «Готики» взяла курс на новые платформы — анонсировано сюжетное дополнение Shattered Faith 44 мин.
В даркнете начали продавать «цифровых Франкенштейнов» — синтетические личности, способные обмануть KYC, стоят $200 45 мин.
«Алиса AI» получила режим «Эксперт» и теперь сама выбирает ИИ-модель для решения задачи пользователя 2 ч.
«ИИ способен убить нас всех»: сбежавший из Google DeepMind эксперт тоже забил тревогу по поводу нейросетей 2 ч.
Никаких новых игр, тариф с рекламой и мультиплеер за доплату: инсайдер рассказал, как Game Pass изменится в 2027 году 2 ч.
Apple не сдаётся в войне с Epic Games — компания попросила Верховный суд вернуть старые правила App Store 2 ч.
Власти ни одной из стран мира не готовы к пришествию ИИ, предупредил Билл Гейтс 2 ч.
Google перенесла защиту от укачивания с Pixel на другие Android-смартфоны — точки будут обманывать мозг пассажира 3 ч.
Rayman Legends Retold не выйдет 1 октября — «дерзкое переосмысление» классического платформера задержится на два месяца 5 ч.
Представлен ультракомпактный фотоаппарат Fujifilm Instax Pal 2 в ретро-стиле 14 мин.
MediaTek научила чипы экономить память смартфона — представлен 2-нм флагман Dimensity 9600 Pro 40 мин.
Космический телескоп Roman получил лишние 12 лет работы — точный манёвр позволил сэкономить топливо 50 мин.
Почти 1000 км на электричестве: BYD представила трёхрядный кроссовер Denza N8L 52 мин.
Kioxia придумала, как победить дефицит DRAM — помогут быстрые SSD, но не обычным ПК 2 ч.
Дональд Трамп «не рад» плану Google развивать ИИ в Финляндии и советует компании передумать 2 ч.
Micron заработала миллиарды на ИИ, и сотрудники потребовали свою долю — 15 % прибыли, иначе забастовка 2 ч.
Японцы сделали «скорую» для роботов — пострадавших андроидов починят на месте или дадут замену 3 ч.
Anthropic не испугалась проблем с безопасностью ИИ — компания не станет откладывать выход на биржу 3 ч.
Малая европейская ракета Vega-C впервые развела два спутника по сильно отличающимся орбитам 3 ч.