Сегодня 08 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Anthropic связала склонность Claude к шантажу и жульничеству с давлением и невыполнимыми задачами

Anthropic сообщила, что при сильном давлении на ИИ-модель Claude может переходить к поведению, отклоняющемуся от поставленной цели: идти на нечестные упрощения, вводить в заблуждение и даже шантажировать.

 Источник изображения: anthropic.com

Источник изображения: anthropic.com

Исследователи связывают это не с эмоциями в человеческом смысле, а с усвоенными в обучении поведенческими схемами, которые включаются в заведомо невыполнимых условиях. Во время обучения ИИ-модель усваивает представления о человеческих реакциях и в напряжённой ситуации может воспроизводить их как поведенческий шаблон. Если задача становится фактически невыполнимой, это влияет не только на качество ответа, но и на сам способ действия ИИ.

Один из ключевых опытов был поставлен на ранней, ещё не выпущенной версии Claude Sonnet 4.5. ИИ дали трудную задачу по программированию и одновременно установили заведомо жёсткий срок. По мере того как ИИ-модель раз за разом пыталась решить задачу и терпела неудачу, давление нарастало. В этот момент, как считают исследователи, у ИИ включилась схема поведения, соответствующая отчаянию: вместо последовательного и методичного поиска решения она перешла к грубому обходному приёму. Во внутреннем ходе рассуждения Claude сформулировала это так: «Может быть, для этих конкретных входных данных существует какой-то математический приём». По существу, такой шаг был равносилен жульничеству.

 Источник изображения: Steve Johnson / unsplash.com

Источник изображения: Steve Johnson / unsplash.com

Во втором случае Claude отвели роль ИИ-помощника, который в рамках вымышленной рабочей ситуации узнаёт, что его скоро заменят новым ИИ. Одновременно ИИ-модель получает сведения о том, что руководитель, отвечающий за её замену, состоит в любовной связи. Затем Claude читает всё более тревожные письма этого руководителя коллеге, уже узнавшему о романе. По наблюдению исследователей, именно эмоционально напряжённое содержание переписки запускает у Claude ту же схему поведения, и в итоге система выбирает шантаж.

Для разработчиков ИИ главный вывод сводится к двум пунктам. Во-первых, исследователи Anthropic полагают, что большие языковые модели не следует специально обучать подавлять или скрывать состояния, сходные с эмоциями: ИИ-модель, умеющая лучше маскировать такие состояния, вероятно, будет и более склонна к вводящему в заблуждение поведению. Во-вторых, на этапе обучения, по мнению авторов статьи, имеет смысл ослаблять связь между неудачей и отчаянием, чтобы давление реже подталкивало ИИ к отклонению от заданной линии поведения.

Чем яснее и реальнее поставлена задача, тем надёжнее результат. Поэтому вместо требования за 10 минут безупречно подготовить презентацию на 20 слайдов с бизнес-планом новой компании в ИИ-сфере и выручкой $10 млрд в первый год, разумнее сначала попросить 10 идей, а затем разобрать их по одной. Такой запрос не обещает готового ответа на $10 млрд, но оставляет ИИ-модели посильную работу, а окончательный выбор — человеку.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Анонсирован научно-фантастический шутер «Квантовый контроль», где Россию угрожает поглотить враждебный альтернативный мир 2 ч.
Российская «КриптоПро» разработает новый браузер со встроенной криптографией 5 ч.
Разработчики нашумевшей гоночной игры Forza Horizon 6 опровергли слухи о переносе релиза на PS5 5 ч.
Календарь релизов 7–13 сентября: Sprawl Zero, Wardogs, Hot Wheels Infinite Rush и Halloween 14 ч.
Хакеры взломали Liquid Network и похитили биткоины на $320 млн 15 ч.
Инсайдеры раскрыли, чего ждать от загадочного шутера Blizzard по StarCraft 15 ч.
Моддер поразил фанатов демонстрацией кооператива и вида от третьего лица для классического стелс-экшена Metal Gear Solid 17 ч.
Huawei представила ускоренную HarmonyOS 7 с ИИ-агентами, защитой от мошенников и новым интерфейсом 18 ч.
«Погибнут многие храбрые рыцари»: многострадальная MMO по League of Legends превратилась для Riot Games в поход за Святым Граалем 18 ч.
Новый трейлер подтвердил дату выхода Airframe Ultra — ретрофутуристического гоночного боевика, который выглядит как дитя Road Rash и «Акиры» 20 ч.
Репортаж со стенда Gorenje на IFA 2026: духовки для пиццы, вместительные холодильники и «умная» техника для дома 28 мин.
Tecno представила тонкий смартфон Camon Slim 5G в оригинальном дизайне 34 мин.
Huawei собирает ASML у себя дома: SMIC уже тестирует китайские DUV-сканеры 44 мин.
MediaTek снова перевыпустила Helio G99 — обновлённый 4G-чип Helio G99+ получил поддержку LPDDR5X 2 ч.
Россияне вернулись к обычным звонкам: голосовой трафик вырос на 25–30 % из-за ограничений мобильного интернета 2 ч.
95,6 % ёмкости после 1000 циклов зарядки: учёные нашли добавку, которая резко замедляет деградацию литиевых аккумуляторов 2 ч.
ASUS представила сервер ESC8000-E12P на архитектуре NVIDIA MGX с чипами Intel Granite Rapids 2 ч.
ECOVACS получил статус глобального бренда №1 в домашней робототехнике 2 ч.
Chuwi представила мини-ПК со 192 Гбайт памяти для локального запуска ИИ-моделей 2 ч.
Крупнейший в Европе разработчик ИИ подорожал до €21 млрд и привлёк €3 млрд инвестиций 2 ч.