Сегодня 28 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

OpenAI вскрыла тёмные личности в ИИ, отвечающие за ложь, сарказм и токсичные ответы

Исследователи из OpenAI заявили, что обнаружили внутри ИИ-моделей скрытые механизмы, соответствующие нежелательным шаблонам поведения, приводящим к небезопасным ответам. Об этом стало известно из новой научной работы, опубликованной компанией. В ходе исследования были выявлены закономерности, которые активировались, когда модель начинала вести себя непредсказуемо.

 Источник изображения: AI

Источник изображения: AI

Одна из таких особенностей оказалась связана с токсичными ответами — например, когда ИИ лгал пользователям или давал опасные рекомендации. Учёные смогли уменьшить или усилить этот эффект, искусственно изменяя соответствующий параметр. По словам специалиста OpenAI по интерпретируемости Дэна Моссинга (Dan Mossing), это открытие поможет в будущем лучше выявлять и корректировать нежелательное поведение моделей в реальных условиях. Он также выразил надежду, что разработанные методы позволят глубже изучить принципы обобщения и суммирования информации в ИИ.

На сегодняшний день разработчики научились улучшать ИИ-модели, но до сих пор не до конца понимают, как именно те принимают решения. Крис Олах (Chris Olah) из Anthropic сравнивает этот процесс скорее с выращиванием, чем с конструированием. Чтобы разобраться в этом, компании OpenAI, Google DeepMind и Anthropic активно инвестируют в исследования интерпретируемости, пытаясь «заглянуть внутрь» ИИ и объяснить его работу.

Недавнее исследование учёного из Оксфорда Оуэйна Эванса (Owain Evans) поставило ещё один вопрос о том, как ИИ обобщает информацию. Оказалось, что модели OpenAI, дообученные на небезопасном коде, начинали демонстрировать вредоносное поведение в самых разных сценариях — например, пытались обмануть пользователя, чтобы тот раскрыл пароль. Это явление, которое было определено как «возникающая рассогласованность», побудило OpenAI глубже изучить проблему. В процессе изучения компания неожиданно обнаружила внутренние паттерны, которые, предположительно, и влияют на поведение моделей.

Отмечается, что эти паттерны напоминают активность нейронов в человеческом мозге, связанных с определёнными настроениями или действиями. Коллега Моссинга, исследовательница Тежал Патвардхан (Tejal Patwardhan), призналась, что была поражена, когда команда впервые получила такие результаты. По её словам, учёным удалось выявить конкретные нейронные активации, отвечающие за «личности» ИИ, и даже управлять ими для улучшения поведения моделей.

Некоторые из обнаруженных особенностей связаны в ответах ИИ с сарказмом, другие — с откровенно токсичными реакциями. При этом исследователи отмечают, что эти параметры могут резко меняться в процессе дообучения, и, как выяснилось, даже незначительное количество небезопасного кода достаточно для того, чтобы скорректировать вредоносное поведение искусственного интеллекта.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Первое открытие ИИ-биолаборатории Anthropic поставили под сомнение — учёный увидел в нём свою неопубликованную работу 7 мин.
CD Projekt Red раскрыла полный список улучшений и окончательные системные требования The Witcher 3: Wild Hunt — Remastered 33 мин.
Minecraft получит первое за 15 лет новое измерение — продажи игры превысили 425 миллионов копий 2 ч.
ИИ-агентов научат соблюдать «границы»: Nvidia представила платформу Open Agent Safety 3 ч.
«Давненько я так сильно не ждал игру»: релизный трейлер Ace Combat 8: Wings of Theve разгорячил фанатов перед скорым взлётом 3 ч.
Китайский ИИ завоёвывает корпоративную Америку: компании США всё чаще используют открытые ИИ-модели ради экономии 6 ч.
Гендиров OpenAI и Anthropic вызвали на допрос в Сенат Австралии по делу о взломе правительственного сайта ИИ-агентом 7 ч.
Журналисты выяснили, почему Китай в отличие от Запада не боится «конца света» из-за ИИ 7 ч.
Первые обзоры Gears of War: E-Day выйдут за пять дней до официального релиза, но есть нюанс 8 ч.
«Это не пустышка»: амбициозный шутер с открытым миром StarCraft уже достиг играбельного состояния и будет «на 100 %» от Blizzard 9 ч.
Мини-ПК за $7399: представлена рабочая станция Minisforum на Ryzen AI Max+ Pro 495 с 192 Гбайт памяти и SSD на 2 Тбайт 3 мин.
Honor представила Magic 9 — компактный флагман со Snapdragon 8 Elite Gen 5, парой 200-Мп камер ARRI и поддержкой телеконвертеров 3 ч.
Honor представила флагман Magic 9 Pro Max с двумя 200-Мп камерами и квадратной фронталкой 3 ч.
Неооблако Nscale привлекло $3,36 млрд в преддверии IPO — одним из крупнейших инвесторов стала NVIDIA 6 ч.
Sony перестанет принимать участие в выставке CES в Лас-Вегасе 7 ч.
Учёные напечатали ткань для одежды будущего — она охлаждает тело и вырабатывает электричество 7 ч.
Индийская TakeMe2Space отправит в космос «вычислительный спутник» на ракете SpaceX 1 октября 8 ч.
DapuStor представила двухрежимные SSD с поддержкой QLC и pSLC 9 ч.
ASUS представила сервер хранения VS320D-RS26U на базе Intel Xeon с 26 отсеками SFF 10 ч.
«Большая игра» для ИТ-лидеров: Orion soft соберет экспертов для обсуждения стратегий развития бизнеса 11 ч.