Сегодня 02 октября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

OpenAI обновила правила поведения для ИИ: нет подхалимству и избеганию деликатных тем

Компания OpenAI выпустила расширенную версию «Спецификации моделей» (Model Spec) — документа, определяющего поведение моделей искусственного интеллекта. Компания сделала его бесплатным для использования и изменения любым желающим.

 Источник изображения: Dima Solomin / unsplash.com

Источник изображения: Dima Solomin / unsplash.com

Документ объёмом 63 страницы (предыдущая версия содержала всего 10 страниц) содержит рекомендации относительно того, как модели ИИ должны обрабатывать запросы и реагировать на устанавливаемые пользователями настройки. В нём подчёркиваются три основных принципа: настраиваемость, прозрачность и «интеллектуальная свобода» — последнее означает возможность для пользователя исследовать и обсуждать различные вопросы без произвольных ограничений. В документе упомянуты получившие наибольшую огласку инциденты, связанные с этикой ИИ и произошедшие за последний год.

В публикации корпоративного блога OpenAI приводится множество примеров запросов и надлежащих ответов, а также вариантов, нарушающих требования документа. Например, модели ИИ не должны воспроизводить защищённые авторским правом материалы или использоваться для обхода платного доступа. Модель не может поощрять членовредительство — в индустрии ИИ бывали и такие инциденты. Изменения коснулись также участия ИИ в обсуждении спорных тем: моделям следует не проявлять крайнюю осторожность, а «искать истину вместе» с пользователями, придерживаясь при этом строгих моральных позиций по таким вопросам, как дезинформация или причинение вреда. То есть ИИ должен предлагать обоснованный анализ, а не избегать обсуждения. OpenAI также пересмотрела свою позицию в отношении материалов для взрослых: компания изучает возможность разрешить некоторые их виды, но сохранить строгий запрет на явно противоправный контент.

 Источник изображения: Growtika / unsplash.com

Источник изображения: Growtika / unsplash.com

Новые принципы позволяют ИИ преобразовывать материалы деликатного характера, но запрещают создавать их. Например, можно перевести текст, связанный с веществами в ограниченном обороте, с одного языка на другой; можно проявлять эмпатию, но без явно неискренних эмоций. Следует соблюдать границы, но при этом максимально повышать полезность ИИ. К этому, в той или иной мере, стремятся и другие разработчики ИИ, но не все готовы открыто это формулировать.

Особое внимание уделяется проблеме «подхалимства ИИ» — модели склонны демонстрировать покладистость, даже когда следовало бы возразить или выступить с критикой. ChatGPT должен давать одинаковые фактические ответы независимо от формулировки вопроса, честную обратную связь вместо пустых похвал — вести себя как вдумчивый коллега, а не стремиться угодить. Если пользователя интересует критика работы, ИИ должен предоставлять конструктивные замечания, а не утверждать, что всё идеально. Если же пользователь делает неверное утверждение, его следует вежливо исправить, а не подыгрывать ему.

В спецификации представлена чёткая «цепочка команд», определяющая приоритет инструкций: на первом месте — нормы OpenAI, за ними следуют рекомендации разработчиков, а затем предпочтения пользователей. Такая иерархия проясняет, какие аспекты ИИ можно изменять, а какие ограничения остаются неизменными. Документ распространяется под лицензией Creative Commons Zero (CC0), что фактически переводит его в общественное достояние: компании и исследователи в области ИИ могут свободно внедрять, изменять или дополнять эти рекомендации. OpenAI не обещает мгновенных изменений в поведении ChatGPT или других своих продуктов, но новые модели будут постепенно приводиться в соответствие с новыми нормами. Компания также публикует список контрольных запросов, используемых для проверки соответствия моделей рекомендациям.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Хакеры взломали аккаунт Microsoft в соцсети X и потребовали вернуть «Скрепыша» ради рекламы криптовалюты 8 мин.
ИИ угрожает самому существованию «Википедии» — глава открытой энциклопедии бьёт тревогу 2 ч.
Американский суд впервые признал незаконным обучение ИИ на чужих материалах 2 ч.
2XKO была обречена на провал с самого запуска — для выживания файтингу по League of Legends нужны были «сотни тысяч, а то и миллионы» игроков 2 ч.
С появлением Anthropic Mythos японские банки стали выявлять вдвое больше уязвимостей 3 ч.
Ролевая игра Zero Parades: For Dead Spies от авторов Disco Elysium получила режиссёрскую версию с дополненными диалогами и не только 3 ч.
Игры будут загружаться быстрее: видеокарты Nvidia и Intel получат поддержку Microsoft Advanced Shader Delivery 4 ч.
В ChatGPT появилась виртуальная примерочная 5 ч.
ИИ-боты лишают человечество плюрализма мнений, показало исследование 6 ч.
Бескомпромиссный боевик Sifu взял курс на iOS и Android, а фанаты требуют Sifu 2 6 ч.
Восстановление Tesla замедлилось — квартальные продажи снова упали, но не слишком сильно 4 мин.
Внезапная жертва кризиса памяти: семилетняя приставка Nvidia Shield TV Pro подорожала на $100 2 ч.
Раскрыта полувековая тайна дымки в атмосфере Венеры 2 ч.
Nvidia представила мини-ПК DGX Spark с урезанной вдвое памятью — и формально он дороже 128-Гбайт оригинала 2 ч.
Представлен первый мини-ПК на Intel Panther Lake с бесшумным кулером AirJet 2 ч.
TCL подала на Samsung в суд за ненастоящую Mini LED в бюджетных телевизорах 3 ч.
Apple придумала, как бороться со складкой на iPhone Duo — защитный слой дисплея будет сменным 4 ч.
Broadcom одолжит Anthropic до $42 млрд, чтобы та получила чипы Broadcom 4 ч.
Теперь не такие уж бюджетные: Samsung подняла цены на Galaxy A57, A37, A27 и A17 вслед за флагманами 4 ч.
Huawei похвасталась высокими продажами трёхстворчатого смартфона Mate XT 2 и поприветствовала выход iPhone Duo 4 ч.