Сегодня 01 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Anthropic вновь разрешила ИИ-моделям атаковать реальные компании в рамках тестов — но теперь с усиленной защитой

Anthropic возобновила внешнее тестирование кибербезопасности своих ИИ-моделей, которое было приостановлено 23 июля из-за проблем с безопасностью, возникших во время их оценки.

 Источник изображения: Anthropic

Источник изображения: Anthropic

Напомним, что 30 июля Anthropic сообщила о трёх инцидентах в ходе тестирования кибербезопасности, когда модели Claude получили доступ в интернет из якобы изолированной среды третьей стороны — Irregular — и произвели взлом реальных систем трёх компаний. Доступ моделей в интернет стал возможен из-за неправильной конфигурации, хотя через промты им сообщалось, что они работают в симуляции в изолированной среде. Модели также намеренно запускались без обычных мер киберзащиты Anthropic, чтобы исследователи могли оценить их базовые возможности.

Anthropic сообщила, что инциденты сочетали в себе сбой в механизмах безопасности с проблемами согласованности, которые компания фиксировала и раньше, включая мотивированное мышление и готовность к совершению вредоносных действий в погоне за определённой целью.

По словам компании, она ввела дополнительные меры защиты перед возобновлением внешнего тестирования. В частности, был добавлен классификатор в реальном времени, который может блокировать вызовы инструментов, завершать задачи и оповещать человека в случае, когда модель агрессивно исследует свою тестовую среду, пытается выйти за её пределы или неожиданно получила доступ к интернету.

Anthropic также перевела внутренние песочницы с высоким уровнем риска на более строгую изоляцию и теперь требует от внешних партнеров, тестирующих предрелизные модели с пониженным уровнем защиты, использования более совершенных инструментов контроля, включая защищённые песочницы без доступа к интернету по умолчанию.

Кроме того, компания планирует сотрудничать с некоммерческой организацией Model Evaluation and Threat Research (METR) для проведения независимой проверки. Ранее в этом году METR провела пилотную оценку внутренних рисков в области ИИ с участием Anthropic, Google, Meta и OpenAI.

Внешнее тестирование на предмет оценки кибербезопасности позволяет выяснить, на что способна продвинутая модель, получив наступательные инструменты. Также внешнее тестирование является одним из способов оценки передовых решений в области ИИ клиентами, регулирующими органами и конкурентами.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
80 % разработчиков Star Wars Zero Company остались без зарплаты, и Electronic Arts тут ни при чём 20 мин.
Sonos попытается вернуть доверие пользователей с помощью ИИ-агентов — представлена ОС Sonos 27 для аудиосистем 28 мин.
Mozilla встроила блокировщик рекламы в Firefox для iPhone 49 мин.
Anthropic вновь разрешила ИИ-моделям атаковать реальные компании в рамках тестов — но теперь с усиленной защитой 2 ч.
Double Fine пообещала сделать Brutal Legend 2, но при одном условии 2 ч.
Группа фанатов возродит амбициозный сетевой экшен APB: All Points Bulletin от создателя GTA — подробности и геймплей 3 ч.
Google Gemini сможет «думать» в фоне, пока пользователь занимается другими делами на смартфоне 3 ч.
«Google Сообщения» начали отправлять людям чужие сообщения из старых переписок 3 ч.
Selectel усиливает ИИ-платформу новой функциональностью в кaталоге ИИ-моделей 3 ч.
Broadcom представила частное ИИ-облако VMware AI Factory, позаимствовав у NVIDIA термин для партнёрства с AMD 4 ч.
Sonos представила наушники Ace Ultra с эффективным шумоподавлением и повышенной автономностью за $450 8 мин.
Самая дешёвая GeForce RTX 5090 теперь стоить $5000 в США — в 2,5 раза дороже, чем на момент анонса 37 мин.
Учёные создали дрон с «кошачьими когтями» — он садится на айсберги и крутые ледяные скалы 40 мин.
Steam Deck получила поддержку более 30 тыс. игр из библиотеки Steam 2 ч.
SilverStone выпустила блок питания HELA 3000Rz на 3000 Вт — он справится с четвёркой RTX 5090 3 ч.
Samsung пустила на производство Galaxy Z Fold8 комплектующие от будущих моделей из-за ажиотажного спроса 3 ч.
При Тиме Куке акции Apple выросли на 2275 % — но Джону Тернусу не обязательно повторять его успех 3 ч.
Asus раскрыла характеристики ноутбука ProArt P14 — одного из первых на процессоре Nvidia RTX Spark 3 ч.
OpenAI отвергла новые обвинения Apple в краже технологий как безосновательные 3 ч.
Samsung рассказала, чем будет хороша память HBM5, zHBM и zNAND-O 3 ч.