Сегодня 01 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Учёные доказали: ИИ-картинки зачастую нельзя связать с конкретными изображениями из обучающих данных

Учёные Лаборатории компьютерных наук и искусственного интеллекта (CSAIL) при Массачусетском технологическом институте доказали, что по мере роста наборов данных связь между тем, чему учится модель, и тем, что она генерирует, практически исчезает. Это указывает на необоснованность претензий правообладателей к лабораториям ИИ.

 Источник изображения: news.mit.edu

Источник изображения: news.mit.edu

Американские учёные открыли явление «затухания атрибуции» (attribution decay), при котором чем больше данных используется при обучении генеративной модели искусственного интеллекта, тем меньшее значение имеет любой конкретный элемент в обучающем массиве для любого конкретного результата генерации. При достаточно больших масштабах можно вообще удалить из обучающих данных любое отдельное изображение, все изображения определённого художника или все фотографии определённого человека, и сгенерированная моделью картинка не изменится.

Доказать это на практике было непросто. В общем случае, чтобы узнать, каков был бы ответ модели на конкретный запрос, если бы она никогда не видела определённое изображение, потребовались бы обучить точно такую же модель без этого изображения и повторить опыт; а затем повторить всё сначала для следующего изображения в обучающем массиве. Поэтому учёные предложили альтернативное решение — созданную ими самостоятельно архитектуру «диффузионного ансамбля» (diffusion ensemble). Это не единая монолитная модель, а множество мелких компонентов, каждый из которых обучен на отдельном фрагменте данных. В этом случае, чтобы узнать, как бы модель работала без конкретного изображения в обучающих данных, достаточно отключить те части ансамбля, которые его видели. Результаты работы этой системы сравнивались с результатами ответов 24 обычных диффузионных моделей, обученных на тех же данных. Изображения получились одинаково хорошими по стандартным показателям.

Учёные пришли к выводу, что чем больше объёмы обучающих данных, тем лучше ансамбли показывают себя по сравнению с аналогами на основе одной модели. В ходе анализа они отправляли группе моделей один запрос, удаляли из обучающих данных по одному изображению и сравнивали расхождение результатов. На основе эксперимента они ввели понятие «контрфактического радиуса» (counterfactual radius) — максимального влияния, которое мог оказывать отдельный элемент в обучающем массиве. В результате исследователи установили закономерность: чем больше обучающий набор данных, тем меньше контрфактический радиус. Другими словами, тем меньше влияние любого конкретного элемента. Результаты сравнивались как попиксельно, так и по общему семантическому значению.

В юридическом аспекте открытие означает, что ИИ-модели демонстрируют по-настоящему творческий подход — они не копируют материалы из исходных данных, а создают совершенно новые результаты. И если эти результаты не имеют ничего общего с отдельными элементами из обучающего массива, то использование контента, даже защищённого авторским правом, является добросовестным даже без обращения к правообладателю. На языковых моделях этот подход пока не проверяли.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Alibaba Cloud запустила свой первый облачный регион в Бразилии — два новых ЦОД и агентные ИИ-сервисы для местных бизнесов 34 мин.
Китай не намерен отставать от SpaceX в сфере создания космических ЦОД 2 ч.
Учёные создали лазерный детектор, который находит контрафактный алкоголь без вскрывая бутылок 2 ч.
JBL представила Cove — трио колонок с Wi-Fi для домашнего аудио 2 ч.
Amazon ответит в суде за манипулирование ценами и обман рекламодателей на сумму более $20 млрд 2 ч.
Bull займётся созданием европейского ИИ-суперкомпьютера LUMI-AI стоимостью €387,8 млн 3 ч.
РТК-ЦОД и «ИТ Школа Ростелекома» представили гибкую инфраструктурную модель для развития цифровой среды вузов 3 ч.
MediaTek даст NVIDIA NVLink Fusion кастомным ASIC, а NVIDIA вложит в MediaTek $3,5 млрд 3 ч.
Anthropic получит доступ к ИИ-мощностям на $35 млрд благодаря поддержке Nvidia 4 ч.
Представлен Samsung Galaxy Book6 — конкурент MacBook Neo за $799 4 ч.