Cloudflare предложила новые средства защиты сайтов от автоматизированного скачивания их материалов с целью обучения моделей искусственного интеллекта: заблокировав предназначенных для сбора обучающей информации ИИ-ботов, владельцы сайтов могут сохранить их в поисковом индексе.
Источник изображения: cloudflare.com
До настоящего времени у владельцев сайтов не было выбора: одни и те же веб-боты собирали информацию и для обучения ИИ, и для поисковых систем; сайты, на контенте которых было запрещено обучать ИИ, выпадали из поискового индекса. Стандартных директив в файле «robots.txt» было недостаточно, потому что они не позволяли идентифицировать ботов, да и сами директивы носят рекомендательный характер. В Cloudflare пытались решить проблему на уровне сети, идентифицируя ботов и при необходимости блокируя их, что тоже представлялось слишком радикальной мерой. Поэтому в компании вступили в прямые переговоры с операторами веб-ботов, чтобы те просто перестали ставить владельцев сайтов перед таким выбором.
Чтобы помочь владельцам сайтов ориентироваться в вопросах прозрачности, в Cloudflare ввели маркировку Accountable («Ответственный»). Для получения этого статуса оператор бота должен обеспечить владельцам сайтов возможность отказываться от обучения ИИ на материалах ресурса, реализовать механизм отказа от попадания материалов сайта в поисковые сводки, а также обеспечить прозрачность на уровне URL — возможность видеть, какие страницы сайта доступны для обучения ИИ, и как контент отображается в результатах поиска. Apple, Google и Microsoft согласились соответствовать критериям статуса Accountable — некоторые функции уже реализованы, а некоторые остаются в разработке.
Источник изображения: Mohamed Nohassi / unsplash.com
Cloudflare классифицирует ботов по типу поведения. Они разделяются на поисковых, которые используются для формирования индекса, применяемых для обучения ИИ, третьей категорией являются ИИ-агенты. Четвёртая категория — боты смешанного типа, которые используются как для индексирования сайтов, так и для обучения ИИ, создавая непростую дилемму. В настройках Cloudflare теперь можно выбрать опцию «Disallow AI Training», адресованную ботам операторов со статусом Accountable — при наличии этой директивы они обязуются использовать их только для поиска, но не для обучения ИИ. Остальные опции остались прежними: ботам можно открыть сайт полностью, полностью его закрыть, или заблокировать ботам только доступ к рекламным страницам. Особое место занимают пользовательские ИИ-агенты, которые тоже могут скачивать материалы сайта, но делать это не в массовом порядке, поэтому отдельного запрета для них пока не предусмотрено, потому что единый стандарт отсутствует.
В дальнейшем Cloudflare намерена более подробно проработать вопрос ИИ-сводок в поисковой выдаче — это непростой вопрос. Более половины пользователей читают ИИ-сводки в поисковой выдаче, и вероятность того, что на этом их поиск завершится, возрастает на 40 %. С другой стороны, конверсия от пользователей, которые пришли по ссылкам из ИИ-сводок, оказывается в 3–5 выше, чем у тех, кто пришёл из обычной выдачи. Для новостного сайта, который существует за счёт рекламы, важно поднимать число посетителей; а интернет-магазин может обойтись и более скромной посещаемостью, если число заказов повысится. Поэтому возможность отказа от попадания в ИИ-сводки — не конечная цель. Владельцы сайтов должны понимать, как этот инструмент влияет на их бизнес, и располагать средствами контролировать объём используемого контента.