Cloudflare отмечает вторую годовщину Content Independence Day и добавляет тонкую настройку управления AI-трафиком. Год назад компания дала владельцам сайтов кнопку «Block AI Bots» и запустила Pay-Per-Crawl-маркетплейс. Теперь подход пересмотрен: вместо простого «AI или нет» трафик разделили на три сценария поведения — Search, Agent и Training.
Поисковое поведение (Search) означает, что бот собирает и индексирует контент, чтобы отвечать на вопросы позже; ожидается, что сайт получит переходы или иную компенсацию. Agent — автоматизированные действия в реальном времени по поручению человека: чат-выборки вроде ChatGPT-User или браузерные агенты типа Gemini и Claude, которые заходят на веб-приложение, чтобы выполнить задачу. Training — краулинг для тренировки или файнтюнинга моделей, когда данные навсегда поглощаются архитектурой AI. Cloudflare призывает операторов разделять краулеры по этим целям для прозрачности, а многоцелевым ботам, которые совмещают Search с Training (например, Googlebot, Applebot и BingBot), теперь присваиваются все назначенные классификации.
Новые опции управления AI-трафиком доступны всем клиентам, включая Free tier. С 15 сентября 2026 года вступают в силу новые умолчания: для всех новых доменов категории Training и Agent будут заблокированы на страницах с рекламой — там, где человеческое внимание монетизируется, а Search останется разрешён, потому что он естественно возвращает посетителей. Многоцелевые краулеры при этом будут блокироваться по наиболее строгому правилу — если владелец сайта запретил Training, боты вроде Googlebot тоже не пройдут. Отказаться от новых дефолтов можно в настройках безопасности до указанной даты.
Для Enterprise Bot Management запущена BotBase — база данных всех известных ботов с классификацией по поведению. Помимо трёх ключевых категорий внутри BotBase выделены Transact, Data Collection, Security Testing, SEO, Ads Verification, Social/Link Preview, Feed Fetching и Monitoring & Operations. В интерфейсе можно найти конкретного бота, скопировать его detection ID для правил безопасности и отфильтровать трафик.
К поведенческой классификации добавляется параметр content use — как бот будет хранить и переиспользовать контент: immediate (взаимодействовать, но ничего не сохранять), reference (индексировать, извлекать фрагменты и давать ссылку — дефолт) или full (суммировать и воспроизводить). Владельцы сайтов смогут задать правила типа «пропускать Search, SEO и Ads Verification только до уровня reference». Для этого в Content Signals в robots.txt внедряется четвёртое поле: use=immediate, use=reference или use=full. Боты, которые нарушают заявленный уровень и воспроизводят контент полностью, теряют Verified-статус.
Понятие Verified тоже меняется. Раньше все Verified боты пропускались по умолчанию, теперь статус лишь делает бота допустимым в рамках разрешённой категории — если Search разрешён, Verified-поисковик пройдёт, а не Verified по-прежнему блокируется. Процесс верификации становится прозрачнее, и Cloudflare строит отдельный инструмент для операторов ботов.
Ещё один эксперимент — транзитивное доверие через заголовок Forwarded из RFC 7239. Он позволяет передать информацию об исходном операторе бота через цепочку прокси, чтобы сайт мог доверять, например, Stripe, но не обязательно каждому разработчику, обернувшему его инструменты. Формат выглядит как Forwarded: for="openai"; use="reference". Потеря доверия для оператора означает блокировку на более чем 20% доменов за Cloudflare, что выглядит как серьёзный сдерживающий фактор.