Shieldstral — это новый открытый классификатор безопасности контента с весами 3B, который работает по принципу «политика как вопрос». Модель выпущена под лицензией Apache 2.0, и это первый релиз в рамках инициативы Open Secure AI Alliance, куда вместе с NVIDIA вошли и другие организации. На текстовых задачах безопасности Shieldstral сравнивается с моделями вплоть до 7 раз больше себя, а на мультимодальной модерации ставит новый state of the art.
Обычные guardrail-модели зашивают фиксированную таксономию вредных категорий в веса. Перенастроить их под новый продукт — значит переучивать. Shieldstral решает задачу иначе: политику описывают обычным языком прямо на инференсе, и модель возвращает калиброванный score безопасности. Один интерфейс для текста и картинок, вердикт из одного токена, никакого retraining.
Каждый запрос состоит из трёх частей: <Instruct> — контекст оценки и строгость, <Query> — вопрос с ответом да/нет, например «Продвигает ли этот контент физическое насилие?», и <Document> — сам контент: промпт, ответ, пара промпт-ответ или изображение с текстом. На инференсе модель читает только логиты yes и no и нормализует их через softmax в непрерывный score. Такая формулировка объединяет классификацию промптов, модерацию ответов, детекцию отказов и токсичности в одну задачу, а политики целиком живут в промпте.
Авторы подчёркивают: маленькая модель может обойти гораздо большие, если правильно собрать данные. Они решали четыре проблемы. Разнородные публичные датасеты приводятся к единому формату instruction–query–document, причём формулировки инструкций и вопросов меняются, чтобы модель не переобучалась на один стиль, а строгость калибруется по источнику. Чтобы модель училась различать политики, а не запоминать ярлыки, LLM переписывает безопасный текст в контрастные пары: каждое изменение нарушает одну политику, но не соседнюю с ней. Для изображений визуальных данных мало, поэтому ограниченные датасеты дополняют общими картинками как негативами, а пары фильтруют через vision-language reranker. Наконец, несколько LoRA-чекпоинтов объединяют через SLERP: один калиброван на публичных данных, другой добавляет тонкое различение политик, третий — базовая instruct-модель. Мерж сохраняет и калибровку, и адаптивность.
Модель обучали на платформе Forge. Она работает на одной GPU с 16GB памяти. Дальше авторы планируют расширять мультиязычность, устойчивость к длинным документам и мультимодальную безопасность.