Mistral AI открыла Shieldstral 1.0: 3B-модератор контента сравнивается с моделями в 7 раз крупнее
Mistral AI представила Shieldstral 1.0 3B — модель для модерации контента с открытыми весами и лицензией Apache 2.0. Ключевое новшество в том, что оператор задаёт политику модерации в виде одного вопроса на естественном языке прямо во время инференса, а модель возвращает калиброванную оценку безопасности за один проход. Это избавляет от необходимости переучивать модель под каждую новую политику — один и тот же чекпоинт может применяться с разными правилами для разных клиентов или сценариев.
Модель построена на базе Ministral-3-3B-Base-2512 с нативным визионным энкодером Pixtral. На текстовых данных она достигает 84,9% среднего F1, что соответствует показателям GPT-OSS-Safeguard-20B (модели в 7 раз больше). На мультимодальных задачах — 83,8% F1, превосходя все проверенные бейзлайны. При этом Shieldstral помещается в 16 ГБ VRAM в BF16 и работает на одной видеокарте. Инференс — один токен, поэтому задержка и стоимость значительно ниже, чем у методов с рассуждением.
Для обучения использовано около 54,1 млн примеров, включая синтетические контрастные пары: LLM переписывает безопасный текст в опасный, нарушающий конкретную категорию, но не смежные. Это учит модель тонко различать политики. Поддерживается развёртывание через vLLM, llama.cpp, SGLang, Transformers, а также дообучение через Axolotl. Модель подходит для модерации пользовательских промптов, ответов, изображений с подписями, фильтрации данных для RAG и пер-тенантной политики в SaaS.
Shieldstral особенно актуален для стартапов, которые не могут позволить себе контракт с вендором модерации, и для enterprise-команд, требующих самодостаточного хостинга внутри VPC или on-prem. Благодаря непрерывной оценке (score, а не метка) команды могут настраивать порог срабатывания под каждый интерфейс или направлять пограничные случаи на человеческую проверку.