Волна ИИПодписаться
← Назад
Инструменты

76% атак пропускают фильтры LLM: как защитить ИИ-агентов с помощью OGL-Mini

30.08.2026 · habr.com ↗

С ростом использования ИИ-агентов злоумышленники активно атакуют их через вредоносные email, фальшивые GitHub issue и джейлбрейк-промпты. Исследователи в 2025-2026 годах зафиксировали реальные инциденты с Copilot, Atlas, Claude Code и Apple Intelligence. Атаки становятся изощрённее: используются XML-политики, base64, невидимые символы и даже стихи.

Встроенные фильтры LLM пропускают до 76% таких атак. Для защиты предложен новый подход — лёгкая модель OGL-Mini. Она работает быстро, не тормозит агента, даёт понятные причины блокировки и функционирует без внешних API, полностью внутри инфраструктуры. Это снижает риски, связанные с облачными провайдерами, которые часто пропускают угрозы.

Источник: habr.com
← Все новости AI Wave