Sakana AI выпустила Fugu-Cyber: кибербез-модель с результатом 86.9% на CyberGym и 72.1% на CTI-REALM
Sakana AI выпустила Fugu-Cyber (fugu-cyber-v1.0) — новую модель для кибербезопасности, которая работает как третий эндпоинт оркестратора Fugu, запущенного месяц назад. Модель заточена на рассуждения в области безопасности и показывает 86.9% на бенчмарке CyberGym и 72.1% на CTI-REALM. Sakana утверждает, что результаты сопоставимы с кибер-специализированными фронтирными моделями вроде GPT-5.5-Cyber и Claude Mythos Preview.
CyberGym — это бенчмарк Калифорнийского университета в Беркли, который включает 1507 реальных уязвимостей из 188 проектов OSS-Fuzz. Агент получает описание уязвимости и незапатченный код, и должен написать proof-of-concept, который крашит старую версию, но не новую. CTI-REALM — открытый бенчмарк Microsoft для детекшн-инжиниринга: 37 реальных угроз от Datadog Security Labs, Palo Alto Networks и Splunk, где агент должен сопоставить техники MITRE ATT&CK, проанализировать телеметрию и сгенерировать Sigma-правила.
Контекст: на CyberGym лучшие модели ранее показывали около 20%, Anthropic — 83.1% для Claude Mythos Preview, OpenAI — 85.6% для GPT-5.5-Cyber. Результат Sakana (86.9%) — небольшой шаг вперёд, а не прорыв. На CTI-REALM ситуация интереснее: Microsoft оценивала топ-3 конфигурации Claude в диапазоне 0.624–0.685, а Fugu-Cyber показывает 72.1% (хотя Sakana называет это success rate, хотя метрика — trajectory reward от 0 до 1).