Волна ИИПодписаться
← Назад
Модели и агенты

Alibaba выпустила Qwen3.8-Omni-Flash: omni-модель с 1M контекстом и агентным видео-пониманием

18.09.2026 · marktechpost.com ↗

Alibaba Qwen анонсировала Qwen3.8-Omni-Flash — первую omni-modal модель, построенную вокруг агентных способностей. Она работает с текстом, изображениями, аудио и видео, выдавая только текст. Архитектура — Qwen3.8-Flash-Next (открытые веса базовой модели вышли в августе 2026). Контекстное окно — 1 млн токенов (991K на вход, 131K на выход, до 262K на рассуждение). Мышление включено по умолчанию с уровнем reasoning_effort = xhigh, его можно отключить. API совместима с DashScope и OpenAI (Chat Completions, Responses API), поддерживает function calling, веб-поиск, структурированный вывод, кэширование контекста и батч-запросы.

Главная фишка — агентное понимание видео. В отличие от обычных моделей, которые читают весь файл от начала до конца, Qwen3.8-Omni-Flash стартует от вопроса, решает, что смотреть и слушать, и собирает доказательства за несколько раундов coarse-to-fine. На OmniVideoBench точность выросла с 63.4 до 67.8, а расход токенов упал с 145 736 до 79 117 (на 45.7%). По 29 бенчмаркам средний прирост — более 25% относительно Qwen3.5-Omni-Plus. WildClawBench-MM улучшился на 36.5 пункта, AgenticVBench — на 22.3, UniClawBench достиг 69.6. Аудио-визуальная производительность близка к Gemini 3.8 Flash, а по аудио — выше.

Цены: $0.15 за 1M входных токенов, $0.47 за 1M выходных, неявный кэш — $0.016 за 1M. По сравнению с Qwen3.5-Omni-Plus затраты на аудио снижены более чем на 98% за час, на аудио-видео — более 93%, на видео — около 89%. Модель доступна через QwenCloud, Alibaba Cloud Model Studio и Qwen Studio. Ограничения: видео до 2 часов и 2 ГБ по URL, аудио до 3 часов, 113 языков и диалектов, стабильная работа при 15 fps. Доступна в 6 регионах: Пекин, Сингапур, Гонконг, Токио, Франкфурт, Виргиния. Открытых весов на момент запуска нет — только API.

Источник: marktechpost.com
← Все новости AI Wave