Z.ai выпустила GLM-5.3-Flash: 320B MoE, 1M контекст и MIT-лицензия — дешевле предшественника в 10 раз
Z.ai выпустила GLM-5.3-Flash — первую модель в серии GLM-5, которая изначально заточена под работу с изображениями и видео (нативно мультимодальная). Это Mixture-of-Experts с 320 миллиардами параметров, из которых на каждый токен активируется только 18 миллиардов, что делает инференс эффективным. Контекстное окно — 1 048 576 токенов, веса выложены на Hugging Face под свободной лицензией MIT.
По данным Z.ai, GLM-5.3-Flash превосходит GLM-5.2 во всех бенчмарках и реальных задачах, при этом стоимость использования примерно в 10 раз ниже. На внутреннем тесте кодинга модель отстаёт от Claude Opus 4.8 менее чем на 0,5 процентного пункта. Первую неделю модель работала анонимно под именем «Ox Alpha» на платформах OpenCode и OpenRouter, причём весь инференс шёл на китайских чипах отечественного производства.
Развёртывание возможно двумя путями: через API (уже доступен с фиксированными ценами) или самостоятельно. Для self-hosting потребуется минимум 8 GPU (NVIDIA Hopper или новее) — FP8-версия весит около 306 GiB без учёта KV-кэша. Это по силам средним и крупным организациям, а также AI-стартапам, арендующим GPU. Для всех остальных — только API, где главное преимущество — экономия.
Модель подходит для разработки репозиторных агентов кодинга, терминальных и браузерных агентов, анализа многомиллионных логов и контрактов, регрессионного тестирования UI по скриншотам и работы с таблицами, диаграммами и дашбордами без дополнительного OCR.