Волна ИИПодписаться
← Назад
Тесты и бенчмарки

GTX 1080 Ti не сдаётся: сравнили MoE-модели 35B, 120B и 176B на llama-server

26.09.2026 · habr.com ↗

В прошлый раз я уже запускал 176B-класс Qwen3.8-Flash-Next на GTX 1080 Ti — это был эксперимент на грани возможного. Но недавно наткнулся на материал, где Qwen 3.8-27B запустили на двух RTX 5060 Ti по 16 ГБ (суммарно 32 ГБ). Там подтвердили, что гибридная архитектура DeltaNet + attention хорошо работает с длинным контекстом, а в квантизации Q4_K_M модель выдаёт около 24 токенов/с.

Этот результат и комментарии на Хабре подтолкнули меня к новой серии экспериментов: я решил сравнить на своём стенде MoE-модели 35B, 120B и 176B через llama-server. Забегая вперёд, скажу честно: я не ожидал, что одна из моделей, которая как минимум не хуже остальных, покажет сопоставимые результаты.

Подробности стенда, настройки и итоговые цифры — под катом. Спойлер: GTX 1080 Ti ещё способна удивить, даже когда речь идёт о моделях на 176B параметров.

Источник: habr.com
← Все новости AI Wave