Волна ИИПодписаться
← Назад
Модели и агенты

Память решает: как выбрать модель для Claude Code на двух DGX Spark

24.09.2026 · habr.com ↗

В сентябре 2026 года на Hugging Face доступны три кандидата для пары DGX Spark под Claude Code: DeepSeek‑V4.1-Flash (552B параметров), GLM-5.3-Flash (320B) и Qwen3.8-Flash‑Next (125B). Первая показывает лучшие результаты в бенчмарках, но не помещается в 243 ГиБ даже в 4-битной квантизации. Вторая занимает 198 ГБ и грузится 15 минут. Третья почти влезает в один Spark — не хватает всего 2 ГБ.

Арифметика памяти оказывается важнее таблицы бенчмарков: 6 миллиардов активных параметров не дают обещанных 90 ток/с, а решающим фактором для Claude Code становится не скорость токенов, а один флаг vLLM, который в самом быстром конфиге выключен. Выбор модели на этом кластере — это прежде всего расчёт доступной памяти, а не сравнение цифр из тестов.

Практический вывод: для двух DGX Spark оптимальным вариантом оказывается Qwen3.8-Flash‑Next, несмотря на её меньший размер — она единственная, кто может работать без свопа и долгой загрузки. DeepSeek и GLM требуют либо больше памяти, либо компромиссов по скорости.

Источник: habr.com
← Все новости AI Wave