Волна ИИПодписаться
← Назад
Инструменты

Видеокарта не панацея: что реально влияет на скорость локальной LLM

18.09.2026 · habr.com ↗

При выборе видеокарты для локального запуска больших языковых моделей многие ориентируются только на пиковую производительность GPU. Но на практике узким местом часто оказывается объём видеопамяти: модель и её KV-кэш должны помещаться целиком, иначе начинается сброс на CPU с катастрофическим падением скорости.

Не менее важен движок инференса — разные фреймворки (llama.cpp, vLLM, TensorRT-LLM) по-разному оптимизируют работу с памятью и распараллеливание. Даже на одной и той же карте разница между ними может достигать нескольких раз.

Перед покупкой стоит прикинуть не только размер модели, но и объём контекста, который вы планируете использовать: длинные диалоги требуют много места под KV-кэш. Итоговый совет: сначала определитесь с моделью и типичной длиной контекста, а уже под них выбирайте карту и движок.

Источник: habr.com
← Все новости AI Wave