Видеокарта не панацея: что реально влияет на скорость локальной LLM
При выборе видеокарты для локального запуска больших языковых моделей многие ориентируются только на пиковую производительность GPU. Но на практике узким местом часто оказывается объём видеопамяти: модель и её KV-кэш должны помещаться целиком, иначе начинается сброс на CPU с катастрофическим падением скорости.
Не менее важен движок инференса — разные фреймворки (llama.cpp, vLLM, TensorRT-LLM) по-разному оптимизируют работу с памятью и распараллеливание. Даже на одной и той же карте разница между ними может достигать нескольких раз.
Перед покупкой стоит прикинуть не только размер модели, но и объём контекста, который вы планируете использовать: длинные диалоги требуют много места под KV-кэш. Итоговый совет: сначала определитесь с моделью и типичной длиной контекста, а уже под них выбирайте карту и движок.