Инструменты
Сайзинг RAM и vCPU для локальной LLM: формула и тест для стартовой VM
Сайзинг RAM и vCPU для локальной языковой модели начинается с конкретных весов и профиля запросов. Исходные требования self-hosted LLM включают длину входа и ответа, конкурентность, рантайм и схему offload.
Расчёт по размеру весов и формуле KV-кэша даёт стартовую конфигурацию виртуальной машины. Прогретый тест показывает реальное потребление памяти и точку, где CPU перестаёт помогать.
Источник: habr.com