Форк llama.cpp для запуска 32B модели на видеокарте 3050: автор утверждает, что модель стала умнее вдвое
Пользователь под ником Titled представил собственный форк популярного инференс-движка llama.cpp. Главная заявленная особенность — возможность запускать 32-миллиардные модели на видеокарте NVIDIA GeForce RTX 3050 с 8 ГБ видеопамяти, что обычно считается недостаточным для таких больших весов.
Автор утверждает, что его модификации не только умещают модель в ограниченную память, но и делают её «в два раза умнее» — вероятно, за счёт оптимизации квантизации, кэширования или архитектурных изменений. Подробности реализации пока не раскрыты, но пост содержит ссылку на репозиторий.
Инструмент может быть полезен энтузиастам и разработчикам, которые хотят экспериментировать с большими LLM на бюджетном железе без доступа к облачным GPU. Если заявленные улучшения подтвердятся, это станет заметным шагом в демократизации доступа к мощным моделям.