Волна ИИПодписаться
← Назад
Инструменты

Букмарклет для расчёта скорости GGUF-моделей в llama.cpp прямо на Hugging Face

30.08.2026 · habr.com ↗

Разработчик представил букмарклет, который позволяет оценить скорость генерации токенов для GGUF-моделей в llama.cpp, не покидая страницу модели на Hugging Face. Достаточно нажать на закладку в браузере — и скрипт покажет предсказание на основе математической модели, построенной на реальных экспериментах автора.

Автор отметил, что существующие онлайн-калькуляторы часто дают заниженные результаты: например, многие утверждают, что на RTX 3070 8 ГБ нельзя запустить MoE-модели больше 20 млрд параметров, хотя на практике он выжимал до 35 млрд с нормальной скоростью. Свой букмарклет он калибровал под реальные замеры, чтобы цифры совпадали с тем, что видит пользователь в терминале.

Инструмент также помогает прикинуть максимальный контекст, при котором llama.cpp не вылетит по памяти. В ходе тестов автор выяснил, что нейросетевые калькуляторы занижают этот показатель в разы: обещали 20 тысяч токенов, а удалось стабильно работать с 70 тысячами. Букмарклет доступен в виде закладки и не требует установки дополнительного ПО.

Источник: habr.com
← Все новости AI Wave