Hermes Desktop научился сам подбирать модель под железо и запускать в один клик
Раньше запуск open‑weights модели на своём компьютере требовал ручного подбора квантизации, расчёта контекста и количества слоёв GPU — и часто заканчивался ошибкой «файл слишком большой». Nous Research свернула этот процесс в один клик внутри Hermes Desktop. Приложение само читает характеристики железа, выбирает модель, которая влезает в память, скачивает веса и конфигурирует рантайм.
Подбор модели идёт с учётом жёсткого правила: Hermes выбирает самую качественную сборку, которая полностью помещается в видеопамять. Если модель не влезает целиком, система предлагает более компактную квантизацию, но не ниже 4‑бит — ниже этого порога качество падает слишком сильно. Машины, которые не могут запустить 4‑битную версию без вытеснения в RAM, просто не получают эту модель, а пользователь видит причину отказа.
Технически Hermes сам управляет инференс‑движком: скачивает официальную сборку llama.cpp под конкретное железо (несколько сотен мегабайт), проверяет её и поддерживает в актуальном состоянии. Поддерживаются бэкенды CUDA, Metal, Vulkan, HIP и CPU. Настройки хранятся в config.yaml, который можно править вручную для headless‑режима.
В интерфейсе каждая модель отображается с цветным индикатором совместимости: зелёный — полностью в GPU, жёлтый — с вытеснением в RAM (медленнее), красный — не помещается. Также показаны начальный и максимальный контекст, размер скачиваемой сборки. Функция доступна при первом запуске и в настройках Settings → Providers → Local Models. Hermes Desktop распространяется бесплатно под лицензией MIT и работает на macOS 12+, Windows 10/11 и любом Linux.