FreeToken: запустите 753B GLM-5.2 на одной видеокарте — новый движок от UC Berkeley и UT Austin
Современные открытые модели весят сотни миллиардов параметров, и их запуск обычно требует кластеров датацентров. Команда из UC Berkeley и UT Austin предложила FreeToken — систему, которая превращает обычный ПК с дискретной видеокартой в эластичную платформу для инференса. Движок непрерывно перераспределяет вычисления и состояние модели между GPU, CPU, памятью и шиной, адаптируясь к реальному железу.
Результаты впечатляют: 35B модель работает на ноутбуке с 8 ГБ видеопамяти, 284B DeepSeek-V4-Flash — на игровом ПК, а 753B GLM-5.2 — на одной рабочей станции. FreeToken решает три ключевые проблемы существующих движков (llama.cpp, KTransformers, Ollama, MoE-Infinity): префилл разрушает разреженность, статическое размещение не учитывает динамику декодинга, а потребительские CPU не справляются с нагрузкой.
FreeToken доступен под лицензией Apache-2.0 на GitHub, установка через pip (freetoken v0.1.2), а также в виде десктопного приложения для Windows и Linux на flashml.ai. CLI поддерживает Linux x86_64 с NVIDIA GPU на драйвере r580+ (CUDA 13). Команда ft serve открывает эндпоинты, совместимые с OpenAI и Anthropic, на порту 1919, а ft launch claude подключает Claude Code, Codex, OpenCode или OpenClaw к локальной машине.
Решение ориентировано на соло-разработчиков, стартапы и небольшие команды, у которых счета за токены агентов уже превышают стоимость собственного GPU. Для предприятий это путь к изолированным или регулируемым нагрузкам: данные не покидают машину. Лучшие сценарии — здравоохранение, юриспруденция, оборона, финансы и R&D с интеллектуальной собственностью.