Волна ИИПодписаться
← Назад
Исследования

Хотел сжать LLaMA-7B до 1 ГБ без дообучения: 60+ экспериментов и вывод, который удивил

09.09.2026 · habr.com ↗

Автор эксперимента посмотрел на 13 ГБ весов LLaMA-7B и задался вопросом: можно ли записать те же «мозги» короче, не обучая новую модель, а просто применив математику к готовым весам. Так родился проект PCST — попытка сжать модель до 2 ГБ, а в идеале до 1 ГБ, без дообучения, дистилляции, pruning и изменения архитектуры, только за счёт преобразований и небольшой калибровочной выборки.

В ходе работы перепробовано более 60 методов, сотни конфигураций и несколько версий модели. Цель в 1 ГБ так и не покорилась: текущий артефакт занимает 2.05 GiB и уступает стандартной Q3_K_M и по качеству, и по скорости. Добавился и неприятный системный баг с transpose, из-за которого пришлось пересмотреть значительную часть результатов.

Главный неожиданный вывод: можно заметно улучшить восстановление отдельных весов, но модель от этого становится глупее в целом. Локальные улучшения куда-то исчезают — история о том, почему красивые методы из картинок почти бесполезны для сырых весов и как устроены пределы сжатия без обучения.

Источник: habr.com
← Все новости AI Wave