Сжать LLM и не потерять в качестве: AIRI предложила работать с полной матрицей Фишера
Когда ресурсов мало, а модель нужно задеплоить, приходится сжимать LLM. Простое обрезание весов сильно бьёт по качеству, поэтому логично опираться на дополнительную информацию — например, матрицу Фишера (FIM), которая показывает важность и взаимосвязи параметров. Но для реальных LLM FIM огромна, и работать с ней напрямую практически невозможно.
Обычный обходной путь — считать матрицу диагональной, что резко экономит память, но напрочь теряет корреляции между параметрами одного слоя. Команда AIRI решила не мириться с этим и предложила способ быстро параметризовать полную недиагональную FIM без потери информации о связях. Подход обещает заметно снизить потери качества при сжатии, не требуя неподъёмных вычислений.
Пока это исследовательский результат, без готового инструмента, но он может пригодиться всем, кто упирается в лимиты GPU при деплое LLM.