Исследования
LLM под капотом: три уровня абстракции для понимания всего стека
Чтобы эффективно работать с большими языковыми моделями, нужно понимать весь программный стек. Автор не нашёл подробного обзора, который собирал бы всё в одну картину, и решил написать его сам. Статья не претендует на исчерпывающий гайд, а скорее делится общим видением ландшафта современных LLM-систем.
Любая система проектируется под конкретные цели и ограничения. Для LLM главные метрики — пропускная способность и задержка. Их оптимизация упирается в три фундаментальных фактора: вычислительные возможности (скорость операций и поддерживаемые типы), память (ёмкость и иерархия) и коммуникацию (ширина передачи данных, задержка и иерархия). Эти концепции хорошо описаны в книге Scaling Book от Google, особенно в разделе Roofline.
Источник: habr.com