Что спрашивают на NLP-собеседованиях про LLM: от архитектуры до инференса
В русскоязычном блоге на Habr опубликован материал, собравший типичные вопросы с реальных собеседований по NLP и LLM. Автор не только перечисляет темы, но и даёт развёрнутые ответы с иллюстрациями: почему современные генеративные модели строятся на decoder-only архитектуре, чем LLaMA отличается от классического Transformer, зачем нужны RoPE, RMSNorm, SwiGLU и Grouped Query Attention.
Отдельный блок посвящён дороговизне инференса LLM и способам её снижения: fused kernels, FlashAttention, KV-cache и PagedAttention, continuous batching, speculative decoding, квантизация и дистилляция. В конце статьи — полный список вопросов, которые реально задают на собесах, так что материал будет полезен и тем, кто готовится к интервью, и тем, кто просто хочет систематизировать знания по устройству современных языковых моделей.