Как LLM превращают текст в числа и обратно: разбор инференса
Когда вы отправляете промпт в большую языковую модель, она не «читает» текст как человек. Сначала входные данные разбиваются на токены — кусочки слов или символы, — затем каждый токен превращается в числовой вектор (эмбеддинг). Эти векторы проходят через десятки слоёв нейросети, где модель «взвешивает» связи между словами и контекстом.
На выходе модель предсказывает следующий токен, используя вероятностное распределение по всему словарю. Этот процесс повторяется итеративно: каждый новый токен добавляется к уже сгенерированному тексту и снова подаётся на вход. Именно поэтому ответы LLM выглядят связными, но иногда «зацикливаются» или галлюцинируют — модель не мыслит, а статистически продолжает последовательность.
Статья объясняет ключевые этапы инференса: от токенизации и эмбеддингов до механизма внимания и автогрессии. Это базовые знания, которые помогают понять, почему LLM работают так, а не иначе, и какие ограничения у них есть.