Почему токенайзер режет слова не там, где нужно, и как это ломает логику LLM
Токенайзер — это компонент, который превращает текст в токены перед подачей в модель. Он не обучается вместе с ней и руководствуется статистикой, а не лингвистикой. В результате слово «сло ва» может быть разрезано посередине, а редкая фамилия — разбита на бессмысленные куски, которые модель не узнаёт.
Из этой нарезки вырастает целый список проблем, которые часто списывают на «глупую нейронку»: модель не может посчитать буквы в слове, ошибается в простой арифметике, коверкает имена, а русский текст обходится в два раза дороже английского при том же смысле. Кроме того, токенайзер объясняет, почему «давай рассуждать по шагам» реально работает, и почему лишний пробел в конце промпта портит ответ.
Статья подробно разбирает, как устроен токенайзер, почему он режет слова именно так, и как это влияет на поведение LLM — от стоимости запросов до качества рассуждений. Это не баг, а архитектурная особенность, которую стоит понимать каждому, кто работает с языковыми моделями.