Как раздвинуть окно контекста: от RoPE до LongRoPE2 и что работает у Qwen, Gemma и других
Любая LLM обучена на фиксированной длине контекста — за пределами окна она просто «слепнет». Но это не приговор: есть целый арсенал методов, которые «растягивают» позиционные кодировки. В статье на Хабре разобрано, как работают RoPE, NTK-aware, YaRN и LongRoPE/LongRoPE2, и как масштабирование сказывается на скорости и качестве генерации.
Хайп вокруг моделей с миллионом токенов — Qwen 3.8-27B и Qwen3.8-Flash-Next — многие меряют сантиметрами, но для маленьких моделей вроде Qwen 3.5 (4B/9B), Gemma 4 E2B/E4B, Ornith 1.0, LFM2/LFM2.5 и MiniCPM5-1B подходы работают по-разному. Где-то помогает простой RoPE, где-то нужен более агрессивный LongRoPE2, а где-то никакое масштабирование не спасает.
Авторы обещают пройтись по каждой модели и показать, что ей подходит — а что только портит скорость и точность. Для инженеров, которые хотят получить больше контекста без переобучения, это готовая шпаргалка.