Волна ИИПодписаться
← Назад
Исследования

Как раздвинуть окно контекста: от RoPE до LongRoPE2 и что работает у Qwen, Gemma и других

29.08.2026 · habr.com ↗

Любая LLM обучена на фиксированной длине контекста — за пределами окна она просто «слепнет». Но это не приговор: есть целый арсенал методов, которые «растягивают» позиционные кодировки. В статье на Хабре разобрано, как работают RoPE, NTK-aware, YaRN и LongRoPE/LongRoPE2, и как масштабирование сказывается на скорости и качестве генерации.

Хайп вокруг моделей с миллионом токенов — Qwen 3.8-27B и Qwen3.8-Flash-Next — многие меряют сантиметрами, но для маленьких моделей вроде Qwen 3.5 (4B/9B), Gemma 4 E2B/E4B, Ornith 1.0, LFM2/LFM2.5 и MiniCPM5-1B подходы работают по-разному. Где-то помогает простой RoPE, где-то нужен более агрессивный LongRoPE2, а где-то никакое масштабирование не спасает.

Авторы обещают пройтись по каждой модели и показать, что ей подходит — а что только портит скорость и точность. Для инженеров, которые хотят получить больше контекста без переобучения, это готовая шпаргалка.

Источник: habr.com
← Все новости AI Wave