Recurrent Looped Transformer (RLT): архитектура с 96 блоками на токен и неограниченной временной глубиной
В обычных decoder-only LLM последний слой токена t никак не влияет на первый слой токена t+1 — связь идёт только через attention поверх кэша ключей и значений. Исследователь из Принстона Yifan Zhang предложил замкнуть этот цикл: архитектура Recurrent Looped Transformer (RLT) передаёт финальное скрытое состояние декодера и его послойный SWA-кэш на следующий токен, не сбрасывая их на границе промпта и ответа. Пока это только спецификация дизайна без измерений эффективности или качества.
RLT состоит из каузального энкодера и рекуррентного декодера. Энкодер обрабатывает токены параллельно под каузальной маской, проецируя KV-память. Декодер хранит полное состояние H_t = (s_t, C_t^D), где s_t — финальный выход декодера, а C_t^D — сохранённые ключи и значения SWA на каждом слое. Для каждого токена выполняется gated-слияние e_t с предыдущим s_{t-1}, затем каждый блок декодера делает каузальный SWA, cross-attention к памяти энкодера и FFN. Окно W включает текущий токен, так что хранится не более W-1 исторических записей на слой. В эталонной конфигурации 48 слоёв энкодера и 48 слоёв декодера с совместимыми весами attention и FFN — итого 96 логических блоков на токен.
Три принципа дизайна: (1) латентное рассуждение с неограниченной временной глубиной — после t токенов путь состояния проходит t·L_D блоков декодера (48t в эталонной конфигурации), хотя gates и contraction могут подавлять длинные пути; (2) co-design модели и железа — энкодер использует token-parallel ядра, декодер остаётся последовательным, но независимые последовательности могут делить один батч; (3) co-design модели и RL-алгоритма — претрейнинг, SFT, сэмплинг и RL replay используют один переход состояния, при этом старые rollout-состояния никогда не переиспользуются.
Обучение: претрейнинг — full-sequence next-token prediction с полным BPTT; SFT маскирует loss на ассистентские токены, но никогда не маскирует обновления состояния, так что градиенты от assistant-токенов проходят через user и tool токены. Автор предупреждает, что частичное отцепление (detach) рискованно из-за перекрёстных членов в Jacobian через decoder KV.