Исследования
Диффузионные языковые модели: что работает, а что нет — опыт AIRI и SberAI
Диффузионные языковые модели (dLLM) отличаются от обычных LLM тем, что генерируют текст сразу несколькими токенами, а не последовательно слева направо. Теоретически это даёт кратное ускорение и позволяет заполнять произвольные пропуски в тексте, а не только дописывать справа.
Специалисты AIRI и SberAI перепробовали множество таких моделей, набили шишек и даже предложили собственные решения. В обзоре они рассказывают, какие подходы действительно работают, а какие вызывают вопросы по воспроизводимости результатов.
Источник: habr.com