Волна ИИПодписаться
← Назад
Модели и агенты

Стартапы ищут замену трансформерам: почему «Внимание — это всё, что вам нужно» больше не работает

Архитектура трансформера, которую Google представила в 2017 году, до сих пор остаётся двигателем всех крупных языковых моделей. Но её ключевой механизм — плотное внимание (dense attention), сравнивающее каждое слово с каждым, — приводит к взрывному росту вычислений при увеличении длины текста. Документ на 10 000 слов требует 50 миллионов операций умножения. Это одна из главных причин, почему OpenAI, по словам президента компании Грега Брокмана, потратит в этом году $50 млрд на вычисления, а энергопотребление дата-центров, по прогнозам МЭА, удвоится к 2030 году.

Но проблема не только в затратах. Трансформеры плохо удерживают длинный контекст и обрабатывают информацию последовательно, что ограничивает сложность задач, которые можно на них решать. Некоторые исследователи считают, что эта архитектура активно мешает развитию рассуждений у ИИ. Стартапы, такие как Subquadratic, предлагают альтернативы: разреженное внимание, свёрточные суммаризаторы памяти, диффузионные модели для генерации текста и сети, вдохновлённые мозгом червя. Один из стартапов уже обыграл 97% из 250 000 сложных судоку, с которыми не справились ведущие LLM, полностью отказавшись от языковых рассуждений.

Пока крупные игроки вроде OpenAI и Google наращивают вычислительные мощности, небольшие компании пытаются переизобрести сам движок ИИ. У них меньше ресурсов, но и меньше потерь в случае неудачи — и потенциально больше шансов изменить индустрию, если одна из альтернатив окажется работоспособной.

Источник: technologyreview.com
← Все новости AI Wave