Исследования
С нуля до своей LLM: опыт команды RWB на гибридной архитектуре Qwen3.5-2B
Обучение большой языковой модели — это прежде всего инфраструктурная задача: нужен пайплайн, который можно перезапускать с новыми данными, архитектурой или расписанием и получать повторяемый результат внутри команды.
Авторы из команды RWB рассказали, как с нуля, без загрузки pretrained-весов, обучили текстовую модель на основе гибридной архитектуры Qwen3.5-2B-Base. В материале — выводы от сборки датасетов до чтения графиков онлайн-оценки.
Отдельное внимание уделено гибридному вниманию, XSA, доменным блендам и неожиданному поведению онлайн-бенчмарков, которое заставляет пересматривать стратегию обучения.
Источник: habr.com