Создаём LLM с фокусом на рассуждения: пошаговый гайд по пайплайну на Colab
В туториале разобран полный конвейер для создания компактной языковой модели, нацеленной на рассуждения. Авторы стримят выборку из 8 000 примеров из датасета SupraLabs/reasoning-corpus-4K-5M-v1 напрямую с Hugging Face Hub, анализируют распределение по источникам, длине токенов, типу задач и соотношению рассуждений к ответам, а затем применяют фильтры качества для удаления неподходящих образцов.
После очистки данные преобразуются в формат чата с явными тегами рассуждений. На них адаптируется модель SmolLM2-135M-Instruct с помощью LoRA через SFTTrainer из библиотеки TRL. Итоговый пайплайн включает масштабируемый доступ к данным, исследовательский анализ, курирование датасета, параметро-эффективную настройку, структурированный инференс и экспорт в Parquet — всё в одной Google Colab-ноутбуке.