Полный разбор анализа тональности IMDb: от TF-IDF до DistilBERT с LoRA
В новом туториале разбирается полный цикл анализа тональности на датасете Stanford IMDb. Авторы начинают с аудита данных: проверяют порядок классов, перекос длин отзывов, дубликаты и артефакты предобработки. Затем строят сильный бейзлайн на TF-IDF и логистической регрессии.
Далее — fine-tuning DistilBERT с LoRA через библиотеку PEFT. Модель оценивают по accuracy, macro-F1, ROC-AUC, матрице ошибок и ROC-кривым. Отдельно исследуют выбор порога и калибровку вероятностей через Expected Calibration Error и анализ надежности.
Помимо метрик, авторы копают глубже: анализируют уверенные ошибки, зависимость качества от длины отзыва, saliency-карты на уровне слов и влияние усечения контекста. В финале используют немаркированную часть IMDb для confidence-based pseudo-labeling и сравнивают полу-обучаемую модель с бейзлайном.
Туториал практичный: весь код доступен, окружение воспроизводимо, а результаты можно использовать как основу для своих задач классификации текста.