TF-IDF против трансформера: на русских отзывах счётный бейзлайн не уступает BERT, а учится за секунды
Когда нужно классифицировать текст, стандартный подход в 2026 году — взять предобученный трансформер и дообучить. TF-IDF при этом воспринимается как музейный экспонат: работал в эпоху до BERT, но сейчас несерьёзно. Обычно этот выбор никто не проверяет на своих данных, потому что исход очевиден. Авторы решили проверить на практике.
Они взяли одну задачу, один корпус русскоязычных отзывов и одну метрику, и прогнали три подхода: счётный бейзлайн на TF-IDF, свёрточную сеть TextCNN и дообученный русский энкодер. Учитывали не только качество, но и стоимость — время обучения и скорость предсказания на обычном процессоре.
Короткий вывод: на этой задаче счётный бейзлайн обучается за три секунды и по честной метрике держится вровень с трансформером, который дообучался восемь минут. Более того, трансформер, взятый по стандартному рецепту, сначала вообще проиграл — и проиграл поучительно. Детали эксперимента и выводы для практики — в полной статье.