Внутренности PCA, t-SNE и UMAP: почему UMAP быстрее, но не лучше t-SNE
Человек привык к трёхмерному миру, а модели машинного обучения легко оперируют сотнями и тысячами измерений. Чтобы анализировать их работу, многомерные данные приходится «сворачивать» в привычную плоскость, сохраняя взаимное расположение точек.
Три главных алгоритма для этого — PCA, t-SNE и UMAP. Несмотря на схожий результат (цветная двумерная карта), внутри они основаны на разных математических подходах. PCA — на линейных преобразованиях и собственных векторах, t-SNE — на вероятностном распределении соседства, UMAP — на топологическом анализе данных.
UMAP действительно работает быстрее t-SNE, но «быстрее» не значит «лучше». Каждый алгоритм имеет свои сильные стороны: t-SNE лучше сохраняет локальную структуру, PCA — глобальную, UMAP пытается найти баланс. Выбор зависит от задачи, а не от скорости.
Материал будет полезен тем, кто хочет глубже понять, что именно происходит, когда многомерные данные сжимаются до плоскости.