ME-POIs от Google: ИИ теперь учитывает, как люди ходят в кафе, а не только их описание
Google Research совместно с USC выпустили Mobility-Embedded POIs (ME-POIs) — фреймворк, который учит модели учитывать не только текстовое описание места (кафе, магазин), но и то, как люди его реально используют. Две кофейни могут иметь одинаковую категорию и текстовый вектор, но одна работает на поток проходящих, а в другой задерживаются на полтора часа. ME-POIs кодирует каждый визит как контекстуальный вектор и через контрастивное обучение привязывает их к обучаемому прототипу для каждой точки интереса.
Архитектура обрабатывает тройки (координаты, время прибытия, время ухода) через три факторизованных энкодера: Space2Vec для локации и два Time2Vec для времени прибытия и длительности. Векторы склеиваются, проходят через 4-слойный Transformer (8 голов, d_h=512) и дают контекстуализированные эмбеддинги визитов. Основная цель — InfoNCE loss, который тянет эмбеддинг визита к прототипу своего POI и отталкивает от чужих. Для редких POI (только 9% в Лос-Анджелесе набрали порог в 100 визитов) используется перенос гистограмм через гауссовы ядра.
Результаты на данных Лос-Анджелеса (39 557 POI, 6.9 млн визитов) и Хьюстона (28 419 POI, 715 тыс. визитов): добавление ME-POIs улучшило 34 из 35 пар модель-задача. Пиковые приросты: 81.9% F1 на определение цели визита (Gemini), 24.7% снижения MAE на загруженность (Gemini), 75.1% F1 на уровень цен (GTR-T5) в Хьюстоне. Вариант без текстового выравнивания (только мобильность) обошел Gemini по классификации цен: 0.600 accuracy против 0.559.
Фреймворк частично развёртываем — это не готовый чекпоинт, а архитектура, которую нужно восстанавливать. Модель всего 53.7M параметров, обучалась на одном NVIDIA Tesla V100 16GB. Главное ограничение — данные: нужны лицензированные логи посещений или first-party трекинг плюс полигоны POI. Код и веса пока не опубликованы, доступна только статья.