Исследования
Модель с <100 тыс. параметров обошла гигантов: TAPe+ML v3 показала 88% на ImageNet и 65 mAP на COCO
На arXiv появилась статья TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision, где представлена версия v3 одноимённой модели. Она решает сразу три задачи компьютерного зрения — классификацию, детекцию объектов и сегментацию экземпляров — в одном компактном ядре размером менее 100 тыс. параметров.
Ключевые результаты: 88,1% Top-1 на ImageNet-1k, 65,3 mAP50–95 в детекции COCO, 58,4 Mask mAP50–95 в сегментации COCO и 98,2% покрытия объектов масками на LVIS. По заявлению авторов, модель превосходит крупные SOTA-архитектуры: RF-DETR и YOLO в детекции, RF-DETR-Seg и YOLO26-X-Seg в сегментации, а на ImageNet-1k достигает уровня foundation-моделей при разнице в параметрах на порядки.
Источник: habr.com