Модель TAPe+ML одновременно решает задачи детекции, классификации и сегментации, при этом она радикально легче и экономичнее по ресурсам, чем любые современные SOTA-архитектуры. На датасетах COCO и RF100-VL достигается качество детекции уровня крупных transformer-детекторов при сотнях раз меньшем числе параметров, а на LVIS — покрытие и точность масок, недостижимые для YOLO-семейства без переобучения.
Работа модели происходит в режиме, близком к real-time на массовом железе. В терминах соотношения «качество / параметры / латентность» модель находится в области, где у крупных конкурентов отсутствуют сопоставимые точки: либо они уступают в качестве при сопоставимой скорости, либо требуют на порядки больше параметров и вычислительных ресурсов для достижения схожих показателей.