Как устроены детекторы на трансформерах (DETR, Deformable DETR, RT-DETR, Co-DETR): почему они предсказывают все объекты сразу, при чём тут венгерский алгоритм и почему им не нужен NMS?
DETR (Carion, ECCV 2020) переформулировал детекцию объектов как предсказание всего набора сразу: трансформер выдаёт фиксированный набор из N предсказаний. Венгерский алгоритм сопоставляет предсказания с настоящими объектами строго один к одному, поэтому дубликаты не появляются в принципе — отсюда и ненужность NMS (шага, который выбрасывает повторные рамки вокруг одного объекта). Deformable DETR (Zhu, 2021) добавил внимание, которое смотрит не на всю картинку, а лишь на несколько важных точек в разных масштабах — обучение сошлось за 50 эпох вместо 500. RT-DETR (Baidu, 2023) — гибридный кодировщик и отбор запросов с учётом перекрытия рамок; работает в реальном времени на T4, RT-DETR-X даёт ≈ 54.8 AP на COCO. Co-DETR (Zong, ICCV 2023) добавил совместные схемы назначения меток и вышел на 66.0 AP с основой EVA-02.