Document AI: LayoutLMv3 / LiLT / DocFormer / Donut — как извлекать структуру из документов (форм / receipts / invoices), и когда нужен OCR-free pipeline?
Document AI делится на две парадигмы. OCR-then-VLM: внешний OCR извлекает текст+bbox, затем мультимодальная модель (LayoutLMv3 — SOTA на FUNSD/CORD/RVL-CDIP, LiLT — language-independent layout для multilingual, DocFormer — text+image+spatial self-attention) делает token classification (IOB-tags) или relation extraction для KIE (Key Information Extraction). OCR-free: Donut (Clova AI, ECCV 2022) — vision-encoder-decoder transformer (Swin + BART-decoder), который читает image и генерирует JSON напрямую, устраняя OCR error propagation. Layout pretraining данные — DocLayNet (IBM, 11 категорий). Используй LayoutLMv3 для form understanding с готовым OCR; Donut когда OCR ненадёжен (handwritten, low-res) или нужна end-to-end fine-tuning под собственный JSON-схему.