pdf-inspector мгновенно определяет, нужно ли вам OCR: за 10–50 мс помечает страницы как текстовые, сканированные или смешанные и потом извлекает позиционно‑осведомленный текст и таблицы в чистый Markdown — без ML и без внешних сервисов. Полезно для тех, кто массово конвертирует отчёты, научные статьи или счета: точнее и в 2–40× быстрее конкурентов на локальных коллекциях благодаря умной выборке, поддержке CID‑шрифтов, мультиколоночности и экспортам в WebAssembly/Python/Node. Можете запустить на папке с отчётами/инвойсами, автоматически детектировать страницы, пропустить OCR только для нужных страниц и сохранить каждый документ как структурированный Markdown + таблицы — готовый к поиску, вёрстке и выгрузке в базу. firecrawl/pdf-inspector Не знаю, как будет работать с русским языком, надеюсь ОК. tg / max