pdf-inspector мгновенно определяет, нужно ли вам OCR: за 10–50 мс помечает страницы как текстовые, сканированные или смешанные и потом извлекает позиционно‑осведомленный текст и таблицы в чистый Markdown — без ML и без внешних сервисов. Полезно для тех, кто массово конвертирует отчёты, научные статьи или счета: точнее и в 2–40× быстрее конкурентов на локальных коллекциях благодаря умной выборке, поддержке CID‑шрифтов, мультиколоночности и экспортам в WebAssembly/Python/Node. Можете запустить на папке с отчётами/инвойсами, автоматически детектировать страницы, пропустить OCR только для нужных страниц и сохранить каждый документ как структурированный Markdown + таблицы — готовый к поиску, вёрстке и выгрузке в базу. firecrawl/pdf-inspector Не знаю, как будет работать с русским языком, надеюсь ОК. tg / max
pdf-inspector мгновенно определяет, нужно ли вам OCR: за 10–50 мс помечает…
Из этого канала
- #18227Думаю, что все поймете сами. tg / max
Думаю, что все поймете сами. tg / max
- #18228LibreTranslate — бесплатный и открытый API машинного перевода. Самостоятельный…
LibreTranslate — бесплатный и открытый API машинного перевода. Самостоятельный хостинг, возможность работы офлайн и простая настройка.
- #18229Владелица небольшой кофейни рассказала, сколько времени требуется новому…
Владелица небольшой кофейни рассказала, сколько времени требуется новому заведению, чтобы начать работать хотя бы в ноль.
- #18225ФАС возбудила дело против Apple — компания не добавила возможность…
ФАС возбудила дело против Apple — компания не добавила возможность предустановить мессенджер MAX и RuStore на iPhone и iPad.
- #18224"Держите меня семеро. Я уважаю любой способ заработать в рамках закона, но…
"Держите меня семеро. Я уважаю любой способ заработать в рамках закона, но ебушки - воробушки, что это вообще такое: ""Психолог с IT-прошлым | Мастер над…