# OCR-извлечение документов

Извлекайте OCR-текст из сканов и преобразуйте страницы или изображения в Markdown, JSON, таблицы, описания и блоки для поиска с проверкой качества.

> Каноническая страница: https://elysiatools.com/ru/hubs/document-ocr-extraction

- **Ключевые слова:** OCR dokumentov, skanirovannyy PDF v markdown, OCR v JSON, izvlechenie tablits iz PDF, segmentatsiya dokumentov dlya RAG

## Частые вопросы

### Нужно ли каждый отсканированный PDF гнать в OCR и Markdown?

Нет. Если в PDF уже есть надёжный текстовый слой, прямое извлечение обычно быстрее и чище.

### Когда специализированный экстрактор лучше общего OCR?

Когда важнее конкретные поля чека или удостоверения, чем точность восстановления абзаца, потому что целью является структурированный JSON.

### Может ли извлечение таблиц заменить проверку страниц?

Нет. OCR-таблицы часто нужно проверять по оригиналу из-за объединённых ячеек, разбитых строк, валютных символов и смещённых заголовков.

### Почему сегментировать нужно после извлечения?

Ранняя сегментация слабого OCR только распространяет ошибки. Сначала стабилизируйте текст и структуру, потом готовьте их для поиска.
