Как распознать текст в скане PDF с помощью OCR
Коротко: OCR не меняет вид страницы: поверх изображения ложится невидимый текстовый слой, по которому работают поиск и копирование. Страницы, где текст уже есть, пропускаются. Режим качества — это разрешение отрисовки: быстрый даёт 100 DPI, точный 300.
Кластер
пошаговое руководство
Пошаговые инструкции, которые помогают довести PDF-задачу от входа до результата.
Основной инструмент
OCR PDF онлайн
Откройте инструмент из материала и выполните операцию в текущей локали.
Открыть инструментОглавление
Распознавание текста в PDF: что происходит со сканом
Скан документа выглядит как документ и читается как документ, но для любой программы это картинка. По нему нельзя искать, из него нельзя скопировать номер договора, и форма приёма, которая проверяет наличие текста, отклоняет его как пустой файл.
Распознавание решает ровно эту задачу и делает это способом, который стоит понимать: оно ничего не переписывает.
Что именно добавляется в файл
Изображение страницы остаётся нетронутым. Поверх него ложится второй слой — текст, расположенный там, где на картинке находятся соответствующие буквы, и сделанный невидимым.
Отсюда все свойства результата. Внешне файл неотличим от исходного: та же бумага, те же печати, тот же перекос, если он был. При этом поиск находит слова, двойной щелчок выделяет строку, а копирование даёт настоящий текст.
Это же объясняет, почему распознавание безопасно для документов, где важен вид. Скан договора с подписью после OCR остаётся тем же сканом с той же подписью, просто теперь по нему можно искать.
Страницы, где текст уже есть, пропускаются
Перед обработкой каждая страница проверяется на наличие текстового слоя, и страницы с текстом не распознаются вовсе.
Практических следствий два.
Смешанные документы обрабатываются правильно сами по себе. Если в файле часть страниц набрана в редакторе, а часть вклеена сканом, распознаётся только вторая часть. Набранный текст остаётся оригинальным, а не заменяется распознанным, что важно: оригинальный текст точен, распознанный содержит ошибки.
Запуск OCR на обычном текстовом PDF почти ничего не делает и не портит файл. Это удобно, когда неизвестно, скан перед вами или нет: просто пропустите документ через инструмент.
Из этой же логики вытекает время работы. Оно зависит не от числа страниц в документе, а от числа страниц без текста. Двухсотстраничный отчёт с пятью вклеенными сканами обработается за время пяти страниц.
Три режима качества — это три разрешения
Выбор качества управляет одной величиной: с каким разрешением страница отрисовывается перед распознаванием.
| Режим | Разрешение | Когда брать |
|---|---|---|
| Быстрый | 100 DPI | Крупный чёткий текст, черновая проверка |
| Сбалансированный | 150 DPI | Обычные документы, договоры, справки |
| Точный | 300 DPI | Мелкий шрифт, сноски, плохие копии |
По умолчанию стоит быстрый режим, и это стоит помнить. Ста точек на дюйм достаточно для заголовков и основного текста в двенадцатом кегле, но мелкие сноски, цифры в таблицах и штампы на такой отрисовке распознаются заметно хуже.
Правило простое: если в документе есть что-то, что вы сами читаете с прищуром, ставьте точный режим. Он медленнее, зато переделывать не придётся.
Язык: «авто» — это два языка сразу
Доступны русский и английский, а также режим «авто».
Автоматический режим не угадывает язык. Он распознаёт документ обоими языками одновременно, поэтому подходит текстам, где русский перемешан с английскими названиями, кодами и терминами. Плата за это — скорость и небольшая потеря точности на однородном тексте.
Если документ целиком на одном языке, выбор конкретного языка даст результат чуть лучше и быстрее.
Когда выбранный язык недоступен, распознавание не падает: оно отрабатывает на доступном и добавляет к результату отдельное предупреждение с указанием, какой язык был запрошен и какой применён. Это стоит читать, а не закрывать: молча подставленный язык объясняет странный результат лучше любых догадок.
Отдельно про документы на других языках. Латиница распознаётся английским набором, но диакритика при этом теряется или искажается: французские и немецкие тексты выйдут читаемыми, но с ошибками в надстрочных знаках. Письменности, отличные от латиницы и кириллицы, не поддерживаются вовсе.
Как запустить распознавание
1. Откройте ocr-pdf и загрузите документ. 2. Выберите язык. «Авто» для смешанного текста, конкретный язык для однородного. 3. Поставьте точный режим, если в документе есть мелкий шрифт. 4. Запустите обработку и скачайте результат. 5. Откройте файл и попробуйте найти поиском слово, которое точно есть на скане. Это самая быстрая проверка.
Выравнивание перекоса и его цена
Отдельный переключатель выпрямляет наклонённые страницы перед распознаванием. По умолчанию он выключен, и на это есть причина.
Выпрямление применяется к временной копии страницы, по которой работает распознавание, а текстовый слой затем накладывается на исходную, неисправленную страницу. На сильно наклонённом скане это даёт смещение: невидимый текст оказывается повёрнут относительно видимых букв.
Поиск от этого не страдает, слово всё равно находится. Страдает выделение мышью: рамка выделения ложится не туда, где буквы, и копирование участка становится неудобным.
Компромисс сделан осознанно: исходные страницы остаются нетронутыми. Если перекос заметный, правильнее выпрямить документ до распознавания через rotate-pdf для поворотов на прямой угол или пересобрать скан через scan-to-pdf, где есть настоящее выравнивание.
Чего распознавание не делает
Оно не улучшает исходник. Смазанное фото, блик от лампы поперёк строки, тень от руки на половине страницы — всё это останется, и распознавание по такому месту даст мусор или пропустит его.
Оно не читает рукописный текст. Инструмент рассчитан на печатный шрифт.
Оно не даёт юридически значимого текста. Распознанный слой содержит ошибки, и его нельзя использовать как копию документа. Он нужен для поиска и для систем, которым требуется текстовый слой, но не для цитирования.
И оно не восстанавливает разрешение. Если исходный скан сделан в 75 точек на дюйм, точный режим отрисует его в 300, но букв от этого не прибавится: увеличится размытая картинка. Качество распознавания определяется исходником, а не настройкой.
Куда встроить распознавание в цепочку операций
Порядок здесь важнее, чем кажется, и правило одно: распознавание должно идти до сжатия.
Распознавание работает по изображению страницы. Сжатие через compress-pdf это изображение ухудшает: понижает разрешение и добавляет искажения вокруг букв. Обратный порядок даёт заметно больше ошибок в тексте, и исправить их потом нечем.
Сборку и повороты тоже стоит делать до распознавания: они меняют состав и ориентацию страниц, а текстовый слой привязан к конкретной странице.
Если нужен не файл с текстовым слоем, а сам текст отдельным файлом, для этого есть pdf-to-text: он извлекает содержимое в обычный текстовый файл с разбивкой по страницам.
Частые вопросы
Ещё из этого кластера
пошаговое руководство
Как конвертировать PDF в редактируемый Word
Файл открылся в Word, а курсор в текст не ставится? Почему по умолчанию получается картинка, чем поточный режим отличается от точного и куда исчезают колонтитулы.
пошаговое руководство
Как извлечь таблицы из PDF в Excel
PDF в Excel: что за листы оказываются в скачанной книге, чем три режима распознавания отличаются на практике и почему мягкий режим находит больше таблиц, но ломает слова.
пошаговое руководство
Как извлечь страницы из PDF в отдельный файл
Как вытащить из PDF нужные листы отдельным файлом: чем два режима вывода отличаются, почему файлы в архиве названы исходными номерами страниц и что делает выключение сохранения размера.
Связанные инструменты
OCR PDF онлайн
OCR PDF помогает закрыть PDF-задачу в одном браузерном потоке: загрузить исходный файл, проверить параметры, запустить обработку и скачать результат.
PDF в текст онлайн
Извлеките текст из PDF в простой текстовый файл, чтобы скопировать содержимое без оформления и вёрстки.
Сжать PDF онлайн
Сожмите PDF онлайн, чтобы уменьшить размер файла для почты, Госуслуг, портала банка, CRM или формы на сайте. Загрузите документ, выберите уровень сжатия и скачайте готовый файл. Регистрация не требуется, файлы автоматически удаляются.
Повернуть PDF онлайн
Исправьте ориентацию страниц PDF, если скан или отдельные листы оказались повернуты боком или вверх ногами.
Что делать дальше
Все инструменты
Каталог PDF-инструментов: объединить, сжать, разделить, конвертировать, повернуть, защитить и разблокировать PDF онлайн.
FAQ
Ответы на частые вопросы об iHatePDF: нужна ли регистрация, как обрабатываются файлы, где смотреть лимиты и безопасно ли загружать документы.
Контакты
Свяжитесь с iHatePDF по вопросам ошибок обработки, выбора инструмента, безопасности, деловых запросов и предложений по новым функциям.