Перейти к содержимому
Материал

Как распознать текст в скане PDF с помощью OCR

Распознавание кладёт невидимый текстовый слой поверх нетронутой картинки страницы. Разбираем, почему режим по умолчанию самый быстрый, что делает «авто» с языком и почему выравнивание перекоса включено не всегда.

Коротко: OCR не меняет вид страницы: поверх изображения ложится невидимый текстовый слой, по которому работают поиск и копирование. Страницы, где текст уже есть, пропускаются. Режим качества — это разрешение отрисовки: быстрый даёт 100 DPI, точный 300.

Кластер

пошаговое руководство

Пошаговые инструкции, которые помогают довести PDF-задачу от входа до результата.

13 материалов

Основной инструмент

OCR PDF онлайн

Откройте инструмент из материала и выполните операцию в текущей локали.

Открыть инструмент

Оглавление

Распознавание текста в PDF: что происходит со сканом

Скан документа выглядит как документ и читается как документ, но для любой программы это картинка. По нему нельзя искать, из него нельзя скопировать номер договора, и форма приёма, которая проверяет наличие текста, отклоняет его как пустой файл.

Распознавание решает ровно эту задачу и делает это способом, который стоит понимать: оно ничего не переписывает.

Что именно добавляется в файл

Изображение страницы остаётся нетронутым. Поверх него ложится второй слой — текст, расположенный там, где на картинке находятся соответствующие буквы, и сделанный невидимым.

Отсюда все свойства результата. Внешне файл неотличим от исходного: та же бумага, те же печати, тот же перекос, если он был. При этом поиск находит слова, двойной щелчок выделяет строку, а копирование даёт настоящий текст.

Это же объясняет, почему распознавание безопасно для документов, где важен вид. Скан договора с подписью после OCR остаётся тем же сканом с той же подписью, просто теперь по нему можно искать.

Страницы, где текст уже есть, пропускаются

Перед обработкой каждая страница проверяется на наличие текстового слоя, и страницы с текстом не распознаются вовсе.

Практических следствий два.

Смешанные документы обрабатываются правильно сами по себе. Если в файле часть страниц набрана в редакторе, а часть вклеена сканом, распознаётся только вторая часть. Набранный текст остаётся оригинальным, а не заменяется распознанным, что важно: оригинальный текст точен, распознанный содержит ошибки.

Запуск OCR на обычном текстовом PDF почти ничего не делает и не портит файл. Это удобно, когда неизвестно, скан перед вами или нет: просто пропустите документ через инструмент.

Из этой же логики вытекает время работы. Оно зависит не от числа страниц в документе, а от числа страниц без текста. Двухсотстраничный отчёт с пятью вклеенными сканами обработается за время пяти страниц.

Три режима качества — это три разрешения

Выбор качества управляет одной величиной: с каким разрешением страница отрисовывается перед распознаванием.

РежимРазрешениеКогда брать
Быстрый100 DPIКрупный чёткий текст, черновая проверка
Сбалансированный150 DPIОбычные документы, договоры, справки
Точный300 DPIМелкий шрифт, сноски, плохие копии

По умолчанию стоит быстрый режим, и это стоит помнить. Ста точек на дюйм достаточно для заголовков и основного текста в двенадцатом кегле, но мелкие сноски, цифры в таблицах и штампы на такой отрисовке распознаются заметно хуже.

Правило простое: если в документе есть что-то, что вы сами читаете с прищуром, ставьте точный режим. Он медленнее, зато переделывать не придётся.

Язык: «авто» — это два языка сразу

Доступны русский и английский, а также режим «авто».

Автоматический режим не угадывает язык. Он распознаёт документ обоими языками одновременно, поэтому подходит текстам, где русский перемешан с английскими названиями, кодами и терминами. Плата за это — скорость и небольшая потеря точности на однородном тексте.

Если документ целиком на одном языке, выбор конкретного языка даст результат чуть лучше и быстрее.

Когда выбранный язык недоступен, распознавание не падает: оно отрабатывает на доступном и добавляет к результату отдельное предупреждение с указанием, какой язык был запрошен и какой применён. Это стоит читать, а не закрывать: молча подставленный язык объясняет странный результат лучше любых догадок.

Отдельно про документы на других языках. Латиница распознаётся английским набором, но диакритика при этом теряется или искажается: французские и немецкие тексты выйдут читаемыми, но с ошибками в надстрочных знаках. Письменности, отличные от латиницы и кириллицы, не поддерживаются вовсе.

Как запустить распознавание

1. Откройте ocr-pdf и загрузите документ. 2. Выберите язык. «Авто» для смешанного текста, конкретный язык для однородного. 3. Поставьте точный режим, если в документе есть мелкий шрифт. 4. Запустите обработку и скачайте результат. 5. Откройте файл и попробуйте найти поиском слово, которое точно есть на скане. Это самая быстрая проверка.

Выравнивание перекоса и его цена

Отдельный переключатель выпрямляет наклонённые страницы перед распознаванием. По умолчанию он выключен, и на это есть причина.

Выпрямление применяется к временной копии страницы, по которой работает распознавание, а текстовый слой затем накладывается на исходную, неисправленную страницу. На сильно наклонённом скане это даёт смещение: невидимый текст оказывается повёрнут относительно видимых букв.

Поиск от этого не страдает, слово всё равно находится. Страдает выделение мышью: рамка выделения ложится не туда, где буквы, и копирование участка становится неудобным.

Компромисс сделан осознанно: исходные страницы остаются нетронутыми. Если перекос заметный, правильнее выпрямить документ до распознавания через rotate-pdf для поворотов на прямой угол или пересобрать скан через scan-to-pdf, где есть настоящее выравнивание.

Чего распознавание не делает

Оно не улучшает исходник. Смазанное фото, блик от лампы поперёк строки, тень от руки на половине страницы — всё это останется, и распознавание по такому месту даст мусор или пропустит его.

Оно не читает рукописный текст. Инструмент рассчитан на печатный шрифт.

Оно не даёт юридически значимого текста. Распознанный слой содержит ошибки, и его нельзя использовать как копию документа. Он нужен для поиска и для систем, которым требуется текстовый слой, но не для цитирования.

И оно не восстанавливает разрешение. Если исходный скан сделан в 75 точек на дюйм, точный режим отрисует его в 300, но букв от этого не прибавится: увеличится размытая картинка. Качество распознавания определяется исходником, а не настройкой.

Куда встроить распознавание в цепочку операций

Порядок здесь важнее, чем кажется, и правило одно: распознавание должно идти до сжатия.

Распознавание работает по изображению страницы. Сжатие через compress-pdf это изображение ухудшает: понижает разрешение и добавляет искажения вокруг букв. Обратный порядок даёт заметно больше ошибок в тексте, и исправить их потом нечем.

Сборку и повороты тоже стоит делать до распознавания: они меняют состав и ориентацию страниц, а текстовый слой привязан к конкретной странице.

Если нужен не файл с текстовым слоем, а сам текст отдельным файлом, для этого есть pdf-to-text: он извлекает содержимое в обычный текстовый файл с разбивкой по страницам.

Частые вопросы

Нет. Изображение страницы остаётся прежним, поверх него добавляется невидимый текстовый слой. Визуально файл не отличается от исходного, а поиск и копирование начинают работать.
Практически ничего: страницы, где текст уже есть, пропускаются без обработки. Это удобно для смешанных документов, где часть страниц набрана, а часть отсканирована.
Русский и английский. Режим «авто» распознаёт оба сразу, что подходит документам со смешанным текстом. Если выбранный язык недоступен, распознавание отработает на доступном и об этом будет отдельное предупреждение.
Нет, для базовой работы регистрация не требуется.
Файлы используются только для выбранной операции и автоматически удаляются после завершения обработки. Мы не используем загруженные документы для обучения AI-моделей.

Ещё из этого кластера

Связанные инструменты

← Все инструменты категории «Оптимизация»

Что делать дальше

Если после материала нужна практическая операция с PDF или ответ по ограничениям сервиса, откройте эти страницы.

Все инструменты

Каталог PDF-инструментов: объединить, сжать, разделить, конвертировать, повернуть, защитить и разблокировать PDF онлайн.

FAQ

Ответы на частые вопросы об iHatePDF: нужна ли регистрация, как обрабатываются файлы, где смотреть лимиты и безопасно ли загружать документы.

Контакты

Свяжитесь с iHatePDF по вопросам ошибок обработки, выбора инструмента, безопасности, деловых запросов и предложений по новым функциям.