Перейти к содержимому
Материал

Как конвертировать PDF в редактируемый Word

Файл открылся в Word, а курсор в текст не ставится? Почему по умолчанию получается картинка, чем поточный режим отличается от точного и куда исчезают колонтитулы.

Коротко: Чтобы получить правящийся Word, в pdf-to-word переключите тип результата на поточный: по умолчанию стоит точный, который вставляет каждую страницу картинкой со скрытым слоем для поиска. Поточный режим собирает абзацы, заголовки и настоящие таблицы Word.

Кластер

пошаговое руководство

Пошаговые инструкции, которые помогают довести PDF-задачу от входа до результата.

13 материалов

Основной инструмент

PDF в Word онлайн

Откройте инструмент из материала и выполните операцию в текущей локали.

Открыть инструмент

Оглавление

Запрос почти всегда один и тот же: нужно поправить пару абзацев в присланном PDF. И почти всегда первый результат разочаровывает — файл открылся в Word, выглядит идеально, а курсор в текст не ставится. Это не сбой конвертации, а следствие настройки, которая стоит по умолчанию.

По умолчанию получается картинка, а не текст

У инструмента два режима, и переключатель между ними называется типом результата. По умолчанию выбран точный, и он делает ровно то, что обещает: сохраняет вид страницы буква в букву. Способ при этом простой до грубости — каждая страница PDF отрисовывается в изображение и вставляется в документ Word целиком.

Отсюда и ощущение подмены. Это настоящий .docx, он открывается в Word, страницы совпадают с оригиналом по размеру и ориентации, а редактировать нечего: внутри страницы лежат картинки.

Второй режим, поточный, разбирает страницу на составляющие и собирает из них настоящий документ Word: абзацы, заголовки, списки и таблицы. Взамен точное расположение элементов на странице теряется.

РежимЧто внутриЧто можно делать
ТочныйИзображение каждой страницы плюс скрытый текстовый слойЧитать, искать по тексту, печатать
ПоточныйАбзацы, заголовки, списки и таблицы WordПравить текст, менять стили, работать с таблицами

Выбор здесь не про качество, а про задачу. Если документ нужно переслать дальше в привычном офисном формате и не трогать — точный. Если в нём нужно что-то изменить — поточный, и никакие настройки точного режима к редактируемому тексту не приведут.

Что лежит внутри «точного» файла

Изображение страницы — не всё её содержимое. Под картинку кладётся ещё и извлечённый из PDF текст, помеченный как скрытый: на экране и на печати его нет, а поиск по документу его находит.

Это делает точный режим осмысленным там, где кажется бесполезным. Договор, который надо разослать и по которому потом искать формулировки, в таком виде работает: вид сохранён идеально, поиск работает, случайных правок не будет. Инструмент, впрочем, сам предупреждает после обработки, что документ не является редактируемым текстом, — сообщение стоит прочитать, а не закрывать.

Размер страницы и ориентация берутся из исходного PDF постранично. Альбомная вклейка посреди книжного документа останется альбомной.

Как получить документ, который правится

1. Откройте pdf-to-word и загрузите файл. 2. Переключите тип результата на поточный. Это главное действие, и по умолчанию оно не сделано. 3. Решите, нужны ли превью страниц (об этом ниже), и при необходимости выключите их. 4. Запустите обработку и скачайте .docx. 5. Откройте документ и пройдитесь по панели навигации: она покажет, какие заголовки распознались. 6. Проверьте таблицы и первую страницу — там чаще всего видны потери.

Колонтитулы исчезают, и это сделано намеренно

В поточном режиме работает отдельный проход по всему документу, который ищет повторяющиеся строки. Условий два: строка должна лежать в верхней или нижней десятой части страницы и повторяться не меньше чем на трёх страницах и не меньше чем на половине документа. Всё, что подходит под оба, из результата убирается.

Сравнение при этом умное. Цифры в строке схлопываются, поэтому «Страница 4» и «Страница 5» считаются одной и той же строкой. Но схлопывание включается только если в строке остаются буквы: голый номер внизу листа сравнивается точно, и три разные цифры на трёх страницах друг другу не равны. Практический вывод: подпись вида «Конфиденциально. Страница 7» уйдёт, а колонтитул из одной цифры останется отдельным абзацем на каждой странице.

Проверено на четырёхстраничном отчёте: строка `Confidential report Page N` в поточном результате отсутствует, в точном она на месте — там страница целиком картинка, и убирать из неё нечего.

Обратная сторона у этого механизма тоже есть. Название документа, набранное крупно в самом верху каждой страницы и одинаковое на всех, попадает под то же правило и будет удалено вместе с колонтитулами. Если верхняя строка важна, её проще вернуть руками, чем искать причину.

Заголовки определяются по размеру шрифта

Стили заголовков в результате не выдумываются: инструмент сначала считает по всему документу, какой размер шрифта в нём основной. Считает не по числу строк, а по числу символов, поэтому редкая крупная надпись основным размером не станет.

Дальше каждый блок сравнивается с этим размером. Крупнее основного примерно на 15 процентов — это заголовок второго уровня, в полтора раза и больше — первого. Всё остальное остаётся обычным абзацем. Дополнительно текст должен быть похож на заголовок по форме: длинная фраза с точкой в конце заголовком не станет, каким бы шрифтом её ни набрали.

Отсюда предсказуемое поведение на документах, свёрстанных без стилей. Если весь текст набран одним кеглем, а разделы выделены только жирностью, заголовков в Word не будет ни одного: размер не отличается, и опереться не на что. Панель навигации в этом случае окажется пустой, и структуру придётся расставлять самому.

Таблицы становятся таблицами

Таблицы ищутся отдельным механизмом — тем же, на котором построен pdf-to-excel. Найденная таблица попадает в документ настоящей таблицей Word с видимой сеткой, а не абзацами с пробелами.

Текстовые блоки, попавшие внутрь границ найденной таблицы, из потока абзацев выбрасываются: иначе содержимое ячеек продублировалось бы сначала как таблица, потом как текст. Порог здесь — перекрытие на шесть десятых площади блока.

Место таблицы в документе определяется по её верхней границе: она вставляется перед первым абзацем, который начинается ниже неё. На обычной одноколоночной странице это даёт правильный порядок. На двухколоночной таблица может встать не там, где стояла, потому что абзацы двух колонок идут в файле последовательно, а по высоте перемешаны.

Если поиск таблиц на какой-то странице сорвался, задача не падает: страница переносится обычным текстом, а в ответе появляется предупреждение с номерами таких страниц. Пустой ответ без объяснений тут невозможен.

Вес файла и превью страниц

Поточный режим по умолчанию добавляет после текста каждой страницы её изображение — чтобы было с чем сверять результат. На вес это влияет сильнее, чем на что-либо ещё.

Измерено на одном и том же четырёхстраничном документе:

Что получилосьРазмер
Точный режим671 КБ
Поточный с превью страниц315 КБ
Поточный без превью37 КБ

Исходный PDF весил около 4 КБ. Разница между крайними строками — восемнадцатикратная, и вся она в картинках. Если документ идёт в работу, а не на сверку, превью стоит выключить сразу: они не редактируются, не участвуют в тексте и только мешают при вычитке.

Точный режим на превью не реагирует вовсе — там страница и так изображение.

Скан без текстового слоя

Отсканированный документ — это картинка, и извлекать из неё нечего. В точном режиме результат окажется тем же сканом, переложенным в .docx. В поточном страницы выйдут пустыми, и на месте каждой останется отметка о пустой странице.

Лечится это до конвертации, а не после: прогоните файл через ocr-pdf, получите PDF с текстовым слоем и только потом переводите в Word. Порядок обратный не работает — распознавать в Word будет уже нечего.

Документ, закрытый паролем на открытие, тоже не обработается: задача остановится и попросит пароль. Снимите защиту через unlock-pdf. Пароль, ограничивающий печать или копирование, конвертации не мешает.

Когда правки внесены, документ обычно нужно вернуть в PDF. Это word-to-pdf, и там своя логика с подстановкой шрифтов, о которой стоит знать заранее.

Частые вопросы

Потому что тип результата по умолчанию точный: каждая страница вставлена изображением, а под ним лежит скрытый текстовый слой для поиска. Чтобы получить правящийся документ, переключите тип результата на поточный и сконвертируйте заново.
В поточном режиме найденные таблицы переносятся настоящими таблицами Word с видимой сеткой. Если поиск таблиц на какой-то странице сорвался, её содержимое переносится обычным текстом, а в ответе появляется предупреждение с номерами таких страниц.
Поточный режим убирает строки, которые лежат в верхней или нижней десятой части страницы и повторяются минимум на трёх страницах и минимум на половине документа. Под это правило попадает и одинаковое название документа, набранное вверху каждой страницы.
Не напрямую. В скане нет текстового слоя, поэтому в поточном режиме страницы выйдут пустыми. Сначала прогоните файл через ocr-pdf, а уже полученный PDF переводите в Word.
Файлы используются только для выбранной операции и автоматически удаляются после завершения обработки. Загруженные документы не используются для обучения AI-моделей.

Ещё из этого кластера

Связанные инструменты

← Все инструменты категории «Конвертация»

Что делать дальше

Если после материала нужна практическая операция с PDF или ответ по ограничениям сервиса, откройте эти страницы.

Все инструменты

Каталог PDF-инструментов: объединить, сжать, разделить, конвертировать, повернуть, защитить и разблокировать PDF онлайн.

FAQ

Ответы на частые вопросы об iHatePDF: нужна ли регистрация, как обрабатываются файлы, где смотреть лимиты и безопасно ли загружать документы.

Контакты

Свяжитесь с iHatePDF по вопросам ошибок обработки, выбора инструмента, безопасности, деловых запросов и предложений по новым функциям.