Как конвертировать PDF в редактируемый Word
Коротко: Чтобы получить правящийся Word, в pdf-to-word переключите тип результата на поточный: по умолчанию стоит точный, который вставляет каждую страницу картинкой со скрытым слоем для поиска. Поточный режим собирает абзацы, заголовки и настоящие таблицы Word.
Кластер
пошаговое руководство
Пошаговые инструкции, которые помогают довести PDF-задачу от входа до результата.
Основной инструмент
PDF в Word онлайн
Откройте инструмент из материала и выполните операцию в текущей локали.
Открыть инструментОглавление
Запрос почти всегда один и тот же: нужно поправить пару абзацев в присланном PDF. И почти всегда первый результат разочаровывает — файл открылся в Word, выглядит идеально, а курсор в текст не ставится. Это не сбой конвертации, а следствие настройки, которая стоит по умолчанию.
По умолчанию получается картинка, а не текст
У инструмента два режима, и переключатель между ними называется типом результата. По умолчанию выбран точный, и он делает ровно то, что обещает: сохраняет вид страницы буква в букву. Способ при этом простой до грубости — каждая страница PDF отрисовывается в изображение и вставляется в документ Word целиком.
Отсюда и ощущение подмены. Это настоящий .docx, он открывается в Word, страницы совпадают с оригиналом по размеру и ориентации, а редактировать нечего: внутри страницы лежат картинки.
Второй режим, поточный, разбирает страницу на составляющие и собирает из них настоящий документ Word: абзацы, заголовки, списки и таблицы. Взамен точное расположение элементов на странице теряется.
| Режим | Что внутри | Что можно делать |
|---|---|---|
| Точный | Изображение каждой страницы плюс скрытый текстовый слой | Читать, искать по тексту, печатать |
| Поточный | Абзацы, заголовки, списки и таблицы Word | Править текст, менять стили, работать с таблицами |
Выбор здесь не про качество, а про задачу. Если документ нужно переслать дальше в привычном офисном формате и не трогать — точный. Если в нём нужно что-то изменить — поточный, и никакие настройки точного режима к редактируемому тексту не приведут.
Что лежит внутри «точного» файла
Изображение страницы — не всё её содержимое. Под картинку кладётся ещё и извлечённый из PDF текст, помеченный как скрытый: на экране и на печати его нет, а поиск по документу его находит.
Это делает точный режим осмысленным там, где кажется бесполезным. Договор, который надо разослать и по которому потом искать формулировки, в таком виде работает: вид сохранён идеально, поиск работает, случайных правок не будет. Инструмент, впрочем, сам предупреждает после обработки, что документ не является редактируемым текстом, — сообщение стоит прочитать, а не закрывать.
Размер страницы и ориентация берутся из исходного PDF постранично. Альбомная вклейка посреди книжного документа останется альбомной.
Как получить документ, который правится
1. Откройте pdf-to-word и загрузите файл. 2. Переключите тип результата на поточный. Это главное действие, и по умолчанию оно не сделано. 3. Решите, нужны ли превью страниц (об этом ниже), и при необходимости выключите их. 4. Запустите обработку и скачайте .docx. 5. Откройте документ и пройдитесь по панели навигации: она покажет, какие заголовки распознались. 6. Проверьте таблицы и первую страницу — там чаще всего видны потери.
Колонтитулы исчезают, и это сделано намеренно
В поточном режиме работает отдельный проход по всему документу, который ищет повторяющиеся строки. Условий два: строка должна лежать в верхней или нижней десятой части страницы и повторяться не меньше чем на трёх страницах и не меньше чем на половине документа. Всё, что подходит под оба, из результата убирается.
Сравнение при этом умное. Цифры в строке схлопываются, поэтому «Страница 4» и «Страница 5» считаются одной и той же строкой. Но схлопывание включается только если в строке остаются буквы: голый номер внизу листа сравнивается точно, и три разные цифры на трёх страницах друг другу не равны. Практический вывод: подпись вида «Конфиденциально. Страница 7» уйдёт, а колонтитул из одной цифры останется отдельным абзацем на каждой странице.
Проверено на четырёхстраничном отчёте: строка `Confidential report Page N` в поточном результате отсутствует, в точном она на месте — там страница целиком картинка, и убирать из неё нечего.
Обратная сторона у этого механизма тоже есть. Название документа, набранное крупно в самом верху каждой страницы и одинаковое на всех, попадает под то же правило и будет удалено вместе с колонтитулами. Если верхняя строка важна, её проще вернуть руками, чем искать причину.
Заголовки определяются по размеру шрифта
Стили заголовков в результате не выдумываются: инструмент сначала считает по всему документу, какой размер шрифта в нём основной. Считает не по числу строк, а по числу символов, поэтому редкая крупная надпись основным размером не станет.
Дальше каждый блок сравнивается с этим размером. Крупнее основного примерно на 15 процентов — это заголовок второго уровня, в полтора раза и больше — первого. Всё остальное остаётся обычным абзацем. Дополнительно текст должен быть похож на заголовок по форме: длинная фраза с точкой в конце заголовком не станет, каким бы шрифтом её ни набрали.
Отсюда предсказуемое поведение на документах, свёрстанных без стилей. Если весь текст набран одним кеглем, а разделы выделены только жирностью, заголовков в Word не будет ни одного: размер не отличается, и опереться не на что. Панель навигации в этом случае окажется пустой, и структуру придётся расставлять самому.
Таблицы становятся таблицами
Таблицы ищутся отдельным механизмом — тем же, на котором построен pdf-to-excel. Найденная таблица попадает в документ настоящей таблицей Word с видимой сеткой, а не абзацами с пробелами.
Текстовые блоки, попавшие внутрь границ найденной таблицы, из потока абзацев выбрасываются: иначе содержимое ячеек продублировалось бы сначала как таблица, потом как текст. Порог здесь — перекрытие на шесть десятых площади блока.
Место таблицы в документе определяется по её верхней границе: она вставляется перед первым абзацем, который начинается ниже неё. На обычной одноколоночной странице это даёт правильный порядок. На двухколоночной таблица может встать не там, где стояла, потому что абзацы двух колонок идут в файле последовательно, а по высоте перемешаны.
Если поиск таблиц на какой-то странице сорвался, задача не падает: страница переносится обычным текстом, а в ответе появляется предупреждение с номерами таких страниц. Пустой ответ без объяснений тут невозможен.
Вес файла и превью страниц
Поточный режим по умолчанию добавляет после текста каждой страницы её изображение — чтобы было с чем сверять результат. На вес это влияет сильнее, чем на что-либо ещё.
Измерено на одном и том же четырёхстраничном документе:
| Что получилось | Размер |
|---|---|
| Точный режим | 671 КБ |
| Поточный с превью страниц | 315 КБ |
| Поточный без превью | 37 КБ |
Исходный PDF весил около 4 КБ. Разница между крайними строками — восемнадцатикратная, и вся она в картинках. Если документ идёт в работу, а не на сверку, превью стоит выключить сразу: они не редактируются, не участвуют в тексте и только мешают при вычитке.
Точный режим на превью не реагирует вовсе — там страница и так изображение.
Скан без текстового слоя
Отсканированный документ — это картинка, и извлекать из неё нечего. В точном режиме результат окажется тем же сканом, переложенным в .docx. В поточном страницы выйдут пустыми, и на месте каждой останется отметка о пустой странице.
Лечится это до конвертации, а не после: прогоните файл через ocr-pdf, получите PDF с текстовым слоем и только потом переводите в Word. Порядок обратный не работает — распознавать в Word будет уже нечего.
Документ, закрытый паролем на открытие, тоже не обработается: задача остановится и попросит пароль. Снимите защиту через unlock-pdf. Пароль, ограничивающий печать или копирование, конвертации не мешает.
Когда правки внесены, документ обычно нужно вернуть в PDF. Это word-to-pdf, и там своя логика с подстановкой шрифтов, о которой стоит знать заранее.
Частые вопросы
Ещё из этого кластера
пошаговое руководство
Как извлечь таблицы из PDF в Excel
PDF в Excel: что за листы оказываются в скачанной книге, чем три режима распознавания отличаются на практике и почему мягкий режим находит больше таблиц, но ломает слова.
пошаговое руководство
Как извлечь страницы из PDF в отдельный файл
Как вытащить из PDF нужные листы отдельным файлом: чем два режима вывода отличаются, почему файлы в архиве названы исходными номерами страниц и что делает выключение сохранения размера.
пошаговое руководство
Как обрезать поля и лишнее на страницах PDF
Обрезка меняет только видимую область страницы, а содержимое за её пределами остаётся в файле. Разбираем, что это значит на практике, почему поля задаются сразу для всего документа и как ведёт себя обрезка на повёрнутых страницах.
Связанные инструменты
PDF в Word онлайн
Преобразуйте PDF в документ Word, чтобы редактировать текст, дополнять разделы и вносить правки.
Word в PDF онлайн
Преобразуйте документ Word в PDF, чтобы зафиксировать оформление и быть уверенным, что файл откроется одинаково везде.
PDF в Excel онлайн
Извлеките табличные данные из PDF в Excel, чтобы их можно было считать, фильтровать и сортировать.
OCR PDF онлайн
OCR PDF помогает закрыть PDF-задачу в одном браузерном потоке: загрузить исходный файл, проверить параметры, запустить обработку и скачать результат.
Что делать дальше
Все инструменты
Каталог PDF-инструментов: объединить, сжать, разделить, конвертировать, повернуть, защитить и разблокировать PDF онлайн.
FAQ
Ответы на частые вопросы об iHatePDF: нужна ли регистрация, как обрабатываются файлы, где смотреть лимиты и безопасно ли загружать документы.
Контакты
Свяжитесь с iHatePDF по вопросам ошибок обработки, выбора инструмента, безопасности, деловых запросов и предложений по новым функциям.