Перейти к содержимому
Материал

Как извлечь таблицы из PDF в Excel

PDF в Excel: что за листы оказываются в скачанной книге, чем три режима распознавания отличаются на практике и почему мягкий режим находит больше таблиц, но ломает слова.

Коротко: Чтобы перенести таблицы из PDF в Excel, откройте pdf-to-excel и оставьте распознавание на авто. В книге будет лист-содержание, лист с текстом, изображение каждой страницы и отдельный лист на каждую найденную таблицу с настоящими ячейками.

Кластер

пошаговое руководство

Пошаговые инструкции, которые помогают довести PDF-задачу от входа до результата.

13 материалов

Основной инструмент

PDF в Excel онлайн

Откройте инструмент из материала и выполните операцию в текущей локали.

Открыть инструмент

Оглавление

Как перенести таблицы из PDF в Excel

В отчёте есть таблица, и её нужно посчитать заново, а не перепечатывать. Инструмент делает для этого больше, чем можно предположить по названию: он не просто выдаёт текст, а собирает книгу из нескольких листов разного назначения. Понимать её устройство полезно до первого запуска.

Что на самом деле лежит в скачанном файле

Результат — не один лист с данными. Это книга, в которой листы играют разные роли.

ЛистЧто на нём
СодержаниеУказатель страниц со ссылками на остальные листы
ТекстВесь текст документа, по строке на страницу
Страница NИзображение страницы PDF целиком
Таблица N.MНайденная таблица настоящими ячейками

Ради последней строки всё и затевается. Листы с таблицами содержат данные, с которыми можно работать формулами. Изображения страниц и лист текста — подстраховка на случай, если таблица не распозналась: содержимое перед глазами останется в любом случае.

Лист содержания устроен как оглавление: номер страницы, ссылка на её лист и первая строка текста для ориентировки. По ссылкам можно переходить прямо в книге.

Три режима распознавания

Параметр распознавания меняет способ, которым инструмент ищет границы ячеек, и это меняет результат сильнее всего остального.

РежимКак ищет таблицуЧто в книге
АвтоПо линиям разметкиВсе листы, включая текстовый
СтрогийПо линиям, с жёсткими требованиями к их пересечениюТекстовый лист не создаётся вовсе
МягкийПо расположению самого текста, без опоры на линииВсе листы, плюс полный текст страницы в примечании к ячейке

По умолчанию стоит авто. Строгий режим отличается от него не только придирчивостью к линиям: он выбрасывает из книги лист с текстом, оставляя только таблицы и изображения. Это осмысленно, когда результат идёт в дальнейшую обработку и лишние листы мешают.

Мягкий режим — единственный, который видит таблицы без линеек. За это приходится платить, и цена высока.

Есть у него и побочный эффект, который иногда оказывается полезнее основного: в мягком режиме весь текст страницы дополнительно попадает в примечание к первой ячейке листа с изображением. Наведя курсор, можно прочитать содержимое страницы, не переключаясь на текстовый лист.

Что показал замер

Взят документ, где на первой странице две таблицы: одна с линейками, вторая без них, просто выровненные колонки.

Авто и строгий нашли только первую и перенесли её идеально: три строки, три колонки, значения на местах.

Мягкий нашёл обе, но собрал их в одну сетку и попутно разломал слова по колонкам. Слово «Region» превратилось в две ячейки, «Re» и «gion». «North» стало «No» и «rth». Число 900 разошлось на «9» и «00». Между строками данных появились пустые строки.

Вывод практический. Начинайте с авто. Если таблица не нашлась и в документе действительно нет линеек, переключайтесь на мягкий, но закладывайте время на ручную сборку: он даёт материал, а не готовый результат.

И обратное: если таблица в PDF нарисована с линейками, а результат всё равно пустой, дело не в режиме. Скорее всего, в документе нет текстового слоя.

Как перенести таблицу

1. Откройте pdf-to-excel и загрузите документ. 2. Оставьте распознавание на авто для первой попытки. 3. Запустите обработку и скачайте книгу. 4. Откройте лист содержания и перейдите на листы с таблицами. 5. Сверьте числа в паре строк с изображением страницы на соседнем листе. 6. Если таблиц не оказалось, повторите в мягком режиме.

Пятый пункт нужен именно потому, что изображение страницы лежит в той же книге. Сверять перенесённое с оригиналом можно не выходя из Excel.

Объединение ячеек и сортировка

Переключатель объединения ячеек включён по умолчанию. Он касается ячеек, которые в исходной таблице растянуты на несколько колонок: включённый, он восстанавливает их как настоящие объединённые диапазоны, повторяя вид оригинала.

Выключенный, он разбирает такие ячейки на обычные: значение остаётся в первой, остальные становятся пустыми.

Выбирать нужно по тому, что вы собираетесь делать с данными.

Если таблицу будут читать глазами и печатать, оставьте объединение включённым: результат совпадёт с оригиналом.

Если по данным будут сортировать, фильтровать или строить сводную, выключите. Excel отказывается сортировать диапазон с объединёнными ячейками и требует привести их к одному размеру. Разбирать объединения потом руками дольше, чем выключить переключатель заранее.

Почему файл тяжелее, чем ожидаешь

Каждая страница PDF попадает в книгу отдельным листом с полноразмерным изображением, отрисованным почти с двукратным запасом по разрешению. Именно эти картинки и составляют почти весь вес результата.

На маленьком тестовом документе разница особенно заметна: исходный PDF весил 2 КБ, книга получилась около 45 КБ. На реальных отчётах счёт идёт на мегабайты, и растёт он от числа страниц, а не от числа таблиц.

Если нужны только данные, а изображения мешают, лишние листы удаляются в Excel за пару действий, и файл после сохранения похудеет.

Скан и таблица без текстового слоя

Инструмент читает текст, а не распознаёт его. Отсканированная таблица для него — картинка: изображение страницы в книге будет, лист текста окажется пустым, таблиц не найдётся ни в одном режиме.

Лечится это до конвертации: прогоните файл через ocr-pdf, получите текстовый слой и после этого переводите в таблицу. Порядок обратный бесполезен, в Excel распознавать уже нечего.

Тот же приём помогает и с документами, где текст есть, но кривой: страница, снятая под углом, распознаётся хуже ровной, и выравнивание перед распознаванием заметно меняет результат.

Границы, предупреждения и соседние инструменты

Если поиск таблиц сорвался на какой-то странице, задача не падает. Книга приходит целиком, а в ответе появляется предупреждение с номерами этих страниц: таблиц оттуда не будет, изображение и текст останутся. То же для страниц, с которых не удалось прочитать текст.

Документ под паролем на открытие обработать нельзя, снимите защиту через unlock-pdf. Пароль, ограничивающий печать или копирование, извлечению таблиц не мешает.

Если на одной странице несколько таблиц, каждая получает свой лист с номером страницы и порядковым номером таблицы на ней. Имена листов в Excel ограничены по длине, поэтому длинные подписи подрезаются, а совпадения разводятся числовым суффиксом.

Если из документа нужны не таблицы, а текст для правки, это pdf-to-word в поточном режиме: тот же механизм поиска таблиц там переносит их настоящими таблицами Word. А готовую книгу вернуть в PDF помогает excel-to-pdf.

Частые вопросы

Сначала проверьте, есть ли в таблице линейки: режимы авто и строгий ищут границы ячеек именно по линиям. Таблицу без линеек видит только мягкий режим. Если линейки есть, а результат пустой, скорее всего в документе нет текстового слоя и нужен OCR.
Он опирается на расположение текста, а не на линии, и на замере разломал слова по колонкам: Region превратилось в Re и gion, число 900 разошлось на 9 и 00. Он даёт материал для ручной сборки, а не готовую таблицу.
Из-за объединённых ячеек: переключатель объединения включён по умолчанию и восстанавливает ячейки, растянутые на несколько колонок. Если по данным будут сортировать или строить сводную, выключите его перед обработкой.
Каждая страница PDF попадает в неё отдельным листом с полноразмерным изображением. Именно картинки составляют почти весь вес. Если нужны только данные, лишние листы удаляются в Excel, и файл после сохранения похудеет.
Файлы используются только для выбранной операции и автоматически удаляются после завершения обработки. Загруженные документы не используются для обучения AI-моделей.

Ещё из этого кластера

Связанные инструменты

← Все инструменты категории «Конвертация»

Что делать дальше

Если после материала нужна практическая операция с PDF или ответ по ограничениям сервиса, откройте эти страницы.

Все инструменты

Каталог PDF-инструментов: объединить, сжать, разделить, конвертировать, повернуть, защитить и разблокировать PDF онлайн.

FAQ

Ответы на частые вопросы об iHatePDF: нужна ли регистрация, как обрабатываются файлы, где смотреть лимиты и безопасно ли загружать документы.

Контакты

Свяжитесь с iHatePDF по вопросам ошибок обработки, выбора инструмента, безопасности, деловых запросов и предложений по новым функциям.