Ваши файлы остаются на устройстве

Файлы обрабатываются в браузере и не загружаются на наши серверы. Сайт может скачивать движки и отправлять события использования или обратной связи без содержимого файлов.

Как мы обращаемся с данными →

Таблицы PDF в CSV

Извлеките таблицы из PDF с выделяемым текстом в файлы CSV, по одному файлу на таблицу. Сканированным страницам сначала нужен OCR. Файлы остаются в браузере.

Небольшая загрузка конвертера при первом использовании.

PDF до 10 МиБ и 200 страниц. Нужен текстовый слой; распознавание сканов не включено.

Найденные таблицы

Проверить на примере

Скачать пример

В CSV должно быть четыре строки и три столбца, разделённых точкой с запятой: Товар, Кол-во, Сумма и итог 148,50. Несколько таблиц скачиваются отдельными файлами CSV в ZIP.

Какой будет результат

Для PDF с текстовым слоем и регулярными строками таблиц. Сканы сначала нужно распознать. Таблицы могут быть пропущены, а текст — попасть не в ту ячейку: сверьте результат с PDF. Объединённые ячейки и исходное оформление не восстанавливаются.

Каждая таблица становится отдельным CSV или листом Excel. Значения сохраняются текстом. Перед потенциальными формулами в CSV добавляется апостроф; ячейки Excel записываются как текст. При импорте CSV выбирайте текстовый тип столбцов, чтобы сохранить начальные нули и запись чисел.

До 10 МиБ на входе, 200 страниц, 100 таблиц, 100 000 ячеек, 256 столбцов и 8 МиБ на выходе. Обработка ограничена 30 секундами. Строки с несовпадающей структурой вызывают ошибку.

При первом запуске могут загрузиться файлы конвертера. Если произошёл сбой, проверьте соединение или выберите меньший файл. Отмена останавливает обработку; затем можно выбрать другой файл и повторить.

Лицензии и исходный код движков

Практическое руководство

Таблица найдена — CSV создан.

  1. Выберите PDF с выделяемым текстом.
  2. Запустите «Таблицы PDF в CSV».
  3. Сверьте строки и столбцы каждого файла CSV с исходной таблицей.

Проверить на этом примере

Извлеките из PDF таблицу из трёх столбцов и восьми строк: в CSV должны быть те же восемь строк и три столбца.

Прежде чем начать: Распознавание может пропустить сложные таблицы и таблицы без границ, а сканированные страницы не дают результата, пока не пройдут OCR.