Ваши файлы остаются на устройстве
Файлы обрабатываются в браузере и не загружаются на наши серверы. Сайт может скачивать движки и отправлять события использования или обратной связи без содержимого файлов.
Как мы обращаемся с данными →PDF в HTML
Превратите встроенный текст PDF в отдельный HTML-файл с разбивкой по страницам для удобного чтения. Изображения и исходный макет в результат не входят.
Учебный пример: проверьте настройки операции перед запуском.
Документы остаются на устройстве. Загрузка движков и статистика не включают содержимое файлов.
Локальные лимиты: Максимальный размер файла: 10 MB
Файлы обрабатываются в вашем браузере. Они не загружаются на этот сайт.
Практическое руководство
Сохраните связь текстового вида с последовательностью страниц.
- Выберите PDF, текст которого можно выделить.
- Экспортируйте HTML и откройте скачанный файл локально.
- Сравните получившиеся разделы и формулировки с исходным PDF.
Попробуйте этот пример
Экспортируйте в HTML предложение на пять страниц с поиском. Убедитесь, что сводка со страницы 1 и контакты со страницы 5 попали в нужные разделы, прежде чем делиться текстовой копией.
До
- Страницы PDF с текстом
После
- Разделы HTML по страницам
Перед началом: Это не отображение PDF и не конвертация с сохранением формата; изображения и исходный макет не включаются.
Продолжить с исходным PDFРезультат
Экспортируйте встроенный текст в отдельный документ HTML с одним разделом на страницу. Текст экранируется и не выполняется как HTML. Исходные шрифты, изображения, таблицы и макет не сохраняются; OCR нет. Ограничения: 10 МиБ на входе, 200 страниц, 4 МиБ на выходе.
Ограничения
Не более 10 МиБ на входе, 200 страниц и 4 МиБ текста на выходе. Для сканированных документов без текстового слоя выдаётся ошибка вместо ложного успешного извлечения. Порядок чтения, колонки и шрифты могут не совпадать с визуальным макетом. Это не OCR и не PDF в Word.
Пример
Экспортируйте отчёт с текстовым слоем и откройте скачанный HTML локально. Разделы следуют порядку страниц PDF; пустые и сканированные страницы помечаются, а не молча считаются распознанным текстом.