PDF в Excel таблицы в XLSX и CSV
Загрузите PDF с таблицей — прайс-лист поставщика, счёт или выгрузку — и получите Excel или CSV. Таблицы на разных страницах с одинаковыми столбцами склеим в одну, цены и количества превратим в числа. Сканы и фото распознаём (OCR). Без водяных знаков.
- 1Загрузите PDF
- 2Проверьте настройки
- 3Скачайте результат
Шаг 1 из 3: загрузите PDF
Файл обрабатывается на нашем сервере: исходник удаляется сразу после обработки, результат хранится около 15 минут, чтобы вы успели скачать, и тоже удаляется. Мы не передаём файлы третьим лицам.
Зарегистрированным — повышенные лимиты на файлы, строки и запросы. Создать аккаунт или войти.
Ваш файл
Например: 1-3, 5, 8-. Без диапазона возьмём первые 60 страниц.
Страницы-картинки распознаём на нашем сервере; до 10 страниц сканов за раз. Выключите, если в PDF обычный текст и распознавание не нужно.
Что получится
Таблицы с линиями
Границы ячеек находим по линиям в PDF — такие таблицы обычно переносятся почти без правок.
Таблицы без линий
Столбцы определяем по выравниванию текста, и для надёжности ищем таблицы с числами (цены, количества). Результат стоит проверить, особенно длинные названия в несколько строк.
Сканы и фото
Скан с таблицей распознаём (OCR): таблицы с линиями находим по самим линиям на картинке, до 10 страниц сканов за раз. Числа и названия после распознавания стоит проверить — отдельные слова бывают с ошибками.
Карточки товаров — не один файл, а тысячи
Проверим описания, фото и SEO-теги всего каталога, исправим ошибки нейросетью — 30 дней бесплатно, без привязки карты.
Частые вопросы
Если не нашли ответ — напишите нам.
Да, без регистрации и водяных знаков. Ограничения: до 20 МБ и до 60 страниц за раз; нужные страницы можно выбрать диапазоном, например 1-5.
Скачайте XLSX или CSV и загрузите файл в личном кабинете UniSeek — прайс-листы в этих форматах он принимает. Перед загрузкой проверьте названия столбцов.
Так бывает, когда в PDF нет линий таблицы или в ячейках длинный текст с переносами. Попробуйте выбрать страницы диапазоном и проверьте результат в Excel — обычно правится за минуту.
Скорее всего, в PDF обычный текст без табличной структуры, либо скан, на котором таблицу не удалось разглядеть. Для текста используйте «PDF в Word».
Да, включена галочка «Распознавать сканы»: страницу выпрямляем, распознаём и разбираем таблицу по линиям. Лучше всего работает на ровных сканах от 200 dpi; фото под углом, с тенями и вбок могут дать неточный результат.
Цены и количества становятся числами Excel. Артикулы с ведущим нулём (00123), длинные коды и штрихкоды остаются текстом — иначе Excel их испортит. Галочку можно снять.
Файл обрабатывается на нашем сервере: исходник удаляется сразу после обработки, результат хранится около 15 минут, чтобы вы успели скачать, и тоже удаляется. Мы не передаём файлы третьим лицам.