Специалист по извлечению данных из PDF — структурирование текстов@ kajalr547

2K $–13K $/мес
Опубликовано 03.10.2026

О позиции

Ищем специалиста по извлечению данных из PDF-документов. Вам нужно будет преобразовать PDF в чистые, хорошо структурированные UTF-8 .txt файлы.

Чем вы будете заниматься

  • Извлечение текста в правильном порядке чтения.
  • Четкая разметка заголовков как H1, H2 или H3.
  • Добавление заполнителей для изображений и диаграмм.
  • Конвертация таблиц в читаемый текст.
  • Сохранение сносок и примечаний в тексте.
  • Удаление артефактов, таких как номера страниц и лишние переносы строк.
  • Финальный вывод: один UTF-8 файл для каждого PDF.

Требования

  • Опыт работы с извлечением данных из PDF.
  • Знание инструментов, таких как Acrobat, pdftotext, Python (PyPDF2, pdfminer), OCR.
  • Внимание к деталям и точность.
Обязательные
0/1
Желательные
0/1
Бонус
0/1
Почему эта вакансия
6.5
6.5 из 10
оценка совпадения

Вакансия предлагает интересную задачу по извлечению данных из PDF-документов. Условия работы удалённые, что является плюсом. Однако зарплата не указана, что снижает привлекательность.

Формируем профиль успеха...

Анализируем требования вакансии и данные рынка

Загружаем обзор рынка...

Анализируем тренды рынка и спрос на навыки

Новости Data Processing

Загружаем новости отрасли...

Ищем релевантные статьи за последние 6 месяцев