PDF

Как сделать скан PDF с поиском: OCR пошагово

Поисковый PDF — это изображение страниц плюс текстовый слой OCR. Чтобы им можно было пользоваться, мало нажать «Распознать»: нужно правильно снять страницы и проверить критичные данные.

Сканированная страница PDF с выделяемым текстовым слоем OCR
Собственная иллюстрация FormatZ по теме материала.

Короткий ответ

Сделайте ровный контрастный скан, откройте его в OCR-программе, выберите язык документа и распознайте все страницы. Сохраните PDF с изображением страницы и поисковым текстовым слоем. Затем найдите несколько слов и вручную сверьте фамилии, даты, суммы и номера.

Сначала подготовьте изображение

OCR хуже работает с тенью у корешка, наклонёнными строками, бликами и мелким текстом. Для обычного печатного документа разумная отправная точка — около 300 dpi. Для мелкого шрифта может потребоваться более высокое разрешение. Руководство Tesseract по качеству входа отдельно разбирает разрешение, поворот, границы и контраст.

Схема создания поискового PDF из скана с проверкой OCR
OCR добавляет текстовый слой, но не гарантирует безошибочное распознавание.
  • Разверните страницу строго по вертикали.
  • Обрежьте стол и фон, но не номера страниц и подписи.
  • Исправьте поворот и заметный наклон строк.
  • Не применяйте агрессивный фильтр, который стирает тонкие буквы и печати.
  • Сохраните исходные сканы отдельно от обработанной копии.

Как запустить OCR

В выбранной OCR-программе укажите диапазон страниц и язык распознавания, затем выберите PDF с текстовым слоем. Названия команд различаются, но результат нужно проверять одинаково. Например, справка Microsoft по OCR в OneNote отдельно предупреждает, что качество зависит от изображения и необычное форматирование копируется плохо.

Если исходники лежат в JPG или PNG, их можно сначала собрать в JPG → PDF или PNG → PDF. Это создаёт PDF из изображений, но не обязательно добавляет OCR. После сборки всё равно проверьте, выделяется ли текст.

Проверка важнее процента распознавания

  1. Закройте и снова откройте результат.
  2. Найдите слово со средней страницы.
  3. Выделите две строки и вставьте их в простой текстовый редактор.
  4. Сверьте фамилии, даты, суммы, номера договоров и реквизиты с изображением.
  5. Проверьте начало, середину и конец, а также одну страницу с таблицей или печатью.
ДокументНастройка и проверка
Русский текст.Выберите русский язык; для смешанного текста добавьте английский, если программа позволяет.
Таблица.Проверяйте порядок столбцов после копирования.
Чек или факс.Нужен высокий контраст, но тонкие цифры нельзя «съесть» фильтром.
Рукопись.Обычный OCR может не справиться; нужна ручная расшифровка или специализированная модель.

Если текст не находится

Убедитесь, что программа сохранила searchable PDF, а не только набор картинок. Повторите распознавание с правильным языком. Если одна страница хуже остальных, переснимите именно её. Преобразование через PDF → TXT удобно для контрольного чтения, но структура таблиц и колонок может потеряться.

Если скан содержит персональные данные

Узнайте, отправляет ли OCR-программа файл в облако. Для паспортов, медицинских документов и закрытых договоров предпочтителен согласованный локальный процесс. После распознавания удалите временные копии по правилам вашей организации и не публикуйте результат по общей ссылке.

Что проверить в многостраничном документе

Не ограничивайтесь первой страницей. Автоподатчик может втянуть лист под углом, а середина пачки — оказаться бледнее. Выберите по одной странице из начала, середины и конца. Отдельно проверьте листы с мелким шрифтом, печатями и двумя колонками.

Если результат нужен для поиска, а не редактирования

Режим «изображение с возможностью поиска» сохраняет внешний вид скана и добавляет невидимый текст. Для переноса текста в новый документ потребуется более строгая проверка абзацев, таблиц и порядка чтения.

Пример контрольного запроса

В договоре найдите редкую фамилию, номер пункта и сумму. Затем скопируйте предложение со страницы, где есть печать. Если обычные слова находятся, но критичные цифры распознаны неверно, результат нельзя использовать для автоматического извлечения без ручной сверки.

Сверено 1 сентября 2026 года по документации Tesseract OCR и справке Microsoft OneNote, ссылки приведены рядом с настройками.

Скорее всего, внутри только изображения страниц. Нужен OCR и сохранение текстового слоя.
Для обычного печатного текста начните примерно с 300 dpi. Мелкий шрифт и слабый оригинал могут потребовать больше; качество нужно проверять по результату.
Нет. Особенно часто ошибаются похожие цифры и буквы, фамилии, суммы, печати и таблицы.