Как сделать скан PDF с поиском: OCR пошагово
Поисковый PDF — это изображение страниц плюс текстовый слой OCR. Чтобы им можно было пользоваться, мало нажать «Распознать»: нужно правильно снять страницы и проверить критичные данные.

Короткий ответ
Сделайте ровный контрастный скан, откройте его в OCR-программе, выберите язык документа и распознайте все страницы. Сохраните PDF с изображением страницы и поисковым текстовым слоем. Затем найдите несколько слов и вручную сверьте фамилии, даты, суммы и номера.
Сначала подготовьте изображение
OCR хуже работает с тенью у корешка, наклонёнными строками, бликами и мелким текстом. Для обычного печатного документа разумная отправная точка — около 300 dpi. Для мелкого шрифта может потребоваться более высокое разрешение. Руководство Tesseract по качеству входа отдельно разбирает разрешение, поворот, границы и контраст.
- Разверните страницу строго по вертикали.
- Обрежьте стол и фон, но не номера страниц и подписи.
- Исправьте поворот и заметный наклон строк.
- Не применяйте агрессивный фильтр, который стирает тонкие буквы и печати.
- Сохраните исходные сканы отдельно от обработанной копии.
Как запустить OCR
В выбранной OCR-программе укажите диапазон страниц и язык распознавания, затем выберите PDF с текстовым слоем. Названия команд различаются, но результат нужно проверять одинаково. Например, справка Microsoft по OCR в OneNote отдельно предупреждает, что качество зависит от изображения и необычное форматирование копируется плохо.
Если исходники лежат в JPG или PNG, их можно сначала собрать в JPG → PDF или PNG → PDF. Это создаёт PDF из изображений, но не обязательно добавляет OCR. После сборки всё равно проверьте, выделяется ли текст.
Проверка важнее процента распознавания
- Закройте и снова откройте результат.
- Найдите слово со средней страницы.
- Выделите две строки и вставьте их в простой текстовый редактор.
- Сверьте фамилии, даты, суммы, номера договоров и реквизиты с изображением.
- Проверьте начало, середину и конец, а также одну страницу с таблицей или печатью.
| Документ | Настройка и проверка |
|---|---|
| Русский текст. | Выберите русский язык; для смешанного текста добавьте английский, если программа позволяет. |
| Таблица. | Проверяйте порядок столбцов после копирования. |
| Чек или факс. | Нужен высокий контраст, но тонкие цифры нельзя «съесть» фильтром. |
| Рукопись. | Обычный OCR может не справиться; нужна ручная расшифровка или специализированная модель. |
Если текст не находится
Убедитесь, что программа сохранила searchable PDF, а не только набор картинок. Повторите распознавание с правильным языком. Если одна страница хуже остальных, переснимите именно её. Преобразование через PDF → TXT удобно для контрольного чтения, но структура таблиц и колонок может потеряться.
Если скан содержит персональные данные
Узнайте, отправляет ли OCR-программа файл в облако. Для паспортов, медицинских документов и закрытых договоров предпочтителен согласованный локальный процесс. После распознавания удалите временные копии по правилам вашей организации и не публикуйте результат по общей ссылке.
Что проверить в многостраничном документе
Не ограничивайтесь первой страницей. Автоподатчик может втянуть лист под углом, а середина пачки — оказаться бледнее. Выберите по одной странице из начала, середины и конца. Отдельно проверьте листы с мелким шрифтом, печатями и двумя колонками.
Если результат нужен для поиска, а не редактирования
Режим «изображение с возможностью поиска» сохраняет внешний вид скана и добавляет невидимый текст. Для переноса текста в новый документ потребуется более строгая проверка абзацев, таблиц и порядка чтения.
Пример контрольного запроса
В договоре найдите редкую фамилию, номер пункта и сумму. Затем скопируйте предложение со страницы, где есть печать. Если обычные слова находятся, но критичные цифры распознаны неверно, результат нельзя использовать для автоматического извлечения без ручной сверки.
Сверено 1 сентября 2026 года по документации Tesseract OCR и справке Microsoft OneNote, ссылки приведены рядом с настройками.
Частые вопросы
Читайте также
АрхивыНужен один файл из RAR, ZIP или 7Z: как скачать его, не распаковывая весь архив
Как открыть архив, найти нужный документ и извлечь только его, не скачивая содержимое повторно и не создавая новый архив.
ОфисExcel весит 300 МБ и тормозит: семь мест, где прячется лишний размер
Как уменьшить огромный XLSX: удалить пустые строки с форматированием, сжать изображения, проверить стили и сохранить безопасную копию.
iPhoneНовый iPhone 17e уже здесь: что его камера снимает на самом деле и как открыть файлы везде
Новый iPhone 17e: камера 48 МП, HEIF, HDR-видео и понятные настройки для совместимости с Windows, Android и телевизорами.