0 1 0 1 0 1 0 1 0 1 0 1 0 1 0 1 0 1 0 1 0 1 0 1 0
OCR: изображение и PDF в текст
Извлекайте текст из изображения, скриншота или PDF. В PDF инструмент объединяет собственный текст документа —включая подписи и поля— с оптическим распознаванием символов (OCR) изображений. Весь процесс происходит в вашем браузере, файл не загружается ни на один сервер.

Перетащите изображение или PDF либо нажмите, чтобы выбрать

PDF, PNG, JPEG, WebP, GIF, BMP

Выберите один или несколько языков, присутствующих на изображении

Как это работает

OCR (оптическое распознавание символов) превращает текст внутри изображения или PDF —фотографии, скриншота или отсканированного документа— в редактируемый текст, который можно скопировать, найти или вставить куда угодно.

Вы можете выбрать один или несколько языков, чтобы повысить точность: при указании правильного языка движок лучше распознаёт диакритические знаки, специальные символы и слова целиком. При первом использовании языка его модель загружается и затем сохраняется для следующих раз.

Всё распознавание происходит в вашем браузере с помощью WebAssembly: файл не загружается ни на один сервер. Результат включает оценку достоверности, чтобы вы знали, насколько надёжным было распознавание.

Сценарии использования

  • Скопировать текст со скриншота, когда его нельзя выделить.
  • Оцифровать отсканированный документ, счёт или чек для редактирования.
  • Извлечь фрагмент кода или сообщение об ошибке с фотографии.
  • Восстановить текст с изображения, чтобы перевести или найти его.
  • Извлечь текст из PDF —цифрового или отсканированного— для повторного использования.

Часто задаваемые вопросы

Загружается ли моё изображение на какой-либо сервер?

Нет. Распознавание выполняется полностью в вашем браузере; изображение никогда не покидает ваше устройство. Загружаются только выбранные вами языковые модели, один раз.

Зачем выбирать язык текста?

У каждого языка своя обученная модель. Выбор правильного языка заметно повышает точность, особенно с диакритикой и специфическими символами. Если на изображении смешаны языки, можно выбрать сразу несколько.

Как получить лучшие результаты?

Используйте чёткие, хорошо освещённые изображения с хорошим контрастом между текстом и фоном. Горизонтальный текст без искажений распознаётся лучше, чем фотографии под углом, размытые или рукописные.

Какие форматы можно использовать?

Можно использовать изображения в обычных форматах (PNG, JPEG, WebP, GIF и BMP), а также файлы PDF. Для документов скриншот или скан в хорошем разрешении даёт лучшие результаты.

Как обрабатываются PDF?

Они обрабатываются постранично, объединяя весь доступный текст: собственный текст PDF —включая поля форм и цифровые подписи— извлекается напрямую и точно, а текст внутри изображений дополнительно распознаётся с помощью OCR. «Цифровые» PDF читаются мгновенно; отсканированные или с большим количеством изображений могут занять больше времени.