Технология распознавания и извлечения текста из изображений и сканированных документов.
OCR (Optical Character Recognition, оптическое распознавание символов) — это технология, распознающая и извлекающая текст из изображений: сканированных документов, фотографий, скриншотов — превращая визуальное изображение текста в редактируемый и машиночитаемый формат, с которым уже можно работать программно (искать, копировать, анализировать).
Ранние системы OCR требовали чёткого печатного текста и хорошего качества скана для приемлемой точности. Современные системы на основе нейросетевых архитектур существенно устойчивее к искажениям — справляются с не идеально ровным сканированием, фотографиями документов под углом, и даже с распознаванием рукописного текста, хотя точность здесь остаётся ниже, чем для печатного.
OCR — часто первый шаг в автоматизации документооборота компании: например, сканы счетов или договоров сначала распознаются через OCR, а затем извлечённый текст анализируется языковой моделью для автоматического заполнения нужных полей в учётной системе.
Нет, точность распознавания рукописного текста в среднем ниже из-за большого разнообразия почерков, хотя современные модели существенно продвинулись и в этой задаче.
Фотография — это просто изображение, в котором нельзя ни найти текст, ни скопировать его программно. OCR превращает изображение текста в реальный редактируемый и анализируемый текстовый формат.
Чаще всего вместе: OCR извлекает текст из изображения, а затем этот текст анализируется языковой моделью или NLP-системой для извлечения нужной информации или принятия решений.