Защищенные планшеты, портативные устройства и специализированные мобильные вычислительные решения от производителя оригинального оборудования (ODM) для промышленного применения.
Что такое технология оптического распознавания символов (OCR)?
Оптическое распознавание символов (OCR) — это процесс анализа и распознавания изображений текстовых материалов для получения информации о тексте и макете.
Подобно технологиям распознавания изображений и машинного зрения, процесс обработки данных в технологии оптического распознавания символов (OCR) также делится на этапы ввода, предварительной обработки, промежуточной обработки, постобработки и вывода.
входить
Для разных форматов изображений существуют разные форматы хранения и разные методы сжатия. В настоящее время используются OpenCV, CxImage и др.
Предварительная обработка – бинаризация
Большинство снимков, сделанных сегодня цифровыми камерами, являются цветными изображениями, содержащими огромное количество информации и не подходящими для технологии оптического распознавания символов (OCR).
Что касается содержимого изображения, мы можем просто разделить его на передний и задний план. Для того чтобы компьютер быстрее и эффективнее выполнял вычисления, связанные с распознаванием текста (OCR), необходимо сначала обработать цветное изображение, чтобы в нем осталась только информация о переднем и заднем плане. Бинаризацию также можно просто понимать как «черно-белое изображение».
снижение шума изображения
Для разных изображений определение шума может быть различным, и процесс шумоподавления в соответствии с характеристиками шума называется уменьшением шума.
коррекция наклона
Поскольку обычным пользователям при фотографировании документов сложно добиться идеального горизонтального и вертикального выравнивания, снимки неизбежно получаются искаженными, что требует коррекции с помощью программного обеспечения для обработки изображений.
Промежуточная обработка – анализ компоновки
Процесс разделения изображений в документе на абзацы и ветви называется анализом макета. Из-за разнообразия и сложности реальных документов этот этап по-прежнему нуждается в оптимизации.
вырезание персонажей
Из-за ограничений, связанных с условиями фотосъемки и письма, символы часто застревают, а ручки ломаются. Прямое использование таких изображений для анализа OCR значительно ограничит производительность распознавания текста. Поэтому необходима сегментация символов, то есть разделение различных символов.
распознавание символов
На начальном этапе в основном использовалось сопоставление шаблонов, а на более позднем — извлечение признаков. Из-за влияния таких факторов, как смещение текста, толщина штриха, обрыв пера, адгезия, вращение и т. д., сложность извлечения признаков значительно возросла.
Восстановление планировки
Люди надеются, что распознанный текст сохранит расположение элементов, аналогичное исходному изображению документа, а абзацы, их расположение и порядок будут сохранены в документах Word, PDF и т. д., и этот процесс называется восстановлением макета.
постобработка
В соответствии с контекстом конкретного языка, результат распознавания корректируется.
выход
Вывести распознанные символы в виде текста в определенном формате.
Каковы области применения портативных терминалов, использующих технологию оптического распознавания символов (OCR)?
С помощью портативного терминала КПК с установленным программным обеспечением для распознавания символов OCR можно реализовать множество задач, таких как: распознавание автомобильных номерных знаков, распознавание номеров контейнеров, распознавание весовых этикеток импортной говядины и баранины, распознавание машиночитаемых областей паспорта, распознавание показаний электросчетчиков, распознавание символов на стальных рулонах.
Шэньчжэнь: 8 этаж, здание А, Инновационный центр Чжихуэй, Промышленная зона Хан Чэн, район Баоань, Шэньчжэнь, Китай.
Гонконг: Комната 605, 6-й этаж, коммерческое здание FA Yuen, улица FA Yuen, 75-77, Монгкок, Коулун, Гонконг.