Клиенты выбирают банк или цифровой сервис по совокупности факторов: надежности и безопасности, качеству обслуживания, удобству цифровых каналов и многих других. Однако все эти преимущества теряют значение, если уже во время онбординга пользователь сталкивается с техническими барьерами. Когда система заставляет по десять раз переснимать паспорт или водительское удостоверение, клиент может просто закрыть заявку и выбрать конкурента. В эпоху цифровой конкуренции ИИ должен подстраиваться под человека, а не заставлять человека приспосабливаться к ограничениям технологии.
Недавно мы рассказывали, как технология Smart Engines справляется с распознаванием паспорта РФ в самых суровых условиях. Но не паспортом единым. В этой статье – о том, как технологии компьютерного зрения помогают распознавать любые документы: от водительских удостоверений и свидетельств о рождении до первичной бухгалтерии, кадровых анкет и доверенностей. И главное – как это работает там, где качество или условия съемки оставляют желать лучшего.
Почему распознавание в реальных условиях – не прихоть, а необходимость
В реальных бизнес-процессах идеальные условия – скорее исключение, чем правило. Клиент фотографирует паспорт в темном коридоре, курьер снимает накладную на складе при тусклом освещении, сотрудник МФЦ сканирует документ с бликами от лампы, а водитель предъявляет удостоверение с выцветшими уголками и в пластиковом потертом чехле. Добавьте к этому разнообразие типов документов – сотни форматов, шрифтов, степеней защиты, расположения полей, – и вы получите среду, в которой традиционные OCR-системы дают сбой.
Для промышленной системы это не набор редких исключений, а обычный входной поток. Если OCR способна работать только с ровными и четкими сканами, нагрузка никуда не исчезает – она просто перекладывается на человека. Клиент снова фотографирует документ, сотрудник вручную переносит реквизиты, а оператор разбирает все случаи, с которыми не справилась автоматика. В онбординге это снижает конверсию, в логистике задерживает приемку товара, а в бэк-офисе превращает автоматизацию в очередь ручных проверок.
Кроме того, низкое качество изображения создает и более серьезный риск: слабая система распознавания может отклонить корректный документ или принять ошибочно распознанные данные за достоверные. Поэтому устойчивость к бликам, смазу, теням и геометрическим искажениям – не дополнительная функция, а базовое требование к промышленному распознаванию.
Технологии, которые видят больше, чем человек
Платформа Smart Engines объединяет технологии распознавания удостоверяющих и деловых документов в рамках единого нейросетевого стека. Система автоматически определяет тип документа, находит его границы и значимые области, извлекает реквизиты и возвращает структурированный результат вместе с показателями уверенности распознавания.
Возможности платформы включают:
- распознавание российских паспортов, водительских удостоверений, ID-карт, виз и других удостоверяющих документов;
- обработку первичной бухгалтерии, включая УПД, счета, счета-фактуры, акты, накладные и ТОРГ-12;
- распознавание кадровых, регистрационных, юридических и корпоративных документов;
- автоматическую классификацию входящего потока без предварительного выбора типа документа;
- извлечение печатного, рукописного и смешанного текста;
- работу с изображениями, содержащими блики, тени, смаз, недостаточное освещение, низкое разрешение и геометрические искажения;
- обработку фотографий, сканов, PDF-файлов и видеопотока;
- запуск на смартфоне, рабочей станции, сервере или непосредственно в браузере.
Платформа работает локально – на конечном устройстве или внутри инфраструктуры заказчика. Изображения документов и извлеченные данные не передаются во внешние облачные сервисы, а для распознавания не нужно подключение к интернету. Решения работают на обычных процессорах без использования GPU.
А теперь – к самому интересному: как решение выходит победителем из схватки с темнотой, кривыми ракурсами и трудноразборчивым рукописным текстом.
Низкое освещение: когда света нет, а распознать нужно
Одна из самых частых проблем в реальных сценариях – недостаток освещения. В отделениях банков и МФЦ, в складских помещениях, в полевых условиях, вечером на улице или при съемке на весу изображения с документами часто выглядят затемненными. Традиционные OCR-системы в таких условиях либо не находят текст, либо ошибаются в символах.
Простое повышение яркости не решает проблему: шумы могут усиливаться, а светлые области – терять детали. Поэтому промышленной OCR-системе недостаточно просто «осветлить» фотографию. Необходимо найти документ и его поля, оценить качество изображения и извлечь те данные, которые действительно различимы.
Алгоритмы Smart Engines рассчитаны на работу с недостаточным и неравномерным освещением, тенями, шумами и размытием. Система анализирует структуру документа, локализует значимые области и распознаёт реквизиты даже тогда, когда исходное изображение далеко от идеального.
Проективные искажения: когда документ снят под углом
Вторая по частоте проблема – съемка под углом. При съемке на смартфон пользователь редко держит документ строго параллельно камере. Поэтому на фотографии строки могут сжиматься, а символы – менять форму. Чем сильнее наклон, тем сложнее системе правильно определить границы документа и прочитать его содержимое.
Но для Smart Engines и это не проблема. Решение включает продвинутые алгоритмы коррекции проективных искажений. Оно детектирует границы документа, восстанавливает его геометрию и приводит изображение к виду, пригодному для распознавания. Поэтому мы умеем распознавать паспорт и другие документы книжного формата, даже если они частично сложены.
Блики, смаз и перекрытия: как помогает видеопоток
Ламинированные документы, в том числе паспорт, ВУ и СНИЛС, легко бликуют. При съемке на весу изображение может смазаться, а часть реквизитов – оказаться перекрыты пальцем. Для обычной OCR-системы один неудачный снимок часто означает ошибку или просьбу переснять документ.
Smart Engines работает иначе: система распознает документ прямо в видеопотоке и применяет алгоритмы межкадровой интеграции результатов распознавания. Пока пользователь наводит камеру, она получает серию кадров, на которых одни и те же поля видны по-разному. На одном кадре реквизит закрыт бликом, на другом – размыт, а на третьем – читается четко.
Система ничего не додумывает и не пытается восстановить невидимый текст. Она использует только те кадры, на которых нужный участок документа действительно читается. Дополнительно технология оценивает помехи и качество каждого кадра – например, замечает блики, пальцы, посторонние предметы или неполное попадание документа в кадр.
Рукописный и смешанный текст: когда машина читает почерк
Третья проблема, с которой сталкиваются разработчики систем распознавания, – рукописный текст. Заполненные от руки анкеты, заявления, доверенности, кадровые документы, акты, договоры – все это может содержать рукописные поля, которые необходимо извлекать и структурировать. При этом почерк может быть разборчивым или нет, наклонным или прямым, с разным нажимом и размером букв.
P.S. Подробнее о том, как мы учили систему работать с рукописным текстом, можно почитать здесь. А мы продолжаем.
В отличие от печатного текста, рукописный не подчиняется строгим правилам расположения символов. Буквы могут сливаться, выходить за строки, перекрывать друг друга. Кроме того, в одном документе часто сочетаются печатный текст – например, типографские реквизиты – и рукописные заполнения. Система должна корректно разделить эти слои и распознать каждый из них.
Smart Engines реализует гибридный подход, разбивая задачу на три подзадачи:
- Детекция наличия рукописи в документе;
- Сегментация рукописной строки на отдельные символы;
- Распознавание символов.
На этапе распознавания ключевая проблема – схожесть начертаний разных букв: например, фамилию «Петров» можно принять за «Нетров». Нейросеть, распознающая рукописные символы, спроектирована так, чтобы быть «толерантной» – возвращать одинаковые значения уверенности для похожих по начертанию букв. А уже постпроцессоры, учитывающие особенности каждого поля (например, что в поле «Дата рождения» должны быть цифры, а в поле «Фамилия» – буквы кириллицы), обрабатывают полученные результаты. Такой подход позволяет достичь высокой точности на рукописных текстах с нестандартным почерком. В смешанных документах – например, в договорах, где печатные обязанности сторон и реквизиты контрагента сочетаются с рукописными номерами, подписями и расшифровками – система обрабатывает оба типа информации одновременно, не смешивая их.
Что бизнес получает от распознавания в любых условиях
Внедрение технологии, устойчивой к реальным условиям съемки, дает бизнесу несколько ключевых преимуществ.
- Рост конверсии в онбординге и клиентских сервисах. Клиенты больше не возвращаются с фразой «не могу сфотографировать документ, система не принимает». Сервис становится доступным с первого раза, независимо от того, где и как снят документ;
- Сокращение операционных затрат. Ручная доработка плохих изображений, пересъемка документов, исправление ошибок распознавания – все это уходит в прошлое. Сотрудники тратят время на содержательные задачи, а не на перепечатку реквизитов;
- Снижение регуляторных рисков. Технологии компьютерного зрения, способные анализировать защитные элементы даже на неидеальных изображениях, становятся последним рубежом обороны перед мошенниками. А точное извлечение реквизитов без домыслов гарантирует соблюдение 115-ФЗ и других регуляторных требований;
- Единая платформа для всех типов документов. Бизнесу не нужно внедрять отдельные решения для паспортов, для водительских удостоверений, для первичной документации, для кадровых анкет и доверенностей. Одно платформенное решение покрывает весь спектр задач, снижая затраты на интеграцию, поддержку и обучение персонала.
Чтобы цифровизация документооборота в России стала по-настоящему эффективной, технологии распознавания должны работать не в лабораторных условиях, а там, где бизнес сталкивается с документами каждый день – в отделениях, на складах, в руках у клиентов.
Именно для этого создано решение Smart Engines: чтобы распознавать любые документы в любых условиях, без компромиссов по качеству и скорости. Если ваш бизнес сталкивается с вызовами распознавания документов – пишите в Smart Engines!