Назад

22.07.2026 г.

Блики, темнота и сложный ракурс больше не помеха: как Smart Engines распознает любые документы в реальных условиях

Сергей Усилин
Исполнительный директор Smart Engines, кандидат технических наук

Клиенты выбирают банк или цифровой сервис по совокупности факторов: надежности и безопасности, качеству обслуживания, удобству цифровых каналов и многих других. Однако все эти преимущества теряют значение, если уже во время онбординга пользователь сталкивается с техническими барьерами. Когда система заставляет по десять раз переснимать паспорт или водительское удостоверение, клиент может просто закрыть заявку и выбрать конкурента. В эпоху цифровой конкуренции ИИ должен подстраиваться под человека, а не заставлять человека приспосабливаться к ограничениям технологии.

Недавно мы рассказывали, как технология Smart Engines справляется с распознаванием паспорта РФ в самых суровых условиях. Но не паспортом единым. В этой статье – о том, как технологии компьютерного зрения помогают распознавать любые документы: от водительских удостоверений и свидетельств о рождении до первичной бухгалтерии, кадровых анкет и доверенностей. И главное – как это работает там, где качество или условия съемки оставляют желать лучшего.

Почему распознавание в реальных условиях – не прихоть, а необходимость

В реальных бизнес-процессах идеальные условия – скорее исключение, чем правило. Клиент фотографирует паспорт в темном коридоре, курьер снимает накладную на складе при тусклом освещении, сотрудник МФЦ сканирует документ с бликами от лампы, а водитель предъявляет удостоверение с выцветшими уголками и в пластиковом потертом чехле. Добавьте к этому разнообразие типов документов – сотни форматов, шрифтов, степеней защиты, расположения полей, – и вы получите среду, в которой традиционные OCR-системы дают сбой.

Для промышленной системы это не набор редких исключений, а обычный входной поток. Если OCR способна работать только с ровными и четкими сканами, нагрузка никуда не исчезает – она просто перекладывается на человека. Клиент снова фотографирует документ, сотрудник вручную переносит реквизиты, а оператор разбирает все случаи, с которыми не справилась автоматика. В онбординге это снижает конверсию, в логистике задерживает приемку товара, а в бэк-офисе превращает автоматизацию в очередь ручных проверок.

Кроме того, низкое качество изображения создает и более серьезный риск: слабая система распознавания может отклонить корректный документ или принять ошибочно распознанные данные за достоверные. Поэтому устойчивость к бликам, смазу, теням и геометрическим искажениям – не дополнительная функция, а базовое требование к промышленному распознаванию.

Технологии, которые видят больше, чем человек

Платформа Smart Engines объединяет технологии распознавания удостоверяющих и деловых документов в рамках единого нейросетевого стека. Система автоматически определяет тип документа, находит его границы и значимые области, извлекает реквизиты и возвращает структурированный результат вместе с показателями уверенности распознавания.

Возможности платформы включают:

  • распознавание российских паспортов, водительских удостоверений, ID-карт, виз и других удостоверяющих документов;
  • обработку первичной бухгалтерии, включая УПД, счета, счета-фактуры, акты, накладные и ТОРГ-12;
  • распознавание кадровых, регистрационных, юридических и корпоративных документов;
  • автоматическую классификацию входящего потока без предварительного выбора типа документа;
  • извлечение печатного, рукописного и смешанного текста;
  • работу с изображениями, содержащими блики, тени, смаз, недостаточное освещение, низкое разрешение и геометрические искажения;
  • обработку фотографий, сканов, PDF-файлов и видеопотока;
  • запуск на смартфоне, рабочей станции, сервере или непосредственно в браузере.

Платформа работает локально – на конечном устройстве или внутри инфраструктуры заказчика. Изображения документов и извлеченные данные не передаются во внешние облачные сервисы, а для распознавания не нужно подключение к интернету. Решения работают на обычных процессорах без использования GPU.

А теперь – к самому интересному: как решение выходит победителем из схватки с темнотой, кривыми ракурсами и трудноразборчивым рукописным текстом.

Низкое освещение: когда света нет, а распознать нужно

Одна из самых частых проблем в реальных сценариях – недостаток освещения. В отделениях банков и МФЦ, в складских помещениях, в полевых условиях, вечером на улице или при съемке на весу изображения с документами часто выглядят затемненными. Традиционные OCR-системы в таких условиях либо не находят текст, либо ошибаются в символах.

Простое повышение яркости не решает проблему: шумы могут усиливаться, а светлые области – терять детали. Поэтому промышленной OCR-системе недостаточно просто «осветлить» фотографию. Необходимо найти документ и его поля, оценить качество изображения и извлечь те данные, которые действительно различимы.

Алгоритмы Smart Engines рассчитаны на работу с недостаточным и неравномерным освещением, тенями, шумами и размытием. Система анализирует структуру документа, локализует значимые области и распознаёт реквизиты даже тогда, когда исходное изображение далеко от идеального.

Проективные искажения: когда документ снят под углом

Вторая по частоте проблема – съемка под углом. При съемке на смартфон пользователь редко держит документ строго параллельно камере. Поэтому на фотографии строки могут сжиматься, а символы – менять форму. Чем сильнее наклон, тем сложнее системе правильно определить границы документа и прочитать его содержимое.

Но для Smart Engines и это не проблема. Решение включает продвинутые алгоритмы коррекции проективных искажений. Оно детектирует границы документа, восстанавливает его геометрию и приводит изображение к виду, пригодному для распознавания. Поэтому мы умеем распознавать паспорт и другие документы книжного формата, даже если они частично сложены. 

Блики, смаз и перекрытия: как помогает видеопоток

Ламинированные документы, в том числе паспорт, ВУ и СНИЛС, легко бликуют. При съемке на весу изображение может смазаться, а часть реквизитов – оказаться перекрыты пальцем. Для обычной OCR-системы один неудачный снимок часто означает ошибку или просьбу переснять документ.

Smart Engines работает иначе: система распознает документ прямо в видеопотоке и применяет алгоритмы межкадровой интеграции результатов распознавания. Пока пользователь наводит камеру, она получает серию кадров, на которых одни и те же поля видны по-разному. На одном кадре реквизит закрыт бликом, на другом – размыт, а на третьем – читается четко.

Система ничего не додумывает и не пытается восстановить невидимый текст. Она использует только те кадры, на которых нужный участок документа действительно читается. Дополнительно технология оценивает помехи и качество каждого кадра – например, замечает блики, пальцы, посторонние предметы или неполное попадание документа в кадр.

Рукописный и смешанный текст: когда машина читает почерк

Третья проблема, с которой сталкиваются разработчики систем распознавания, – рукописный текст. Заполненные от руки анкеты, заявления, доверенности, кадровые документы, акты, договоры – все это может содержать рукописные поля, которые необходимо извлекать и структурировать. При этом почерк может быть разборчивым или нет, наклонным или прямым, с разным нажимом и размером букв. 

P.S. Подробнее о том, как мы учили систему работать с рукописным текстом, можно почитать здесь. А мы продолжаем.

В отличие от печатного текста, рукописный не подчиняется строгим правилам расположения символов. Буквы могут сливаться, выходить за строки, перекрывать друг друга. Кроме того, в одном документе часто сочетаются печатный текст – например, типографские реквизиты – и рукописные заполнения. Система должна корректно разделить эти слои и распознать каждый из них.

Smart Engines реализует гибридный подход, разбивая задачу на три подзадачи: 

  • Детекция наличия рукописи в документе;
  • Сегментация рукописной строки на отдельные символы;
  • Распознавание символов.

На этапе распознавания ключевая проблема – схожесть начертаний разных букв: например, фамилию «Петров» можно принять за «Нетров». Нейросеть, распознающая рукописные символы, спроектирована так, чтобы быть «толерантной» – возвращать одинаковые значения уверенности для похожих по начертанию букв. А уже постпроцессоры, учитывающие особенности каждого поля (например, что в поле «Дата рождения» должны быть цифры, а в поле «Фамилия» – буквы кириллицы), обрабатывают полученные результаты. Такой подход позволяет достичь высокой точности на рукописных текстах с нестандартным почерком. В смешанных документах – например, в договорах, где печатные обязанности сторон и реквизиты контрагента сочетаются с рукописными номерами, подписями и расшифровками – система обрабатывает оба типа информации одновременно, не смешивая их.

Что бизнес получает от распознавания в любых условиях

Внедрение технологии, устойчивой к реальным условиям съемки, дает бизнесу несколько ключевых преимуществ.

  • Рост конверсии в онбординге и клиентских сервисах. Клиенты больше не возвращаются с фразой «не могу сфотографировать документ, система не принимает». Сервис становится доступным с первого раза, независимо от того, где и как снят документ;
  • Сокращение операционных затрат. Ручная доработка плохих изображений, пересъемка документов, исправление ошибок распознавания – все это уходит в прошлое. Сотрудники тратят время на содержательные задачи, а не на перепечатку реквизитов;
  • Снижение регуляторных рисков. Технологии компьютерного зрения, способные анализировать защитные элементы даже на неидеальных изображениях, становятся последним рубежом обороны перед мошенниками. А точное извлечение реквизитов без домыслов гарантирует соблюдение 115-ФЗ и других регуляторных требований;
  • Единая платформа для всех типов документов. Бизнесу не нужно внедрять отдельные решения для паспортов, для водительских удостоверений, для первичной документации, для кадровых анкет и доверенностей. Одно платформенное решение покрывает весь спектр задач, снижая затраты на интеграцию, поддержку и обучение персонала.

Чтобы цифровизация документооборота в России стала по-настоящему эффективной, технологии распознавания должны работать не в лабораторных условиях, а там, где бизнес сталкивается с документами каждый день – в отделениях, на складах, в руках у клиентов. 

Именно для этого создано решение Smart Engines: чтобы распознавать любые документы в любых условиях, без компромиссов по качеству и скорости. Если ваш бизнес сталкивается с вызовами распознавания документов – пишите в Smart Engines!

Содержание

Информация об авторе

Сергей Усилин
Исполнительный директор Smart Engines, кандидат технических наук
  • 60+ научных публикаций
  • 2 патента США
  • 30 патентов РФ

Сергей Усилин – российский ученый, изобретатель, эксперт в области распознавания документов. Один из первопроходцев в разработке антифрод-систем для детекции поддельных документов. Под началом Сергея Усилина был создан нейросетевой ансамбль “Шерлок”, который проверяет на подлинность документы всех стран мира по 600+ признакам и детектирует физические и цифровые подделки.

В настоящее время в Smart Engines Сергей Усилин отвечает за операционное управление компанией, координацию внедрения технологий в бизнес-процессы и развитие прикладных решений для клиентов и партнеров.