Назад

14.08.2026 г.

Smart Engines vs облачные OCR-провайдеры: где должны распознаваться документы

Сергей Усилин
Исполнительный директор Smart Engines, кандидат технических наук

По данным Роскомнадзора, в 2025 году в России произошло 118 случаев компрометации баз персональных данных, а в сеть попали более 52 млн записей. Недавняя утечка ПДн в Казахстане затронула три четверти населения страны – в открытом доступе оказались личные данные 15 млн жителей. Последствия утечек выходят далеко за рамки разовых штрафов и могут стать основанием для уголовного преследования. Поэтому подход к обработке данных становится критическим для любых цифровых сервисов.

Для систем, работающих с персональными, финансовыми и коммерческими данными, идеальным решением остается локальное распознавание. В статье рассказываем, какие риски возникают при передаче обработки документов облачным сервисам в контексте 152-ФЗ и почему архитектура систем распознавания Smart Engines идеально подходит для защищенных корпоративных процессов.

Облачный OCR выводит документы из-под контроля организации

Иногда компании выбирают наиболее простой, на первый взгляд, вариант и для решения задач распознавания документов выбирают готовые облачные OCR-сервисы. На практике это означает передачу всех операций с документами во внешний контур – на серверы провайдера, где к процессам обработки документов подключаются облачные верификаторы.

В этом процессе компания теряет контроль над документами и данными, а также условиями их хранения и обработки. Изображение документа передается по сети, обрабатывается на оборудовании третьей стороны и может проходить через несколько технических компонентов облачной платформы и ручных этапов обработки верификаторами. 

Кроме того, при оценке рисков важна зависимость от интернет-соединения, доступности API, скорости передачи файлов и текущей нагрузки на сервис.

Локальное распознавание документов устроено иначе. OCR-компонент размещается внутри инфраструктуры компании или непосредственно на пользовательском устройстве. Изображение документа не отправляется третьим лицам: распознавание начинается и завершается в контролируемом контуре. 

152-ФЗ: ответственность за данные не исчезает при передаче обработки документов провайдеру

Документы, поступающие в OCR-систему, содержат чувствительную информацию – ФИО, дату и место рождения, адрес, паспортные реквизиты, сведения о работе, доходах, счетах и представителях юридического лица. Поэтому выбор архитектуры распознавания напрямую связан с соблюдением требований 152-ФЗ.

Согласно части 5 статьи 6 152-ФЗ, если оператор поручает обработку персональных данных другому лицу, именно оператор отвечает перед субъектом за действия исполнителя. Иными словами, сбой или нарушение на стороне OCR-провайдера не освобождают от ответственности компанию, которая отправила документы в облако.

Финансовые последствия стали значительно серьезнее. За несвоевременное уведомление Роскомнадзора об утечке предусмотрен штраф от 1 до 3 млн рублей, а за саму утечку – до 15 млн рублей в зависимости от ее масштаба. При повторной утечке штраф может составить от 1 до 3% годовой выручки или капитала кредитной организации и достигать 500 млн рублей. Размеры санкций установлены статьей 13.11 КоАП РФ.

Поэтому использование облачных OCR-сервисов добавляет не просто технического подрядчика, а полный комплекс правовых и организационных рисков.

Локальное распознавание снижает риски утечки ПДн

В работе с чувствительными данными решения для распознавания документов в компании должны исключать передачу документов за пределы контролируемой инфраструктуры. Это позволяет выстроить процесс так, чтобы в нем не задействовались внешние хранилища, а у сотрудников сторонней организации не было доступа к данным.

При локальной обработке компания сама устанавливает состав технических мер защиты. OCR можно встроить в уже действующий защищенный контур организации. 

On-device-архитектура дополнительно позволяет распознавать документ непосредственно на смартфоне или в браузере. Это особенно важно для дистанционного банковского обслуживания, выездной идентификации, кадрового оформления и других сценариев, где документы поступают с пользовательских устройств.

Решение Smart Engines: распознавание остается там, где предъявляется документ

Решение для распознавания документов Smart Engines выполняет обработку на 100% локально – on-premise или on-device. Изображения и извлеченные сведения не передаются в облако, сторонним сервисам или верификаторам. Технология встраивается в инфраструктуру заказчика и подходит для идентификации физических лиц, KYB, ДБО, КДО, бухгалтерских, финансовых и других корпоративных процессов.

Основные характеристики решения:

  • Высокая скорость. Так, паспорт РФ на смартфоне распознается за 0,15 секунды, а серверная обработка достигает 125 паспортов в секунду на процессоре без GPU.
  • Высокая точность. Решение распознает печатный и рукописный текст на 100+ языках, извлекает реквизиты, таблицы, штрихкоды, чекбоксы, печати и подписи с точностью 99,9%. 
  • Распознавание в реальных условиях. Алгоритмы обрабатывают сканы и фотографии с бликами, тенями, низким разрешением и неравномерным освещением. Поддерживается съемка под углом, с веб-камеры и бюджетного смартфона.
  • Широкий охват документов. Решение поддерживает более 5 000 шаблонов и распознает паспорт РФ, паспорта, ID-карты, водительские удостоверения, виды на жительство и другие документы более чем 210 стран и территорий.
  • Легкая интеграция в корпоративные сценарии. Технология обрабатывает учредительные, регистрационные, бухгалтерские, финансовые и кадровые документы.
  • Антифрод документов. Решение выявляет признаки физического и цифрового вмешательства, проверяет согласованность реквизитов, обнаруживает пересъемку документа с экрана, следы обработки в графических редакторах и детектирует поддельные изображения, созданные с помощью современных генеративных моделей.

В результате решение закрывает ввод удостоверяющих, первичных, бухгалтерских, корпоративных и кадровых документов. Заказчик в свою очередь не передает персональные и чувствительные данные сторонним сервисам и сохраняет контроль над всем циклом обработки.

Smart Engines и облачный OCR: разница начинается с архитектуры

При сравнении OCR-систем, помимо функциональности, важно оценивать зависимость от внешней инфраструктуры и возможность контролировать каждый этап обработки.

КритерийОблачный OCR-сервисSmart Engines
АрхитектураОбработка во внешней инфраструктуре провайдера100% on-premise или on-device
Передача документовФайлы необходимо отправлять через сеть третьей сторонеИзображения и данные остаются в контуре заказчика или на устройстве пользователя
Контроль инфраструктурыКонтроль передается владельцу облачной платформыСерверы и доступы контролирует заказчик
Риски по 152-ФЗДаже в случае инцидентов на стороне облачного сервиса риски несет заказчик Нет передачи документа сторонним сервисам и рисков в процессе обработки документов
ТочностьЗависит от провайдера и подключенных верификаторов99,9%, включая печатные и рукописные данные на 100+ языках
ОхватНабор документов и языков ограничен возможностями конкретного сервиса5 000+ шаблонов, документы 210+ стран, 100+ языков
Условия съемкиТребования к входным изображениям определяет провайдерРабота с бликами, тенями, низким разрешением и съемкой под углом
АнтифродОграниченный набор проверокВыполняет более 600 проверок и покрывает полный спектр атак с поддельными документами – от переклейки фотографий до атак на предъявление

Облачный OCR делает сторонний сервис обязательной частью работы с каждым документом. Smart Engines исключает эту зависимость: распознавание выполняется внутри нужного канала обслуживания и не требует передачи изображений документов третьей стороне. Для бизнеса, работающего с чувствительными данными, это означает отсутствие  посредников в процессах обработки документов и полный контроль над ИТ-инфраструктурой.

Безопасность OCR начинается с архитектуры

Пока изображение отправляется в стороннюю систему, компания зависит от чужой инфраструктуры и получает риски, которыми не может управлять.

Локальная обработка устраняет саму необходимость такой передачи. Решение для распознавания документов Smart Engines работает на 100% on-premise и on-device, позволяя бизнесу обрабатывать документы без передачи данных третьим сторонам и снижать регуляторные и операционные риски.

Пишите, чтобы протестировать решение Smart Engines в сценариях вашей компании!

Содержание

Информация об авторе

Сергей Усилин
Исполнительный директор Smart Engines, кандидат технических наук
  • 60+ научных публикаций
  • 3 патента США
  • 30 патентов РФ

Сергей Усилин – российский ученый, изобретатель, эксперт в области распознавания документов. Один из первопроходцев в разработке антифрод-систем для детекции поддельных документов. Под началом Сергея Усилина был создан нейросетевой ансамбль “Шерлок”, который проверяет на подлинность документы всех стран мира по 600+ признакам и детектирует физические и цифровые подделки.

В настоящее время в Smart Engines Сергей Усилин отвечает за операционное управление компанией, координацию внедрения технологий в бизнес-процессы и развитие прикладных решений для клиентов и партнеров.