Искусственный интеллект автоматически определяет тип документа, извлекает ключевые реквизиты и подготавливает данные для регистрации в СЭД и ECM-системах без ручного ввода. Решение распознает договоры, счета, акты, письма, заявления, кадровые и бухгалтерские документы, формируя структурированный результат. Это позволяет сократить время регистрации документов, снизить количество ошибок ручного ввода и ускорить обработку входящего потока документов.
Технология Smart Engines применяет уникальные Хаф-сети для интеллектуального выравнивания, разглаживания и нормализации изображений документов перед распознаванием. Алгоритмы ИИ автоматически устраняют перекосы, деформации страниц, изгибы бумаги и геометрические искажения, возникающие при сканировании и мобильной съемке. Это обеспечивает высокую точность извлечения данных даже при работе с документами, снятыми в «неидеальных» условиях.
Система обеспечивает полностью автоматический ввод документов на сканах и фотографиях в СЭД и ECM-платформы без необходимости ручной сортировки и перепечатки данных. Искусственный интеллект извлекает реквизиты документа и предоставляет структурированный результат для интеграции в корпоративные системы. Решение позволяет значительно снизить нагрузку на сотрудников, ускорить обработку документов и повысить качество данных в цифровом архиве компании.
Система Smart Engines использует современные алгоритмы бинаризации изображений для повышения качества распознавания корпоративных документов любой сложности. Искусственный интеллект надежно распознает документы, даже если на изображении присутствуют шумы, артефакты сканирования и дефекты печати. Это обеспечивает высокоточное распознавание данных даже при работе с частично поврежденными документами.
Технология Smart Engines автоматизирует обработку входящей корреспонденции для канцелярий, сервисных центров и других отделов. Искусственный интеллект распознает письма, обращения, заявления и сопроводительные документы, автоматически извлекая данные отправителя, дату, номер и другие реквизиты для регистрации в СЭД. Это позволяет сократить время обработки входящих документов и ускорить маршрутизацию документов между подразделениями.
Архитектура Smart Engines обеспечивает высокоскоростную обработку больших массивов документов для массовой оцифровки архивов и потокового ввода данных в СЭД/ECM. Решение эффективно масштабируется под любые корпоративные нагрузки и позволяет обрабатывать сотни тысяч страниц без использования GPU и усложнения инфраструктуры. Высокая производительность системы помогает ускорить цифровую трансформацию документооборота и снизить затраты на обработку архивов.
Система поддерживает все основные форматы файлов и изображений: JPEG (JPG), PNG, TIFF, многостраничные PDF, а также сканы и фотографии документов. Искусственный интеллект автоматически извлекает текст и реквизиты независимо от качества входящего изображения. Это позволяет применять решение для потоковой оцифровки архивов, ввода данных из документов с помощью мобильных устройств, а также в других корпоративных сценариях.
Технология Smart Engines подходит для массовой оцифровки бумажных архивов предприятий с возможностью автоматического экспорта в PDF с текстовым слоем. Система распознает содержимое архивных документов, делая их доступными для полнотекстового поиска, индексации и быстрого доступа из ECM-систем. Это позволяет существенно сократить время работы с архивами, ускорить поиск информации и быстро переводить бумажные фонды в цифровой формат без ручной обработки документов.
Система Smart Engines работает полностью локально в инфраструктуре организации без передачи документов и данных во внешние облачные сервисы. Обработка выполняется внутри защищенного контура заказчика, что обеспечивает высокий уровень конфиденциальности и соответствие требованиям информационной безопасности. Решение подходит для банков, государственных организаций, промышленности и компаний, работающих с коммерческой тайной и персональными данными.
Программное обеспечение на базе искусственного интеллекта для распознавания в СЭД и ECM позволяет автоматически вводить документы в цифровой контур организации без ручной обработки. Решение классифицирует бухгалтерские и корпоративные документы, извлекает реквизиты, подготавливает материалы к регистрации в системе, распознает входящую корреспонденцию с экспортом в PDF с текстовым слоем. Система работает со сканами, фотографиями и многостраничными PDF, включая изображения низкого качества. Используются современные методы бинаризации, выравнивания и нормализации документов, а также компактные 4.6-битные нейросети для быстрого распознавания на CPU без GPU. ПО работает полностью в контуре заказчика, обрабатывая до 1800 страниц в минуту на сервере.
DocEngine engine = DocEngine.Create(<PATH_TO_CONFIGURATION_FILE>, true);
DocSessionSettings settings = engine.CreateSessionSettings();
settings.SetCurrentMode("primary_accounting");
settings.AddEnabledDocumentTypes("*");
DocSession session = engine.SpawnSession(settings, <PERSONALIZED_SIGNATURE>);
DocProcessingSettings proc_settings = session.CreateProcessingSettings();
Image image = Image.FromFile(<PATH_TO_IMAGE>);
session.ProcessImage(image, proc_settings);
DocResult result = session.GetCurrentResult();
Document document = result.DocumentsBegin().GetDocument();
for (DocTextFieldsIterator iterator = doc.TextFieldsBegin(); !iterator.Equals(doc.TextFieldsEnd()); iterator.Advance()) {
String name = iterator.GetField().GetBaseFieldInfo().GetName();
String value = iterator.GetField().GetOcrString().GetFirstString().GetCStr();
}
std::unique_ptr<se::doc::DocEngine> engine(se::doc::DocEngine::Create(<PATH_TO_CONFIGURATION_FILE>, true));
std::unique_ptr<se::doc::DocSessionSettings> settings(engine->CreateSessionSettings());
settings->SetCurrentMode("primary_accounting");
settings->AddEnabledDocumentTypes("*");
std::unique_ptr<se::doc::DocSession> session(engine->SpawnSession(*settings, <PERSONALIZED_SIGNATURE>));
std::unique_ptr<se::doc::DocProcessingSettings> proc_settings(session->CreateProcessingSettings());
std::unique_ptr<se::common::Image> image(se::common::Image::FromFile(<PATH_TO_IMAGE>));
session->ProcessImage(*image, proc_settings.get());
const se::doc::DocResult& result = session->GetCurrentResult();
const se::doc::Document& doc = result.DocumentsBegin().GetDocument();
for (auto iterator = doc.TextFieldsBegin(); iterator != doc.TextFieldsEnd(); ++iterator) {
std::string name = iterator.GetFieldPtr()->GetBaseFieldInfo().GetName();
std::string value = iterator.GetFieldPtr()->GetOcrString().GetFirstString().GetCStr();
}
DocEngine engine = DocEngine.Create(<PATH_TO_CONFIGURATION_FILE>, true);
DocSessionSettings settings = engine.CreateSessionSettings();
settings.SetCurrentMode("primary_accounting");
settings.AddEnabledDocumentTypes("*");
DocSession session = engine.SpawnSession(session_settings, <PERSONALIZED_SIGNATURE>);
DocProcessingSettings proc_settings = session.CreateProcessingSettings();
Image image = Image.FromFile(<PATH_TO_IMAGE>);
session.ProcessImage(image, proc_settings);
DocResult result = session.GetCurrentResult();
doc_it = recog_result.DocumentsBegin()
Document doc = recog_result.DocumentsBegin().GetDocument();
for (DocTextFieldsIterator iterator = doc.TextFieldsBegin(); !iterator.Equals(doc.TextFieldsEnd()); iterator.Advance()) {
String name = iterator.GetField().GetBaseFieldInfo().GetName();
String value = iterator.GetField().GetOcrString().GetFirstString().GetCStr());
}
engine = pydocengine.DocEngine.Create(<PATH_TO_CONFIGURATION_FILE>)
settings = engine.CreateSessionSettings()
settings.SetCurrentMode("primary_accounting")
settings.AddEnabledDocumentTypes("*")
session = engine.SpawnSession(settings, <PERSONALIZED_SIGNATURE>)
proc_settings = session.CreateProcessingSettings()
image = pydocengine.Image.FromFile(<PATH_TO_IMAGE>)
session.ProcessImage(image, proc_settings)
result = session.GetCurrentResult()
doc_it = recog_result.DocumentsBegin()
doc = recog_result.DocumentsBegin().GetDocument()
iterator = doc.TextFieldsBegin()
while(iterator != doc.TextFieldsEnd()):
name = iterator.GetField().GetBaseFieldInfo().GetName()
value = iterator.GetField().GetOcrString().GetFirstString().GetCStr()
iterator.Advance()
Уверенность распознавания, координаты объектов, вырезание полей и документов
Возврат зоны принятия решения для проверок подлинности
Система позволяет автоматически вводить данные из документов в цифровой контур организации без ручной обработки. Решение классифицирует бухгалтерские, кадровые и корпоративные документы, извлекает реквизиты и возвращает структурированные данные для регистрации в СЭД/ECM. Это помогает ускорить обработку входящего потока документов, избежать ошибок ручного ввода и повысить качество данных в корпоративных ИС.
Система поддерживает все основные форматы файлов и изображений: JPEG (JPG), PNG, TIFF, PDF, а также сканы и фотографии архивных документов. Решение автоматически распознает все данные из одностраничных и многостраничных документов. Искусственный интеллект автоматически извлекает текст и реквизиты независимо от формата файла и качества изображения.
Да. Технология Smart Engines предназначена для высокоточной потоковой оцифровки архивов и бумажных фондов в компаниях. Система выполняет полнотекстовое распознавание архивных документов с экспортом в PDF с текстовым слоем, делая возможным поиск по словам и ключевым фразам и быстрый доступ из ECM-систем. Решение помогает значительно ускорить цифровизацию архивов и сократить затраты на перенос документов в цифровой формат.
Да. Система автоматически распознает входящую корреспонденцию любого типа: письма, заявления, обращения, сопроводительные документы и внутренние служебные материалы. Искусственный интеллект извлекает реквизиты отправителя, дату, регистрационные номера, содержимое документов и другую информацию для последующей регистрации в СЭД. Это позволяет ускорить документооборот и минимизировать ошибки при обработке входящих писем.
Технология Smart Engines обрабатывает до 1800 страниц в минуту на одном сервере без GPU и масштабируется под любые корпоративные нагрузки. Применение сверхкомпактных 4.6-битных нейросетей позволяет минимизировать требования к инфраструктуре и сократить затраты на внедрение и эксплуатацию системы в компаниях.
Да. Система использует методы бинаризации изображений документов, а также интеллектуальные алгоритмы выравнивания, разглаживания и нормализации. Искусственный интеллект автоматически устраняет шумы, артефакты сканирования, дефекты печати, а также перекосы и искажения, обеспечивая высокое качество распознавания даже старых и частично поврежденных документов.
Да. Технология автоматически выполняет поиск границ и коррекцию проективных искажений документа на фотографиях. Алгоритмы ИИ автоматически устраняют артефакты, возникающие при мобильной съемке, и обеспечивают высокоточное извлечение данных из документов, сфотографированных в условиях реальной жизни.
Решение обеспечивает высокоточное распознавание печатного и рукописного текста из документов с качеством до 99,9%. Система надежно работает со сканами и фотографиями с шумами, бликами, тенями, размытием и дефектами печати. Алгоритмы искусственного интеллекта обеспечивают автоматическое извлечение данных даже из документов на изображениях низкого качества.
Да. Искусственный интеллект распознает таблицы, штампы, печати, служебные отметки, рукописные пометки и полностью рукописные документы. Система возвращает результаты распознавания в структурированном виде для быстрой интеграции в СЭД и ECM. Решение поддерживает обработку печатных, рукописных и смешанных текстов, где одновременно присутствуют печатные и рукописные фрагменты.
Да. Решение распознает документы полностью в защищенном контуре заказчика без передачи изображений и данных на внешние серверы. Все документы и извлеченные данные обрабатываются локально внутри инфраструктуры организации без отправки в облачные сервисы. Это обеспечивает высокий уровень безопасности данных и полное соответствие требованиям по защите персональных данных и коммерческой тайны.