Система Smart Engines формирует высокоточный текстовый вывод, оптимизированный для обработки большими языковыми моделями (LLM). Технология возвращает весь оцифрованный текст без искажений и потери исходной структуры, что позволяет значительно повысить качество данных для ИИ-агентов и упростить интеграцию с AI-системами.
Технология Smart Engines обеспечивает омнифонтовое распознавание текста более чем на 100 языках мира независимо от гарнитуры, начертания и качества печати. Система одинаково эффективно работает с латиницей, кириллицей, арабской вязью, китайскими и японскими иероглифами, корейским письмом и другими сложными системами письменности.
Система Smart Engines использует наиболее передовые нейросетевые алгоритмы для поиска и локализации текста на изображениях документов любой сложности. Искусственный интеллект с высочайшей точностью определяет текстовые области и извлекает данные даже на низкокачественных сканах и фотографиях, включая изображения с артефактами сканирования, шумами, перекосами, тенями и сложным фоном.
Система автоматически определяет тип документа на фото и сканах и извлекает ключевые реквизиты из деловых документов РФ и документов, удостоверений личности всего мира. Технология Smart Engines поддерживает потоковую обработку больших массивов документов, ускоряя ввод данных, проверку и автоматизацию бизнес-процессов.
Искусственный интеллект извлекает любой печатный, рукописный и смешанный текст, включая трудноразборчивый почерк и пометки, сделанные от руки. Для последующей обработки NLP-моделями система возвращает знакоместа, альтернативы и всю геометрию, позволяя строить высокоточные сценарии анализа, обработки и принятия решений с помощью ИИ-агентов.
Система Smart Engines обеспечивает сверхбыструю обработку документов — до 1800 страниц в минуту на одном сервере без использования GPU. Архитектура решения позволяет масштабировать технологию под любые объемы нагрузки без усложнения существующей ИТ-инфраструктуры, обеспечивая максимальную производительность и минимальные затраты на вычислительные ресурсы.
Система извлекает весь текст и реквизиты из документов в исходном виде «as is» — без интерпретации и вмешательства в исходные данные. В отличие от LLM, склонных к галлюцинациям, искусственный интеллект Smart Engines обеспечивает точное и проверяемое распознавание, необходимое для юридически значимых и бизнес-критичных процессов.
Технология Smart Engines с высочайшей точностью распознает документы, снятые в условиях реальной жизни: при плохом освещении, сложном фоне, размытии, перекосах, бликах и низком разрешении. Алгоритмы искусственного интеллекта устойчивы к артефактам на фотографиях и сканах, обеспечивая нормализацию и точное извлечение данных даже в случаях, где не справляются традиционные OCR-инструменты.
Решение обрабатывает документы полностью локально внутри инфраструктуры заказчика без передачи данных во внешние сервисы. Это защищает конфиденциальную информацию от неавторизованного доступа и утечек, а также обеспечивает полное соответствие требованиям ИБ и законодательства в области обработки данных.
Надежное и точное распознавание текстов для создания ИИ-агентов на базе LLM‑моделей, где критически важна полнота, скорость и особенно достоверность данных. Система распознает печатный текст на 100+ языках, включая арабский, китайский, японский и корейский, кириллический, рукописный и смешанный тексты. Для результатов распознавания возвращает знакоместа, альтернативы и всю геометрию. ПО работает с фото и сканами низкого качества. Поддерживается поиск, выравнивание и нормализация документа, распознавание таблиц и многостраничных файлов, классификация документов и выделение реквизитов. Решение работает автономно в контуре заказчика, не требует GPU, обрабатывает до 1800 страниц в минуту на сервере.
DocEngine engine = DocEngine.Create(<PATH_TO_CONFIGURATION_FILE>, true);
DocSessionSettings settings = engine.CreateSessionSettings();
settings.SetCurrentMode("primary_accounting");
settings.AddEnabledDocumentTypes("*");
DocSession session = engine.SpawnSession(settings, <PERSONALIZED_SIGNATURE>);
DocProcessingSettings proc_settings = session.CreateProcessingSettings();
Image image = Image.FromFile(<PATH_TO_IMAGE>);
session.ProcessImage(image, proc_settings);
DocResult result = session.GetCurrentResult();
Document document = result.DocumentsBegin().GetDocument();
for (DocTextFieldsIterator iterator = doc.TextFieldsBegin(); !iterator.Equals(doc.TextFieldsEnd()); iterator.Advance()) {
String name = iterator.GetField().GetBaseFieldInfo().GetName();
String value = iterator.GetField().GetOcrString().GetFirstString().GetCStr();
}
std::unique_ptr<se::doc::DocEngine> engine(se::doc::DocEngine::Create(<PATH_TO_CONFIGURATION_FILE>, true));
std::unique_ptr<se::doc::DocSessionSettings> settings(engine->CreateSessionSettings());
settings->SetCurrentMode("primary_accounting");
settings->AddEnabledDocumentTypes("*");
std::unique_ptr<se::doc::DocSession> session(engine->SpawnSession(*settings, <PERSONALIZED_SIGNATURE>));
std::unique_ptr<se::doc::DocProcessingSettings> proc_settings(session->CreateProcessingSettings());
std::unique_ptr<se::common::Image> image(se::common::Image::FromFile(<PATH_TO_IMAGE>));
session->ProcessImage(*image, proc_settings.get());
const se::doc::DocResult& result = session->GetCurrentResult();
const se::doc::Document& doc = result.DocumentsBegin().GetDocument();
for (auto iterator = doc.TextFieldsBegin(); iterator != doc.TextFieldsEnd(); ++iterator) {
std::string name = iterator.GetFieldPtr()->GetBaseFieldInfo().GetName();
std::string value = iterator.GetFieldPtr()->GetOcrString().GetFirstString().GetCStr();
}
DocEngine engine = DocEngine.Create(<PATH_TO_CONFIGURATION_FILE>, true);
DocSessionSettings settings = engine.CreateSessionSettings();
settings.SetCurrentMode("primary_accounting");
settings.AddEnabledDocumentTypes("*");
DocSession session = engine.SpawnSession(session_settings, <PERSONALIZED_SIGNATURE>);
DocProcessingSettings proc_settings = session.CreateProcessingSettings();
Image image = Image.FromFile(<PATH_TO_IMAGE>);
session.ProcessImage(image, proc_settings);
DocResult result = session.GetCurrentResult();
doc_it = recog_result.DocumentsBegin()
Document doc = recog_result.DocumentsBegin().GetDocument();
for (DocTextFieldsIterator iterator = doc.TextFieldsBegin(); !iterator.Equals(doc.TextFieldsEnd()); iterator.Advance()) {
String name = iterator.GetField().GetBaseFieldInfo().GetName();
String value = iterator.GetField().GetOcrString().GetFirstString().GetCStr();
}
engine = pydocengine.DocEngine.Create(<PATH_TO_CONFIGURATION_FILE>)
settings = engine.CreateSessionSettings()
settings.SetCurrentMode("primary_accounting")
settings.AddEnabledDocumentTypes("*")
session = engine.SpawnSession(settings, <PERSONALIZED_SIGNATURE>)
proc_settings = session.CreateProcessingSettings()
image = pydocengine.Image.FromFile(<PATH_TO_IMAGE>)
session.ProcessImage(image, proc_settings)
result = session.GetCurrentResult()
doc_it = recog_result.DocumentsBegin()
doc = recog_result.DocumentsBegin().GetDocument()
iterator = doc.TextFieldsBegin()
while iterator != doc.TextFieldsEnd():
name = iterator.GetField().GetBaseFieldInfo().GetName()
value = iterator.GetField().GetOcrString().GetFirstString().GetCStr()
iterator.Advance()
Уверенность распознавания, координаты объектов, вырезание полей и документов
Возврат зоны принятия решения для проверок подлинности
Система подходит для автоматизации ввода данных в любые LLM и агентные модели ИИ, построенные на их основе. Решение может использоваться как источник достоверных данных для корпоративных AI-платформ, интеллектуальных помощников, RAG-систем, NLP-моделей, AI-агентов для документооборота, KYC/KYB-сценариев и других систем анализа и принятия решений, работающих на основе текстовой информации из документов. Решение обеспечивает высокоточный структурированный ввод без искажения исходных данных, что особенно важно для ИИ-агентов, принимающих решения на основе содержимого документов.
Технология Smart Engines позволяет существенно повысить качество работы ИИ-агентов за счет высокоточного и достоверного извлечения данных. Система обеспечивает максимальное качество распознавания без галлюцинаций и рисков искажения исходной информации. На выходе решение формирует расширенный результат распознавания: текст, знакоместа, геометрию документа и альтернативы для NLP-обработки. Это позволяет значительно точнее анализировать документы с помощью ИИ-агентов, учитывать контекст расположения данных и минимизировать ошибки интерпретации при автоматическом принятии решений.
Система Smart Engines распознает печатный, рукописный и смешанный текст любой сложности. Поддерживается обработка рукописных пометок, комментариев, анкет, заявлений, подписей и других текстовых элементов, заполненных от руки. Решение корректно работает даже с трудноразборчивым почерком, а также с текстом, написанным ручкой, карандашом или пером. Решение поддерживает распознавание смешанного текста в документах, где одновременно присутствуют печатные и рукописные фрагменты.
Да. Система Smart Engines автоматически определяет тип документа на фотографиях и сканах и извлекает ключевые реквизиты из различных типов документации. Решение поддерживает обработку 80+ видов деловых документов РФ, а также 3000+ типов удостоверений личности всего мира. OCR распознает и классифицирует договоры, счета, акты, анкеты, заявления, бухгалтерские и кадровые документы и другие формы документации. Технология поддерживает потоковую обработку больших массивов документов, ускоряя ввод данных, проверку, маршрутизацию и автоматизацию бизнес-процессов без участия человека.
Технология поддерживает распознавание текста более чем на 100 языках мира. Система эффективно работает не только с латиницей и кириллицей, но и со сложными системами письменности, включая арабскую вязь, китайские и японские иероглифы, корейское письмо и другие алфавиты. Поддерживается омнифонтовое распознавание независимо от гарнитуры, начертания и качества печати, что позволяет использовать решение в мультиязычных AI-сценариях.
Да. Технология с высочайшей точностью распознает документы, снятые в реальных условиях, и работает с изображениями низкого качества. Система автоматически выполняет локализацию документа в кадре, выравнивание и нормализацию изображения. Искусственный интеллект устойчив к шумам, бликам, теням, размытию, сложному фону и артефактам сканирования. Это позволяет одинаково эффективно обрабатывать как фотографии с мобильных устройств, так и низкокачественные сканы документов, обеспечивая высокую точность извлечения данных.
Система передает результаты распознавания в структурированном виде, подходящем для последующей обработки ИИ-агентами и NLP-системами. Вместе с извлеченным текстом решение возвращает знакоместа, геометрию документа и альтернативы. Такой уровень детализации позволяет применять технологию для ввода данных в существующие системы интеллектуального анализа документов и автоматического принятия решений, а также для построения мультиагентных моделей на базе AI.
Решение Smart Engines обеспечивает сверхбыструю обработку документов — до 1800 страниц в минуту на одном сервере без использования GPU. Архитектура решения позволяет легко масштабировать систему для работы с большими объемами данных без усложнения ИТ-инфраструктуры и дополнительных затрат на специализированное оборудование. Высокая производительность системы делает решение эффективным инструментом для потоковой обработки документов, корпоративных AI-платформ и высоконагруженных систем, где критически важна скорость, полнота и достоверность данных.
Система Smart Engines — мультиплатформенный программный продукт, который быстро встраивается в существующую ИТ-инфраструктуру заказчика без необходимости доработок. Для работы решения не требуется интернет-соединение и привлечение мощностей графических ускорителей (GPU). Это позволяет применять систему как на серверах, так и на рабочих станциях, мобильных устройствах и на веб-страницах.
Да. Решение работает полностью автономно в инфраструктуре заказчика по модели on-premise и обеспечивает 100% локальную обработку документов. Во время распознавания изображения и извлеченные данные не передаются за пределы защищенного контура организации и не отправляются во внешние облачные сервисы. Это обеспечивает высокий уровень конфиденциальности и соответствие требованиям информационной безопасности, что особенно важно для банков, государственных организаций, промышленности и корпоративных заказчиков.