Тип документа
Определяем, к какому поддерживаемому классу относится файл, если это нужно для выбора дальнейшей схемы обработки.
Автоматизируем обработку PDF, сканов и других файлов там, где ручной перенос данных занимает время. Сначала определяем тип документа и извлекаем нужные значения, затем проверяем формат, обязательные поля и связи обычной логикой перед записью в CRM или запуском следующего шага.
ИИ используется для понимания содержимого. Суммы, даты, реквизиты и другие критичные поля проходят отдельную проверку до записи.
Что извлекаем
Для каждого типа файла фиксируем набор полей и правила проверки. Это делает обработку предсказуемой и позволяет отличить уверенный результат от спорного.
Определяем, к какому поддерживаемому классу относится файл, если это нужно для выбора дальнейшей схемы обработки.
Номера, даты, наименования, ИНН/КПП и другие значения извлекаются только в согласованном составе.
Сумма, НДС и другие числовые поля приводятся к точному формату и отдельно валидируются.
Для подходящих документов можно извлекать строки товаров, количество, цену и другие колонки в структурированном виде.
По номеру заказа, сделке или другому устойчивому идентификатору определяем, куда относится документ.
Можно извлекать отдельные факты, которые запускают дальнейшую проверку или изменение состояния процесса.
Конвейер
Даже если модель уверенно прочитала документ, критичное действие не должно выполняться без формальной проверки данных.
Проверка
Так ошибка распознавания не превращается автоматически в неверную сумму, контрагента или статус сделки.
Дата, сумма, ИНН, номер документа и другие поля приводятся к ожидаемому типу и диапазону.
Если критичного значения нет, документ не проходит дальше как успешно обработанный.
При необходимости сравниваем номер заказа, сумму, контрагента или другой набор признаков с данными системы.
Один и тот же файл или документ не должен повторно запускать необратимую операцию без проверки.
Спорные значения отправляем на ручную проверку вместо принудительного выбора.
Источники
Отдельно проектируем получение файла и отдельно — извлечение бизнес-данных.
Файл может быть прикреплён к сделке или запускаться из пользовательского действия в карточке.
Можно обрабатывать вложения или файлы, поступающие через отдельную форму или серверный процесс.
Если документ приходит из учёта, ЭДО или другого сервиса, сохраняем внешний идентификатор и контекст источника.
Для большого потока используем статусы, повторные попытки и отдельный результат по каждому файлу.
Когда нужен ИИ
Если документ всегда имеет один строгий формат, обычный парсер может быть дешевле и стабильнее. ИИ полезен, когда расположение и формулировки меняются, а нужные данные остаются смыслово одинаковыми.
Берём реальные документы разных вариантов и качества.
Определяем минимальный набор данных, который нужен следующему этапу.
OCR, текстовый слой PDF, шаблонный парсер, модель или их комбинация.
Задаём типы полей, обязательность, массивы строк и признаки неуверенности.
Критичные значения валидируются независимо от модели.
После успешной проверки обновляем CRM, БД или вызываем следующий API-сценарий.
Неоднозначные документы попадают на проверку вместо скрытой ошибки.
Связанные решения
Разбор документа полезен, когда результат не остаётся отдельной таблицей, а используется в существующей цепочке.
Смотреть также
После проверки можно заполнить поля, сформировать документ, отправить данные в учёт или запустить ЭДО-сценарий.
Вопросы
Да, но сначала потребуется распознавание изображения. Качество зависит от разрешения, ориентации, печатей, рукописных элементов и других особенностей исходника.
Можно, если структура документа позволяет надёжно определить строки и колонки. На примерах заранее проверяем, нужен ли обычный парсер, OCR или модель.
Да, поэтому критичные числа не стоит принимать без проверки. После извлечения приводим значение к точному типу и при необходимости сверяем его с данными заказа или другой системы.
Да, если в документе или источнике есть устойчивый идентификатор либо достаточный набор проверяемых признаков для однозначного сопоставления.
Он получает отдельный статус и уходит на ручную проверку. Неизвестный или неполный файл не должен маскироваться под успешно обработанный.
Да. По выполненной разработке предоставляем 3 месяца бесплатной технической поддержки. Дальнейшее сопровождение и развитие — по запросу.
Покажите несколько реальных файлов и результат, который должен получиться после обработки. Определим, где достаточно обычного парсера, а где нужен ИИ.