Данные, которые есть, но которых нет
В большинстве компаний огромная часть данных существует, но недоступна: сканы договоров в папках, входящие письма в почте, первичка в PDF, чертежи в архиве. Формально информация есть; практически — по ней нельзя искать, её нельзя посчитать, она не попадает в отчёты и ИИ. OCR-слой закрывает именно этот разрыв: документ любого формата превращается в структурированные данные с контролем качества.
Чистый OCR (просто «текст из картинки») сегодня — половина решения. Вторая половина — понимание: какая строка — это ИНН, какая — сумма, где табличная часть, что из этого сверять с учётной системой. Здесь работают LLM: они извлекают поля и классифицируют документы по смыслу, а не только по шаблону — поэтому решение переживает смену бланков и новые типы документов. Наш типовой маршрут: прототип за 90 000 ₽ (3–5 рабочих дней) показывает точность на ваших образцах до всяких больших вложений.
Кому подходит
- Первичка и входящие документы. Счета, акты, УПД в сканах от контрагентов: распознать, проверить, провести — без ручного перебивания в 1С. Типовой первый контур для бухгалтерий и АПК.
- Обращения граждан и клиентов. Входящие письма и заявления: классификация по темам, маршрутизация исполнителям, черновики ответов — прецедент КП 2 560 000 ₽; методика — в гайде по ИИ-обработке обращений.
- Техдокументация и чертежи. Проверка конструкторской документации по нормам (VLM-проверка чертежей — прецедент ТКП 1 424 000 ₽), поиск по архивам стандартов, OCR старых фондов.
- Договоры и внутренний поиск. «Найди все договоры с такой оговоркой» — после OCR и индексации это вопрос секунд, а не недели юриста; база заодно становится фундаментом для ИИ-ассистента.
Что делаем: этапы
Стандартный путь от архива к данным — от 3–5 рабочих дней (прототип) до 4–6 недель (пилот на потоке):
- Аудит потока документов. Какие типы, объёмы, качество сканов, куда данные должны попадать и какие поля действительно нужны в учёте. Бесплатно — как разбор задачи.
- Выбор стека. OCR-движок и LLM под ваши документы: печатный текст, рукопись, таблицы, чертежи — разные инструменты; для чувствительных документов — закрытый контур (on-premise), данные не покидают периметр.
- Прототип — 90 000 ₽, 3–5 рабочих дней. На выборке ваших документов: распознавание, извлечение полей, метрики точности на каждом поле. Вы видите, где решение уверенно, а где нужна доработка.
- Пилот — от 480 000 ₽, 4–6 недель. Реальный поток: точность на объёме, контролёр для спорных случаев, обработка исключений. Метрики: доля документов без ручной правки, время на документ.
- Промышленный контур — 0,9–1,2 млн ₽. Интеграции с 1С/СЭД/BI, маршрутизация, контроль качества, журнал обработки для аудита (включая требования 152-ФЗ к персональным данным).
- Сопровождение — от 50 000 ₽/мес. Новые типы документов, дообучение извлечения, мониторинг точности, отчётность.
Технологии и стек
Стек подбираем под документы: OCR-распознавание — текст из сканов и фото; мультимодальные VLM — чертежи и сложная разметка; LLM — извлечение полей и классификация (GigaChat, YandexGPT или open-source в закрытом контуре); векторные базы — поиск по извлечённому. Документооборот — интеграции ЭДО и СЭД.
Цены и сроки
| Ступень | Цена | Срок |
|---|---|---|
| Разбор потока документов и КП | бесплатно | 1 рабочий день |
| Прототип на ваших документах | 90 000 ₽ фикс | 3–5 рабочих дней |
| Пилот на потоке | от 480 000 ₽ | 4–6 недель |
| Промышленный контур с интеграциями | 0,9–1,2 млн ₽ | по дорожной карте |
| Прецеденты | КП 2 560 000 ₽ · ТКП 1 424 000 ₽ · СЭД-концепция 648 000 ₽ | обращения · нормоконтроль · СЭД |
Цены — «от», без НДС (УСН, п. 2 ст. 346.11 НК РФ). Сентябрь 2026. Точность на ваших документах покажет прототип — до больших вложений.
Смежные услуги и материалы
ЭДО и СЭД
Документооборот, в который попадают распознанные данные. Развитие от 480 000 ₽.
LLM-интеграции
Извлечение, классификация и ответы поверх ваших данных. Пилот от 480 000 ₽.
1С
Учётная система, куда приходят структурированные документы. От 7 000 ₽/мес.
Как готовить данные для ИИ — гайд «Как подготовить данные для RAG»; обзор направления — центр разработки и защиты ИИ; технология подробно — OCR-распознавание документов.
Контроль качества: кто проверяет робота
Автоматическое извлечение без контроля — это лотерея с данными. Мы строим контроль тремя слоями. Первый — порог уверенности: документы, где модель «не уверена», уходят человеку, а не в учёт. Второй — сверка: извлечённые суммы сверяются с итогом документа, реквизиты — с эталонной базой контрагентов, даты — с логикой процесса. Третий — выборочная проверка человеком по журналу: какая доля документов прошла без правок, где чаще ошибки, какие типы документов «учатся» хуже.
Экономика решается этими же метриками: если 85% документов проходят без ручной правки — контролёр смотрит оставшиеся 15%, и время на документ падает в разы; если правки нужны половине — честнее сказать, что для этого типа документов решение пока не готово, и показать это на цифрах прототипа за 90 000 ₽, а не обнаруживать в промышленной эксплуатации. Журнал обработки при этом закрывает и аудит: каждый документ — с версией модели, временем, решением контролёра; для персональных данных — разграничение доступа и сроки хранения по 152-ФЗ. В итоге вы получаете не «магию ИИ», а процесс с измеримым качеством, который можно предъявить бухгалтерии, юристам и проверяющим.
Финальный совет — про выбор первого контура. Не начинайте OCR-проект с самого болезненного и большого архива: начните с потока, где эффект считается за неделю — входящие счета, типовые обращения, один тип договоров. На нём отладится качество, команда привыкнет доверять цифрам точности, а дальше контур расширяется по тем же правилам на новые типы документов. Так строился и наш прецедент обработки обращений граждан: от классификации одного типа до маршрутизации и черновиков ответов. Лестница цен при этом не меняется: прототип 90 000 ₽, пилот от 480 000 ₽, контур 0,9–1,2 млн ₽ — и каждая ступень оставляет вам точку принятия решения с цифрами на руках.