Задача: найти документ за секунды, а не за смену
Типовая организация с историей: десятилетия бумажных дел, частично отсканированные папки, номенклатура, которая ведётся вручную и с ошибками. Запрос «найди договор 2019 года с таким-то предметом» превращается в часы работы: сначала ищут дело, потом листают. Если документ нужен к совещанию или проверке — часы становятся проблемой. Отдельная головная боль — сроки хранения: без системы непонятно, что уже можно уничтожать по протоколу, а что обязано храниться ещё годы. Задача контура — сделать содержание архива доступным поиском, а ведение дел — автоматическим: и текущий поток документов, и оцифрованное ретро живут в одной системе с единой номенклатурой и историей каждого дела.
Что здесь делает ИИ
Три функции. Распознавание: OCR переводит сканы в текст с разметкой структуры — реквизиты, таблицы, подписи; качество проверяется порогом, сомнительные страницы уходят на верификацию. Классификация: ИИ определяет тип документа и предлагает дело по номенклатуре — человек подтверждает, контур донастраивается. Поиск: по содержанию, реквизитам и связям — «все документы по контрагенту за период, где встречается такой пункт», включая сканы.
Фундамент — модель данных архива: фонд, дело, документ, лист, связи и сроки. Без неё ИИ-функции повисают в воздухе; с ней архив становится системой с проверяемой целостностью.
Архитектура: от скана до дела
Источники: бумажные дела (потоковое сканирование) · цифровые файлы · ЭДО ▼ Оцифровка: контроль качества образов, штрихкодирование дел ▼ OCR + структура: текст, реквизиты, таблицы; порог качества ├──► уверенность ниже порога ──► ручная верификация страницы ▼ ИИ-классификация: тип документа → кандидат дела по номенклатуре │ человек подтверждает разноску (карточка = рабочее место архивариуса) ▼ Электронный архив: дела, связи, версии, целостность ├──► поиск: по содержанию и реквизитам, включая сканы └──► сроки хранения: контроль «хранить до», протоколы выделения к уничтожению ▼ Аналитика: поток поступления, качество распознавания, узкие места
Разрушение документов остаётся строго человеческим решением: система готовит протокол и основание, подписывает комиссия — как положено по правилам архивного хранения.
Этапы внедрения
| Этап | Что получается | Цена | Срок |
|---|---|---|---|
| Обследование фонда | объёмы и состояние, модель данных, план оцифровки | 90 000 ₽ | 3–5 рабочих дней |
| Пилот на одном фонде | оцифровка и распознавание потока, автоклассификация, замеры качества | от 480 000 ₽ | 4–6 недель |
| Промышленный контур | все фонды, стыковка с СЭД/ЭДО, роли, контроль сроков | 0,9–1,2 млн ₽ | по ТЗ |
| Сопровождение | переиндексация, донастройка классификации, отчётность | по отдельному договору | — |
Рыночный ориентир: медиана начальных цен в 236 закрытых ИТ-лотах сентября — 2,43 млн ₽; архивный контур с ИИ-обработкой — нижняя половина коридора. Цены «от», НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ). Масштабная оцифровка ретро-фондов считается отдельно — по объёму страниц.
Поток и ретро: две скорости оцифровки
В типовом проекте оцифровка идёт двумя разными скоростями. Поток — текущие поступления: бумага и файлы проходят сканирование, распознавание и разноску сразу, и именно здесь ИИ даёт основной эффект — новые документы не успевают стать «лежащим в папке» балластом. Ретро — исторические фонды: они оцифровываются волнами по приоритету, и приоритет задаёт не возраст бумаги, а частота запросов — что чаще просят, то и переезжает в индекс первым.
Между двумя скоростями живёт связка со сроками: пока дело не в системе, его срок хранения существует только в голове архивариуса. По мере перевода фонда контроль сроков становится полным, а протоколы выделения к уничтожению — обоснованными: система показывает не «наверное, можно», а конкретное дело с основанием и историей. Так архив перестаёт быть кладом с неизвестным содержимым и становится рабочим активом организации — с проверяемой структурой, поиском и прозрачной судьбой каждого дела.
Типовые метрики «до/после»
Ниже — вилки результатов, типичные для этого класса систем, а не отчёт конкретного архива. Базовая линия всегда замеряется на старте проекта: время поиска, доля ручной разноски, точность номенклатуры.
- Поиск документа: с часов до секунд — по содержанию, включая распознанные сканы.
- Ручная разноска: сокращение на 60–90% — человек подтверждает, а не разбирает с нуля.
- Качество OCR: типовая доля страниц, требующих верификации, — 5–15% после настройки порога.
- Сроки хранения: прозрачный контроль по каждому делу; типовая находка обследования — часть фонда хранится дольше положенного или без оснований.
Безопасность и границы
Архивные документы содержат персональные данные и коммерческие сведения. Типовой контур: российские информационные системы, разграничение доступа на уровне дел и документов, журналирование каждого просмотра и выгрузки, обезличивание для аналитики — под 152-ФЗ и режим коммерческой тайны. Целостность обеспечивается контролем образов и связей «дело — документ — лист». Границы автоматизации: ИИ не уничтожает документы и не принимает решений о сроках — система готовит основание, решение оформляет комиссия по установленной процедуре.
Об этом разборе. Это обезличенный типовой проект из нашей практики проектирования: имена организаций не раскрываются (NDA), метрики показаны вилками класса; фактические цифры фиксируются в КП и по приёмке. Реквизиты в распознанных документах всегда проверяемы по образу оригинала.