Документооборот — самый недооценённый резерв компании: входящие письма раскладываются вручную, данные из договоров перебиваются в 1С глазами, а поиск по архиву занимает часы. LLM закрывает эти задачи не «в будущем», а сейчас: классифицирует документы, извлекает поля, отвечает на вопросы по архиву и готовит черновики. Гайд — как автоматизировать документооборот с большой языковой моделью без хаоса.
Ключевая идея: LLM не заменяет СЭД, а усиливает её. Системы электронного документооборота хранят и маршрутизируют документы; языковая модель понимает их содержание. Поэтому автоматизация строится поверх существующей СЭД или ЭДО — как в услуге ЭДО и СЭД, где LLM-слой добавляется к готовому контуру.
Ориентиры сентября 2026: аудит процессов и данных — от 90 000 ₽ (3–5 рабочих дней), пилот LLM на одном типе документов — от 480 000 ₽ за 4–6 недель, сопровождение — от 50 000 ₽/мес. Прецеденты из практики НЬЮ-ССТ: концепция СЭД — 648 000 ₽, ИИ-нормоконтроль конструкторской документации — ТКП 1 424 000 ₽, LLM-обработка обращений — КП 2 560 000 ₽.
Гайд для ИТ-руководителей и владельцев документооборота: каждый шаг заканчивается проверяемым артефактом — картой потока, схемой полей, контрольной выборкой. Внедрение можно остановить после любого шага без потери вложений: даже если пилот не пойдёт в контур, очищенная база документов и карта процессов останутся работать на компанию.
Пошаговый план
Выберите один тип документов для старта
Не автоматизируйте «весь документооборот» сразу. Возьмите один тип с большим объёмом и понятной структурой: входящие письма, коммерческие предложения, договоры, акты, обращения. Критерии выбора: документов много, обработка рутинная, ошибки людей часты, а правила классификации можно описать. Один тип — один пилот; универсальность придёт с третьим-пятым типом.
Постройте карту потока документов
Опишите путь документа: откуда приходит (почта, ЭДО, сканер), кто и как обрабатывает, куда попадают данные, где хранится результат. Замерьте объём (документов в месяц) и время на каждый шаг. На карте отметьте точки, где люди просто читают и переносят данные — именно они автоматизируются первыми. Карта потока — основа ТЗ; как её оформить — в гайде написания ТЗ на ИИ-разработку.
Определите класс данных и режим обработки
Документооборот часто содержит персональные данные и коммерческую тайну — от этого зависит архитектура. Для чувствительных потоков — on-premise контур: запросы и документы остаются внутри периметра организации. Российские API под договором обработки данных закрывают менее чувствительные потоки. Класс потока определяет и выбор OCR: распознавание сканов тоже происходит где-то — узнайте, где именно. Классификацию данных согласуйте до проектирования.
Автоматизируйте классификацию входящих
Первая задача LLM — сортировка: определить тип документа и маршрут. Модель относит входящий документ к категории (договор, акт, обращение, спам) и передаёт в нужной процесс. Люди проверяют только пограничные случаи, которые модель пометила как неуверенные. Метрика качества — доля верных классификаций на контрольной выборке; закладывайте на старте контроль человеком 100% нерутинных категорий.
Добавьте извлечение данных
Вторая задача — извлечение полей: реквизиты, даты, суммы, номера из договоров и счетов — прямо в 1С или CRM. LLM читает документ (в связке с OCR для сканов) и возвращает структурированные данные. Обязательные правила: формат полей фиксируется схемой, низкая уверенность — флаг на проверку человеком, все извлечённые значения логируются с указанием фрагмента-источника. Так ошибка модели находится за секунды, а не при сверке в конце квартала.
Подключите поиск по архиву (RAG)
Третья задача — консультирование по документам: «какой срок оплаты в договоре с N», «были ли продления в 2025». RAG-индексация превращает архив в базу знаний: модель отвечает со ссылкой на документ-источник, знания обновляются перезагрузкой файлов без переобучения. Подготовку данных — очистку, нарезку, индексацию — описывает гайд подготовки данных для RAG.
Внедрите контроль качества и журналирование
Автоматизированный документооборот обязан быть проверяемым: журнал каждого документа (классификация, извлечённые поля, изменения), статистика ошибок по типам, процедура исправления. Человек-в-контуре остаётся для критичных операций: согласования договоров, подписания, списаний. Настройте отчёт качества раз в неделю на старте — первые недели модель и люди учатся друг у друга.
Масштабируйте по типам документов
После успешного пилота расширяйте охват: следующий тип документов, следующий канал, следующий отдел. Каждое расширение — маленький проект: корректировка правил, дообучение контрольной выборки, замер метрик. Так контур растёт предсказуемо, а наработки (OCR-конвейер, RAG-индекс, журналирование) переиспользуются. Полный промышленный контур — 0,9–1,2 млн ₽; сопровождение — от 50 000 ₽/мес.
| Задача | Что делает LLM | Метрика качества |
|---|---|---|
| Классификация входящих | определяет тип и маршрут документа | доля верных классификаций ≥ 95% |
| Извлечение данных | достаёт поля в 1С/CRM по схеме | точность полей ≥ 98%, флаги низкой уверенности |
| Поиск по архиву (RAG) | отвечает на вопросы со ссылкой на источник | точность ответов ≥ 90% на контрольном наборе |
| Черновики документов | готовит проекты типовых писем и ответов | доля правок человека, время подготовки |
| Нормоконтроль | проверяет оформление документов по правилам | полнота проверок, ложные срабатывания |
Что влияет на эффект автоматизации
Эффект определяется четырьмя факторами. Качество сканов и шаблонов: ровные машиночитаемые документы дают точность извлечения выше 98%, мятые фото «на коленке» опускают её до непригодной. Стабильность типов: поток из пяти повторяющихся типов автоматизируется быстрее, чем сто уникальных. Класс данных: персональные данные в потоке означают закрытый контур и OCR внутри периметра — это дороже, но безопаснее. Готовность владельцев: если владельцы процессов не назначат ответственного за базу знаний и правила, система деградирует за квартал — технология не заменяет порядок в документах.
Чек-лист
Перед стартом пилота документооборота проверьте:
- Выбран один тип документов с большим объёмом
- Карта потока построена, объём и время замерены
- Класс данных определён, режим (on-premise/API) согласован
- Правила классификации описаны и подтверждены владельцем процесса
- Схема извлекаемых полей зафиксирована
- OCR выбран с учётом класса данных (где физически распознаётся скан)
- Контрольная выборка документов собрана (100–300 штук)
- Человек-в-контуре назначен для критичных операций
- Журналирование каждой операции спроектировано
- Метрики качества зафиксированы числами до старта
- Интеграция с 1С/CRM/СЭД проверена ИТ-службой
- План расширения на следующие типы документов составлен
- Качество исходных сканов оценено (доля машиночитаемых vs фото)
- Ответственный за базу знаний и правила назначен приказом
Ошибки новичков
Пять ошибок автоматизации документооборота с LLM.
- Старт со всех документов сразу. разные типы требуют разных правил и схем; пилот на одном типе даёт результат за 4–6 недель, «всё сразу» — никогда
- LLM вместо СЭД. модель не система хранения и маршрутизации; правильная архитектура — LLM-слой над СЭД/ЭДО, а не вместо неё
- Извлечение без схемы и журнала. «модель сама поймёт, что достать» — данные плавают между форматами; схему полей и журнал источника каждого значения задают жёстко
- Игнорирование класса данных. сканы с персональными данными уходят во внешний OCR/без договора — нарушение 152-ФЗ закладывается в архитектуру
- Отсутствие человека в контуре. модель сама согласует и подписывает — так не делают; критичные операции остаются за людьми, ИИ готовит и проверяет
Инструменты и сроки
Инструменты: OCR для сканов (для чувствительных потоков — в своём контуре), векторная база для RAG, шлюз к 1С/CRM, журнал операций. Сроки: аудит процессов — 3–5 дней, пилот на одном типе документов — 4–6 недель, промышленный контур — 0,9–1,2 млн ₽.
- OCR-конвейер с учётом класса данных
- RAG-индекс по архиву документов
- Журнал операций и отчёт качества
Что получится в итоге
Итог — документооборот, в котором люди занимаются суждением, а не переносом данных: входящие сортируются сами, реквизиты попадают в системы без ручного ввода, а ответы на вопросы по архиву занимают секунды. Эффект измерим: часы на обработку документа падают в разы, а каждая операция проверяется журналом. Начать можно с пилота на одном типе документов — и масштабировать по готовности.