Задача «извлечь данные из документов» в 2026 году решается двумя путями: классический конвейер — OCR распознаёт текст, затем LLM разбирает его в поля — или мультимодальная модель (VLM), которой отдают изображение целиком. Конвейер десятилетиями обкатан на типовых бланках и даёт контролируемую точность; VLM элегантнее на сложных макетах, но тяжелее в эксплуатации и не свободна от галлюцинаций. Выбор зависит от типа документов, качества сканов и объёма — не от моды.
Ниже — таблицы «когда что» и критериев: точность, железо, стоимость, риски, 152-ФЗ и режим данных. Смежные материалы: «как выбрать LLM для обработки документов» и сравнение «ЭДО-платформа против ИИ-разбора»; услуга — «OCR-извлечение данных».
Кратко: когда что выбирать
Прямой ответ — в таблице: слева ситуация, справа разумное решение по состоянию на сентябрь 2026 года. Если узнали свою компанию в одной из строк — дальше достаточно проверить решение по чек-листу в конце страницы, а не перечитывать весь интернет.
| Ситуация | Что выбрать | Почему |
|---|---|---|
| Типовые бланки: заявления, счета, паспорта РФ, доверенности | OCR + LLM | зрелые профили распознавания, высокая точность на шаблонах |
| Сложные макеты: переплетённые таблицы, вёрстка, печати поверх текста | VLM | мультимодальная модель читает макет целиком, не теряя структуру |
| Рукописные анкеты и формы | VLM | OCR по рукописному русскому тексту стабилен хуже; VLM работает с изображением напрямую |
| Миллионы страниц в месяц, счёт важен | OCR + LLM | OCR на CPU дешевле GPU-инференса VLM в массе |
| Уже стоит ЭДО и сканы хорошего качества | OCR + LLM | текстовый слой уже есть или извлекается дёшево |
| Качество сканов непредсказуемое (фото телефона) | гибрид с маршрутизатором | хорошие сканы — в конвейер, плохие — в VLM |
Критерии сравнения
Развёрнутая матрица по критериям, которые заказчики проверяют перед решением: стоимость, сроки, риски, поддержка, комплаенс и режим данных. Каждая строка матрицы ниже раскрыта отдельным разбором — с пояснениями, откуда берутся цифры и на что смотреть в вашей ситуации.
| Критерий | OCR + LLM | VLM напрямую |
|---|---|---|
| Точность на шаблонах | высокая и стабильная, ошибки предсказуемы | высокая, но с редкими тихими галлюцинациями |
| Сложные макеты и таблицы | требует настройки зон и правил | читает макет целиком, обычно без разметки |
| Железо и стоимость | OCR на CPU; массовый прогон дешевле | GPU-инференс; дороже на объёме |
| Контролируемость | каждый шаг конвейера верифицируется | модель чёрным ящиком; нужна проверка полей |
| Сроки проекта | прототип — от 90 000 ₽ на своём типе бланков | пилот сравним, но нагрузочное тестирование дольше |
| 152-ФЗ и данные | все компоненты разворачиваются локально | открытые VLM тоже разворачиваются локально; вес моделей больше |
| Сопровождение | обновление профилей под новые бланки | пере-eval при смене версии модели |
Строки «точность на шаблонах» и «железо» образуют главный размен: конвейер дешевле и стабильнее на объёме, VLM сильнее на трудных страницах. Гибрид с маршрутизатором снимает развилку — сравнивайте не технологии, а долю страниц каждого типа в вашем потоке.
Разбор критериев
Точность: где конвейер, а где VLM
На типовых бланках конвейер стабилен: OCR извлекает текстовый слой, LLM разбирает поля, нечеткости ловятся валидацией (ИНН по контрольной сумме, дата по формату). VLM выигрывает там, где структура важнее текста: многослойные таблицы, колонки, текст «змейкой», печати поверх полей. Тихая опасность VLM — уверенное заполнение поля, которого не было: это ловится только обязательной валидацией выхода.
Железо и экономика объёма
OCR крутится на CPU и стоит копейки на страницу; VLM требует GPU, и счёт растёт линейно с миллионами страниц. На большом архиве разница между конвейером и VLM измеряется не процентами, а разрядами бюджета. Промышленный контур разбора документов — от 690 000 ₽; как считать полную стоимость владения, разбирает гайд «TCO ИИ-решения».
Контролируемость и проверка
В конвейере каждый шаг виден: сырой текст OCR, разобранные поля, валидации. У VLM вход-выход непрозрачен, поэтому в проде обязателен слой проверки: форматы, справочники, контрольные суммы, выборочная вычитка человеком по уровню риска. Архитектура верификации для генеративных моделей описана в статье словаря «guardrails»; для документов она не опциональна.
152-ФЗ и режим данных
В документах — персональные данные, поэтому промышленные конвейеры разворачивают локально: и OCR, и LLM, и VLM в одном контуре, 0,9–1,2 млн ₽ под ключ. Облачные распознавания допустимы только для обезличенных потоков с поручением обработки. Что можно отправлять во внешние сервисы, разбирает ответ на вопрос «безопасно ли отдавать данные в облачный ИИ».
Гибрид с маршрутизацией
Рабочая схема 2026 года — единый вход с маршрутизатором: качество скана и тип документа определяют путь. Хорошая печатная страница идёт в дешёвый конвейер, сложный макет или рукопись — в VLM, спорные случаи — на разметку оператору. Такая система удерживает стоимость на уровне конвейера, поднимая качество до уровня VLM на трудных страницах; кейс-референс — «типовой проект LLM+RAG по документам».
Сроки и внедрение
Пилот на одном типе документов занимает 4–6 недель: контур, разметка, валидации, метрики точности по полям. Промышленная система с маршрутизацией и операторским интерфейсом — от 690 000 ₽. Начинать стоит с самого массового типа документа: он же и самый выгодный, и самый простой для проверки качества.
Вердикты по трём сценариям
Сценарий 1. Массовый поток типовых бланков
OCR + LLM: прототип от 90 000 ₽, промышленный конвейер — от 690 000 ₽, точность контролируется валидациями по каждому полю. VLM здесь — переплата за GPU без прироста качества.
Сценарий 2. Сложные и рукописные документы
VLM с обязательной валидацией выхода и выборочной вычиткой: пилот от 480 000 ₽ на своей выборке. Критично заранее собрать тестовый набор трудных страниц и мерить точность по полям, а не «в целом».
Сценарий 3. Смешанный вход непредсказуемого качества
Гибрид с маршрутизатором: конвейер для хороших сканов, VLM для сложных, оператор для спорных. Локальный контур 0,9–1,2 млн ₽ закрывает и 152-ФЗ, и экономику одновременно; маршрутизатор со временем обучается на решениях операторов.
Типичные ошибки выбора
Ошибки в проектах распознавания, которые всплывают на объёме.
- Выбор технологии до классификации документов: поток всегда смешанный.
- Отсутствие валидации полей: галлюцинация VLM попадает прямо в учётную систему.
- Тестовый набор из «красивых» сканов: прод состоит из фото телефонов и кривых поворотов.
- Сравнение по обзорам вместо прогона на своей выборке с эталонной разметкой.
- Облачный распознаватель на паспортах и заявлениях без поручения обработки (152-ФЗ).
Итог
Типовые бланки — конвейеру, сложные макеты — VLM, спорные страницы — оператору: так выглядит рабочая система 2026 года. Выбор технологии вторичен по отношению к классификации вашего потока. Решение стоит перепроверить на своих цифрах: разбор задачи бесплатный, ответ — за 1 рабочий день.
Чек-лист решения
Семь пунктов, которые стоит закрыть до выбора: они одинаково полезны обоим вариантам и закрывают большинство ошибок из списка выше. Пройдите список с командой — обычно это один рабочий час, который экономит недели переделок.
- Классифицируйте вход: типовые бланки, сложные макеты, рукопись, фото с телефона.
- Соберите тестовый набор из 200–500 страниц с эталонной разметкой полей.
- Определите валидации по каждому полю: форматы, справочники, контрольные суммы.
- Сравните на своём наборе конвейер и VLM до принятия решения — не по обзорам.
- Посчитайте стоимость страницы на прогнозном объёме: CPU против GPU.
- Решите вопрос контура: ПДн в документах — локальное развёртывание.
- Заложите операторский интерфейс для спорных страниц и метрику доли ручной доработки.
Смежные материалы
Смежные сравнения: «как выбрать LLM для обработки документов» и «векторная БД против полнотекстового поиска». Технологии: «OCR-распознавание документов» и «VLM в практике». Услуга: «OCR-извлечение данных». Вопросы: «кто делает ИИ-распознавание документов».
Полный каталог разборов «или — или» — в разделе Сравнения; форматы работ, сроки и цены «от» — в каталоге услуг.