Мультимодальные модели убирают стену между типами данных. Классический ИИ-ландшафт компании — это зоопарк: одна система читает сканы, вторая транскрибирует звонки, третья отвечает на текстовые вопросы, и всё это склеивают интеграциями. Мультимодальная модель понимает несколько типов данных в одном контуре: ей передают фотографию акта, аудиозапись звонка и текстовую задачу — она работает со всем сразу, в одном контексте, одним пониманием смысла.
«Мода» здесь — способ представления данных: текст — одна модальность, изображение — другая, звук — третья. Внутри модели все они переводятся в общее векторное пространство, похожее на то, что описано в статье про эмбеддинги, — и именно поэтому модель может сопоставлять слово «помятая упаковка» с фотографией, где эта упаковка видна. Для бизнеса это означает одно: данные, которые раньше требовали отдельной автоматизации для каждого формата, попадают в один конвейер.
Какие сочетания модальностей встречаются на практике
- Текст и изображения. Понимание сканов, схем, фото с мест; генерация картинок по описанию. Это самый зрелый класс — специализированные модели для него разобраны в статье про VLM.
- Текст и аудио. Распознавание речи и голосовые интерфейсы: пользователь говорит — модель отвечает; основы — в статье speech-to-text для русского языка.
- Генерация речи. Синтез голоса для роботов и дубляжа — отдельная индустрия со своими рисками клонирования голоса.
- Видео. Анализ записей камер и роликов: события, нарушения, хронология.
Что меняется в архитектуре ИИ-системы
Первое — исчезают промежуточные конвертеры: там, где раньше стояли отдельное распознавание, отдельный классификатор и отдельная модель ответов, теперь один вызов с несколькими входами. Второе — контекст становится общим: модель помнит, что показали на фото, когда отвечает на следующий текстовый вопрос. Третье — растут требования к инференсу: картинка и аудио «весят» больше текста, и контекстное окно расходуется быстрее. Четвёртое — усложняется контроль: фильтры guardrails обязаны проверять не только текст, но и то, что модель «увидела» или «услышала».
Бизнес-сценарии
- Документооборот со смешанными входами. Скан с печатью, подписью и таблицей разбирается одной системой: реквизиты, позиции, контроль отклонений.
- Поле и производство. Фото с места работ + текстовая задача: «проверь соответствие» — модель сопоставляет изображение с регламентом.
- Контакт-центр. Запись разговора и экран оператора анализируются вместе: что сказали и что показалось клиенту.
- Контент и каталоги. Генерация и разметка иллюстраций к товарам и статьям, поиск по картинке.
Практические развёртывания мультимодальных сценариев у НЬЮ-ССТ строятся в рамках ИИ-ассистентов и распознавания документов: от 0,9–1,2 млн ₽ за разработку решения; подключение готовых моделей к существующему процессу — от 90 000 ₽.
Риски и безопасность
Мультимодальность расширяет поверхность атаки. Картинка может нести промпт-инъекцию: текст внутри изображения, невидимый человеку, для модели читаем. Аудио — скрытые команды, неслышимые уху. Ответы мультимодальных моделей тоже требуют контроля: сгенерированные изображения и голос — почва для дипфейков, а скрытые вложения в медиафайлах — предмет стеганографии в выходах ИИ. Отдельный класс — персональные данные: лица, голоса и документы на фото подпадают под режим защиты персональных данных, и обрабатывать их без обезличивания нельзя.
Минимальный контур защиты: проверять все входы (не только текст) фильтрами, ограничивать набор разрешённых модальностей сценарием, журналировать источники медиа и не отправлять чувствительные изображения во внешние облака без правовой оценки.
Типовые ошибки
Ошибка первая — мультимодальность ради мультимодальности: в процесс, где достаточно текстового распознавания, покупают дорогую универсальную модель и платят за воздух. Ошибка вторая — игнорирование стоимости входов: картинки в контексте дороже текста в разы, и счёт удивляет. Ошибка третья — доверие «пониманию» без проверки: модель уверенно описывает фотографию, но путает детали — выходы нужно сверять с эталонами, как в evals. Ошибка четвёртая — смешение сценариев: одна модель на все задачи вместо специализированных веток там, где точность критична.
Как готовят мультимодальные данные
Обучающий набор для мультимодальной задачи — это пары и тройки: изображение и его описание, аудио и транскрипт, скан и извлечённые поля. Готовить их дороже, чем текст: нужны источники медиа, разметка — она занимает вдвое больше времени текстовой, — и хранение. Для компании практичный путь — собственный корпус: реальные сканы, записи звонков и фото с мест, уже сопровождающиеся правильными ответами в существующих процессах. Сырьё часто лежит в CRM и документообороте; задача — собрать его в набор и разметить по единым правилам.
Второй вопрос — качество входов. Фотография с телефона в плохом свете, скан с поворотом страницы, зашумлённая запись звонка — модель должна работать с реальностью, а не со стерильными примерами, поэтому в набор включают и сложные случаи. На них же проверяют систему: если на контрольном наборе с реальным качеством медиа точность приемлема — она приемлема и в жизни.
Оценка качества мультимодальных систем
Мультимодальные ответы проверять труднее текстовых: «правильно ли описана фотография» — вопрос с широкой шкалой. Рабочие подходы: контрольные наборы с эталонными описаниями и полями, попарные сравнения ответов людьми, и автоматические метрики там, где ответ машиночитаем — извлечённые реквизиты сверяются со связкой «источник-эталон». Отдельно проверяют устойчивость: те же входы в другом разрешении, сжатии и освещении должны давать тот же результат — иначе система ловит артефакты кодирования вместо смысла.
И финальный рубеж — человек в контуре на чувствительных сценариях: там, где мультимодальная модель выносит вердикты (соответствие фото регламенту, подлинность документа), её ответ — рекомендация для специалиста, а не приговор.
Типовая архитектура мультимодального процесса
Рабочая схема обработки смешанных входов выглядит как конвейер с общей шиной. Приём: файлы попадают в систему с метаданными источника. Нормализация: изображения приводятся к рабочему разрешению, аудио — к единому формату, избыточные копии отсеиваются. Распознавание: модель извлекает содержание — текст со скана, речь из записи. Понимание: извлечённое и исходное содержание уходит в мультимодальную модель вместе с задачей. Проверка: guardrails контролируют и вход (вредоносные вложения), и выход (утечки, запрещённое содержание). Фиксация: результат и его обоснование записываются в журнал с указанием источников.
Звенья могут заменяться: на простых сценариях достаточно одного вызова готовой модели, на сложных конвейер обрастает ветками и проверками. Принцип неизменен: путь от сырого файла до проверенного ответа должен быть единым и журналируемым — тогда «на основании чего принято решение» имеет документальный ответ.
Стоимость мультимодальных сценариев
Экономика мультимодальности считается по трём статьям, и входы — не всегда главная. Обработка: медиа занимают больше контекста, и каждый скан или минута записи стоит дороже текстового эквивалента; экономится это приоритетным выбором модальностей — распознавать только то, что несёт информацию для задачи, а не всё подряд. Хранение: индексы медиа тяжелее текстовых, архивы растут быстрее, жизненный цикл хранения фиксируется политикой. Интеграция: смешанные потоки требуют конвейеров нормализации и журналирования — постоянная, но предсказуемая статья.
Сравнивать стоит не «мультимодально против текстово», а полные стоимости двух архитектур: мультимодальный конвейер против связки «распознавание плюс текстовая модель плюс интеграция между ними». На смешанных входах конвейер обычно выигрывает и по деньгам, и по надёжности: меньше стыков — меньше точек отказа.
С чего начать
Найдите процесс, где входы действительно смешанные: сканы с фото, звонки с экранами, полевые заявки с изображениями. Отмерьте сто реальных кейсов, проверьте на них готовые модели и посчитайте стоимость обработки. Эффект и цена станут конкретными. Пилот на ваших данных — в бесплатном разборе ИИ-ландшафта.
- процесс с подлинно смешанными входами, а не «красивый кейс»;
- сто кейсов из производства с реальным качеством медиа;
- проверка готовых моделей без обучения;
- расчёт стоимости обработки кейса до внедрения;
- контур фильтрации входов и выходов заложен сразу.
Мультимодальность окупается там, где смешанные входы уже сегодня обрабатываются людьми: ассистент, читающий скан и слышащий звонок, забирает у команды именно эту рутину и делает её измеримой. Если входы однотипны — достаточно текстового решения, и честный пилот это покажет раньше, чем бюджет будет потрачен на ненужную универсальность — как и в любом другом ИИ-решении, выбор модальностей подчиняется задаче, а не тренду года; именно поэтому каждый сценарий начинается с замера, а не с закупки.