Разметка данных — невидимая половина любого ИИ. Модель учится на примерах «вход — правильный ответ», и эти правильные ответы кто-то должен указать. Вот человек обводит рамками поля в счёте-фактуре — модель учится находить их сама. Вот редактор помечает ответ ассистента «верный/неверный» — модель учится отличать одно от другого. Без меток обучение невозможно в принципе; с плохими метками оно вредно: модель честно выучит чужие ошибки и будет тиражировать их с уверенностью автомата.
Для языковых моделей разметка выглядит иначе, чем для классического машинного обучения: готовые модели уже обучены на огромных массивах текста, но чтобы модель работала с вашими документами и стандартами ответов, нужны свои размеченные данные — примеры диалогов, оценок, извлечённых полей. Чем точнее примеры, тем меньше их нужно; чем небрежнее, тем больше уходит на компенсацию шума.
Какие бывают типы разметки
- Классификация. Каждому объекту — метка категории: тональность отзыва, тема письма, тип документа.
- Выделение фрагментов. Где в тексте проходит сущность: реквизиты организации, суммы, даты, имена.
- Разметка документов. Поля и таблицы на сканах: что является графой, что продолжением шапки.
- Оценка ответов. Разметка диалогов ассистента: верно, неточно, вредно — то самое сырьё, из которого растут evals и дообучение.
- Попарные сравнения. Какой из двух ответов лучше — основа обучения с подкреплением, о котором рассказано в статье RLHF.
Кто делает разметку
Варианта три. Первый — штатные эксперты: дороже, но точнее на узкой предметке, где нужна экспертиза. Второй — подрядчики и краудсорсинг: быстро и масштабно, но требует инструкций, обучения и многослойного контроля. Третий — полуавтоматическая разметка: черновые метки ставит модель, люди проверяют и правят; при правильной организации скорость вырастает в разы при том же качестве. Для чувствительных данных существует и четвёртый путь — федеративное обучение, при котором данные не покидают своих контуров.
Как контролировать качество
Качество меряется согласованностью. Рабочие механизмы: двойная разметка одних и тех же объектов разными людьми с подсчётом расхождений; золотые задания — подмешанные примеры с известным правильным ответом, по которым оценивается точность аннотатора; арбитраж — спорные случаи уходит старшему эксперту. Правило инструкций: чем короче и однозначнее инструкция, тем выше согласованность; спорные формулировки не «разбираются по ходу», а возвращаются в инструкцию новым пунктом.
Зачем бизнесу и где применяется у НЬЮ-ССТ
- Качество модели. Хотите ассистента, отвечающего в вашем стиле и по вашим стандартам, — подготовьте размеченные примеры; это дешевле, чем борьба с чужими паттернами.
- Контроль деградации. Свежая разметка реальных диалогов — топливо для переобучения при дрейфе.
- Приёмка. Размеченные эталоны — единственный честный способ принять работу подрядчика по модели: сверка с эталонами, а не демонстрация.
- Аудируемость. Происхождение данных и правила разметки фиксируются в документации ИИ-актива — вопрос «на чём обучено» получает ответ.
У НЬЮ-ССТ разметка входит в проекты машинного обучения и данных как сервиса: инструкции, контроль согласованности, золотые наборы, полуавтоматические конвейеры. Подготовка обучающего набора под задачу — от 90 000 ₽; полное решение с моделью — от 0,9–1,2 млн ₽.
Риски и безопасность
Риск первый — персональные данные: в разметку попадают реальные диалоги, документы, сканы; передача их подрядчику без обезличивания — нарушение режима защиты ПДн. Снимается анонимизацией и работой в контуре заказчика. Риск второй — отравление данных: вредоносные метки, внесённые в набор, превращают обучение в канал закладки. Риск третий — субъективность: «правильный» ответ, собранный с мнений трёх людей, обучает модель усреднённому вкусу, а не стандарту компании. Риск четвёртый — безоглядная синтетика: сгенерированные примеры дёшевы, но переносят предубеждения генератора; их применяют как добавку, а не как замену.
Типовые ошибки
Ошибка первая — «разметит кто угодно»: сложную предметку отдают случайным людям без обучения и получают красивый по объёму и мусорный по качеству набор. Ошибка вторая — нет измерения согласованности: качество разметки никто не считал, о нём узнают по качеству модели, когда поздно. Ошибка третья — инструкция-роман: после тридцатой страницы аннотаторы читают по диагонали. Ошибка четвёртая — замороженные эталоны: набор собран при запуске и не пополняется, хотя реальные вопросы меняются каждый квартал.
Экономика
Разметка — самая недооценённая строка бюджета ИИ-проекта: в классическом машинном обучении она регулярно превышает стоимость самого обучения. Снижение стоимости — не экономией на людях, а организацией: полуавтоматическая разметка, точные инструкции, приоритизация сложных случаев людьми при автоматической обработке простых. Каждый рубль в качество меток экономит несколько рублей на доработках модели.
Конвейер разметки: от сырых данных до набора
Зрелая разметка — это конвейер, а не толпа людей с таблицами. Первый этап — отбор: какие объекты вообще размечать; случайная выборка из потока почти всегда хуже целевой, собранной по частям реальных вопросов, где модель будет работать. Второй — инструкция: короткая, с примерами на каждый спорный случай. Третий — пилот на пятидесяти объектах: двое аннотаторов, замер согласованности, доработка инструкции. Четвёртый — основной прогон с подмешанными золотыми заданиями. Пятый — приёмка: подсчёт итоговой согласованности, арбитраж спорных, фиксация версий набора.
Каждый этап оставляет артефакт: список отбора, инструкция с версией, протокол пилота, журнал золотых заданий, отчёт приёмки. Через год эти документы отвечают на вопрос «откуда взялся набор и почему ему можно верить» — а без них набор превращается в ненаглядное наследие, которое боятся трогать.
Сколько стоит разметка: структура затрат
Бюджет разметки складывается из четырёх частей, и сама разметка — не самая большая. Подготовка (отбор, инструкция, пилот) занимает до трети срока проекта; контроль (двойные прогоны, арбитраж, золотые задания) — ещё пятая часть; управление версиями и хранение набора — постоянная, но скромная статья. Наивная оценка «заплатим N аннотаторам» регулярно проваливается на первых двух пунктах: плохая инструкция удваивает объём переделок, отсутствие пилота утраивает.
Рациональная экономия существует, но она организационная: полуавтоматическая предразметка с человеческой проверкой, приоритизация сложных случаев, переиспользование разметки между задачами — извлечённые поля документа годятся и для классификации, и для поиска. Анти-экономия — урезание контроля: она проявляется не в смете, а в качестве модели, когда переделывать дороже, чем размечать заново.
Разметка и качество модели: зависимость
Связь между качеством меток и качеством модели жёстче, чем кажется. Модель не отличает ошибку разметки от закономерности: противоречивые метки она усредняет, систематическую ошибку — честно выучивает. Отсюда эмпирическое правило: сначала согласованность, потом объём. Набор из пяти тысяч объектов с согласованностью девяносто процентов обучает лучше, чем двадцать тысяч с семьюдесяти: во втором случае модель тратит ёмкость на шум. Расширение набора имеет смысл только после того, как согласованность вытянута — иначе масштабируется брак.
Вторая зависимость — представительность: набор обязан покрывать реальное распределение случаев, включая редкие. Модель, обученная на лёгких примерах, на первом же сложном случае из производства выдаёт уверенную бессмыслицу. Поэтому в отбор включают хвосты: необычные документы, спорные диалоги, пограничные ситуации — то, что в потоке встречается редко, а в инцидентах — постоянно.
Правовая и этическая рамка
Разметка — одно из немногих мест, где ИИ-проект напрямую соприкасается с трудом людей и персональными данными одновременно. Три правила закрывают большинство рисков. Первое — данные в контуре: диалоги и документы с персональными данными размечаются обезличенными или на стороне заказчика; выгрузка «как есть» внешним исполнителям недопустима. Второе — прозрачность условий: аннотаторы понимают, что размечают и для чего; подозрительные с точки зрения этики задачи — например, профилирование людей по защищённым признакам — отсекаются до начала работ. Третье — прослеживаемость: у каждой метки есть автор и время, у набора — версия и происхождение; при споре о решении модели цепочка «данные — метка — обучение» восстанавливается документально.
С чего начать
Определите сто объектов из вашей реальности и «правильные ответы» к ним — глазами эксперта. Разметьте дважды: двумя людьми, посчитайте расхождения — вы увидите, однозначна ли ваша задача. Ровно этот набор станет ядром и обучающих данных, и приёмочных тестов. Стартовый набор — в бесплатном разборе ИИ-ландшафта.
- сто объектов из живого потока, а не из головы;
- инструкция на одну страницу с примерами;
- двойная разметка и замер согласованности до основного прогона;
- золотые задания подмешаны в поток;
- версия набора и происхождение данных зафиксированы.
Этот минимальный каркас — отбор, инструкция, двойная разметка, золотые задания, версии — одинаково работает и для ста объектов пилота, и для промышленного потока; масштабируется он людьми и инструментами, а не отменой контроля.