Разработчик экосистемы ВЫШКА Cloud

+7 (4852) 60-91-96 Обсудить проект
Словарь ИИ · определения

Что такое разметка данных?

Актуально на 20 сентября 2026. MLOps — практики автоматизации жизненного цикла моделей: данные, обучение, реестр, деплой, мониторинг, переобучение. Разобрали: как работает контур MLOps — шаги цикла, специфика MLOps для LLM и зачем бизнесу и где применяется у НЬЮ-ССТ.

Разметка данных — это процесс присвоения обучающих меток: люди или контролируемые модели указывают машине, что считать правильным — где на документе проходит таблица, какой ответ верен, какова тональность реплики; качество разметки напрямую ограничивает качество модели сверху.

Опубликовано: 21 сентября 2026 · Обновлено: 21 сентября 2026 · ООО «НЬЮ-ССТ»

Разметка данных — невидимая половина любого ИИ. Модель учится на примерах «вход — правильный ответ», и эти правильные ответы кто-то должен указать. Вот человек обводит рамками поля в счёте-фактуре — модель учится находить их сама. Вот редактор помечает ответ ассистента «верный/неверный» — модель учится отличать одно от другого. Без меток обучение невозможно в принципе; с плохими метками оно вредно: модель честно выучит чужие ошибки и будет тиражировать их с уверенностью автомата.

Для языковых моделей разметка выглядит иначе, чем для классического машинного обучения: готовые модели уже обучены на огромных массивах текста, но чтобы модель работала с вашими документами и стандартами ответов, нужны свои размеченные данные — примеры диалогов, оценок, извлечённых полей. Чем точнее примеры, тем меньше их нужно; чем небрежнее, тем больше уходит на компенсацию шума.

Какие бывают типы разметки

  • Классификация. Каждому объекту — метка категории: тональность отзыва, тема письма, тип документа.
  • Выделение фрагментов. Где в тексте проходит сущность: реквизиты организации, суммы, даты, имена.
  • Разметка документов. Поля и таблицы на сканах: что является графой, что продолжением шапки.
  • Оценка ответов. Разметка диалогов ассистента: верно, неточно, вредно — то самое сырьё, из которого растут evals и дообучение.
  • Попарные сравнения. Какой из двух ответов лучше — основа обучения с подкреплением, о котором рассказано в статье RLHF.

Кто делает разметку

Варианта три. Первый — штатные эксперты: дороже, но точнее на узкой предметке, где нужна экспертиза. Второй — подрядчики и краудсорсинг: быстро и масштабно, но требует инструкций, обучения и многослойного контроля. Третий — полуавтоматическая разметка: черновые метки ставит модель, люди проверяют и правят; при правильной организации скорость вырастает в разы при том же качестве. Для чувствительных данных существует и четвёртый путь — федеративное обучение, при котором данные не покидают своих контуров.

Как контролировать качество

Качество меряется согласованностью. Рабочие механизмы: двойная разметка одних и тех же объектов разными людьми с подсчётом расхождений; золотые задания — подмешанные примеры с известным правильным ответом, по которым оценивается точность аннотатора; арбитраж — спорные случаи уходит старшему эксперту. Правило инструкций: чем короче и однозначнее инструкция, тем выше согласованность; спорные формулировки не «разбираются по ходу», а возвращаются в инструкцию новым пунктом.

Зачем бизнесу и где применяется у НЬЮ-ССТ

  • Качество модели. Хотите ассистента, отвечающего в вашем стиле и по вашим стандартам, — подготовьте размеченные примеры; это дешевле, чем борьба с чужими паттернами.
  • Контроль деградации. Свежая разметка реальных диалогов — топливо для переобучения при дрейфе.
  • Приёмка. Размеченные эталоны — единственный честный способ принять работу подрядчика по модели: сверка с эталонами, а не демонстрация.
  • Аудируемость. Происхождение данных и правила разметки фиксируются в документации ИИ-актива — вопрос «на чём обучено» получает ответ.

У НЬЮ-ССТ разметка входит в проекты машинного обучения и данных как сервиса: инструкции, контроль согласованности, золотые наборы, полуавтоматические конвейеры. Подготовка обучающего набора под задачу — от 90 000 ₽; полное решение с моделью — от 0,9–1,2 млн ₽.

Риски и безопасность

Риск первый — персональные данные: в разметку попадают реальные диалоги, документы, сканы; передача их подрядчику без обезличивания — нарушение режима защиты ПДн. Снимается анонимизацией и работой в контуре заказчика. Риск второй — отравление данных: вредоносные метки, внесённые в набор, превращают обучение в канал закладки. Риск третий — субъективность: «правильный» ответ, собранный с мнений трёх людей, обучает модель усреднённому вкусу, а не стандарту компании. Риск четвёртый — безоглядная синтетика: сгенерированные примеры дёшевы, но переносят предубеждения генератора; их применяют как добавку, а не как замену.

Типовые ошибки

Ошибка первая — «разметит кто угодно»: сложную предметку отдают случайным людям без обучения и получают красивый по объёму и мусорный по качеству набор. Ошибка вторая — нет измерения согласованности: качество разметки никто не считал, о нём узнают по качеству модели, когда поздно. Ошибка третья — инструкция-роман: после тридцатой страницы аннотаторы читают по диагонали. Ошибка четвёртая — замороженные эталоны: набор собран при запуске и не пополняется, хотя реальные вопросы меняются каждый квартал.

Экономика

Разметка — самая недооценённая строка бюджета ИИ-проекта: в классическом машинном обучении она регулярно превышает стоимость самого обучения. Снижение стоимости — не экономией на людях, а организацией: полуавтоматическая разметка, точные инструкции, приоритизация сложных случаев людьми при автоматической обработке простых. Каждый рубль в качество меток экономит несколько рублей на доработках модели.

Конвейер разметки: от сырых данных до набора

Зрелая разметка — это конвейер, а не толпа людей с таблицами. Первый этап — отбор: какие объекты вообще размечать; случайная выборка из потока почти всегда хуже целевой, собранной по частям реальных вопросов, где модель будет работать. Второй — инструкция: короткая, с примерами на каждый спорный случай. Третий — пилот на пятидесяти объектах: двое аннотаторов, замер согласованности, доработка инструкции. Четвёртый — основной прогон с подмешанными золотыми заданиями. Пятый — приёмка: подсчёт итоговой согласованности, арбитраж спорных, фиксация версий набора.

Каждый этап оставляет артефакт: список отбора, инструкция с версией, протокол пилота, журнал золотых заданий, отчёт приёмки. Через год эти документы отвечают на вопрос «откуда взялся набор и почему ему можно верить» — а без них набор превращается в ненаглядное наследие, которое боятся трогать.

Сколько стоит разметка: структура затрат

Бюджет разметки складывается из четырёх частей, и сама разметка — не самая большая. Подготовка (отбор, инструкция, пилот) занимает до трети срока проекта; контроль (двойные прогоны, арбитраж, золотые задания) — ещё пятая часть; управление версиями и хранение набора — постоянная, но скромная статья. Наивная оценка «заплатим N аннотаторам» регулярно проваливается на первых двух пунктах: плохая инструкция удваивает объём переделок, отсутствие пилота утраивает.

Рациональная экономия существует, но она организационная: полуавтоматическая предразметка с человеческой проверкой, приоритизация сложных случаев, переиспользование разметки между задачами — извлечённые поля документа годятся и для классификации, и для поиска. Анти-экономия — урезание контроля: она проявляется не в смете, а в качестве модели, когда переделывать дороже, чем размечать заново.

Разметка и качество модели: зависимость

Связь между качеством меток и качеством модели жёстче, чем кажется. Модель не отличает ошибку разметки от закономерности: противоречивые метки она усредняет, систематическую ошибку — честно выучивает. Отсюда эмпирическое правило: сначала согласованность, потом объём. Набор из пяти тысяч объектов с согласованностью девяносто процентов обучает лучше, чем двадцать тысяч с семьюдесяти: во втором случае модель тратит ёмкость на шум. Расширение набора имеет смысл только после того, как согласованность вытянута — иначе масштабируется брак.

Вторая зависимость — представительность: набор обязан покрывать реальное распределение случаев, включая редкие. Модель, обученная на лёгких примерах, на первом же сложном случае из производства выдаёт уверенную бессмыслицу. Поэтому в отбор включают хвосты: необычные документы, спорные диалоги, пограничные ситуации — то, что в потоке встречается редко, а в инцидентах — постоянно.

Правовая и этическая рамка

Разметка — одно из немногих мест, где ИИ-проект напрямую соприкасается с трудом людей и персональными данными одновременно. Три правила закрывают большинство рисков. Первое — данные в контуре: диалоги и документы с персональными данными размечаются обезличенными или на стороне заказчика; выгрузка «как есть» внешним исполнителям недопустима. Второе — прозрачность условий: аннотаторы понимают, что размечают и для чего; подозрительные с точки зрения этики задачи — например, профилирование людей по защищённым признакам — отсекаются до начала работ. Третье — прослеживаемость: у каждой метки есть автор и время, у набора — версия и происхождение; при споре о решении модели цепочка «данные — метка — обучение» восстанавливается документально.

С чего начать

Определите сто объектов из вашей реальности и «правильные ответы» к ним — глазами эксперта. Разметьте дважды: двумя людьми, посчитайте расхождения — вы увидите, однозначна ли ваша задача. Ровно этот набор станет ядром и обучающих данных, и приёмочных тестов. Стартовый набор — в бесплатном разборе ИИ-ландшафта.

  • сто объектов из живого потока, а не из головы;
  • инструкция на одну страницу с примерами;
  • двойная разметка и замер согласованности до основного прогона;
  • золотые задания подмешаны в поток;
  • версия набора и происхождение данных зафиксированы.

Этот минимальный каркас — отбор, инструкция, двойная разметка, золотые задания, версии — одинаково работает и для ста объектов пилота, и для промышленного потока; масштабируется он людьми и инструментами, а не отменой контроля.

Частые вопросы

Это подготовка обучающих примеров: человеку показывают объект — документ, реплику, скан — и он указывает правильный ответ: где поля, какая тема, верен ли ответ ассистента. По этим примерам модель учится.

Для базового применения нет, для качественной работы в ваших процессах да: примеры правильных ответов, извлечённых полей и оценок диалогов превращают универсальную модель в вашу.

Согласованностью: одни объекты размечают несколько людей и считают расхождения, в поток подмешивают задания с известными ответами, спорные случаи разбирает арбитраж. Итоговую согласованность фиксируют в отчёте приёмки — она часть договора, а не внутренняя метрика исполнителя.

Только с обезличиванием или в замкнутом контуре: реальные диалоги и сканы содержат персональные данные, и передача их внешним аннотаторам без защиты недопустима.

Бесплатный разбор ТЗ

Пришлите ТЗ, описание процесса или ссылку на закупку — оценим объём, дадим смету «от…» и честно скажем, какой формат вам нужен: пилот или полный контракт.

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Не хватает ответа на ваш вопрос?

Разбор задачи бесплатный и без звонков «просто так»: за 1 рабочий день вернём оценку объёма, смету «от…» и честный ответ, нужен ли вам пилот, MVP или полный контракт.

Бесплатный разбор ТЗ Контакты

Цены и рыночные данные приведены по состоянию на сентябрь 2026 года. НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ). Материал носит информационный характер и не является публичной офертой.