Модель не может выучить то, чего нет в данных
Каждая вторая неудача ИИ-проекта — не «плохая модель», а плохие данные: разметка делалась наспех, классы перекошены, границы понятий плывут, спорные случаи никто не согласовывал. Модель честно учится тому, что ей показали, — и на проде воспроизводит весь этот бардак. Переразметка после провала стоит дороже правильной методики с первого дня.
Профессиональная разметка — это не «люди кликают по картинкам», а дисциплина: инструкция с определениями и примерами, откалиброванные аннотаторы, двойная разметка с измерением согласия, арбитраж спорных случаев, контроль перекоса классов и версионирование датасета. Современный процесс ускоряется ИИ: модель готовит черновую разметку, люди проверяют и правят — скорость растёт в разы, а качество контролируется метриками, а не обещаниями.
Когда нужна профессиональная разметка
- Дообучаете модель под свою задачу. Своя классификация документов, свой тональный анализ, свои категории обращений — модели нужны примеры именно вашей задачи, разметанные по вашим правилам.
- Строите RAG и поиск. Правильные пары «вопрос — релевантный документ», тестовые наборы для оценки качества поиска — без них вы не отличите «стало лучше» от «кажется, что лучше» (см. гайд по подготовке данных для RAG).
- OCR и извлечение данных буксуют. Ваши документы нестандартны: свои шаблоны, почерки, сканы. Для дообучения извлечения полей нужны размеченные образцы — иначе модель путается в том, что «очевидно» вашему бухгалтеру.
- Компьютерное зрение. Детекция объектов, сегментация, контроль качества по фото — каждая задача требует своего датасета с точной разметкой рамок и масок.
- Аудио и речь. Транскрипции звонков для обучения или настройки распознавания, разметка спикеров, тем, эмоций — основа speech analytics.
- Данные есть, но в хаосе. Разные форматы, дубликаты, противоречия — нужен аудит и приведение в датасет, а не «загрузим как есть и посмотрим».
Что делаем
Методика и инструкция
Определяем классы, границы понятий и спорные случаи; пишем инструкцию с примерами, которую понимает аннотатор без «телепатии». Это фундамент воспроизводимой разметки.
ИИ-ассистированная разметка
Модель готовит черновик, аннотаторы проверяют и правят: скорость выше ручной в разы, стоимость ниже, а люди занимаются сложными случаями, а не кликерством.
Контроль качества
Двойная разметка с измерением согласия, арбитраж спорных, приёмка по метрикам на контрольных выборках. Качество подтверждается цифрами, а не «ну вроде нормально».
Синтетические данные
Где реальных примеров мало (редкие случаи, аномалии), генерируем контролируемую синтетику с проверкой реалистичности — расширяем датасет без ожидания года накопления.
Форматирование под задачу
Датасет готовится в формате вашего фреймворка и модели: разбиение train/val/test, балансировка, версионирование — берите и обучайте, без «дочистки напильником».
Документация и передача
Инструкция, словарь классов, протоколы контроля, известные ограничения датасета. Датасет — ваш актив: он должен быть понятен любой команде, которая будет его использовать.
Как проходит работа: этапы
- Разбор — бесплатно, 1 рабочий день. Присылаете описание задачи и примеры данных (обезличенные) — возвращаемся с планом и вилкой цен.
- Аудит данных и методика — от 90 000 ₽, 1–2 недели. Оцениваем объём, качество, чувствительность; определяем классы и схему разметки; пишем инструкцию и готовим контрольные выборки.
- Датасет-прототип — от 150 000 ₽, 2–3 недели. Размечаем первый массив с полным контролем качества: метрики согласия, отчёт по спорным случаям, готовый формат для обучения.
- Пилот с обучением — от 480 000 ₽, 4–6 недель. Полный цикл: пайплайн разметки, обучение/дообучение модели на датасете (ML-моделирование), оценка качества на отложенной выборке.
- Масштабирование. Датасет растёт под прод-нагрузку: доклады новых данных, актуализация классов, переобучение по регламенту — 0,9–1,2 млн ₽ для полного датасет-контура.
- Сопровождение — от 50 000 ₽/мес. Разметка входящего потока, контроль дрейфа данных, пополнение датасета по мере изменения задачи.
Технологии и подход
Инструменты выбираем под тип данных: текст и документы — LLM-ассистированная разметка со схемами структурированных выходов; аудио — локальное распознавание речи с последующей разметкой; документы — в связке с OCR. Чувствительные данные размечаем в изолированном контуре: обезличивание на входе, доступы по ролям, NDA с командой — требования 152-ФЗ выполняются до начала работ. Смежная услуга — данные как сервис (датапайплайны и витрины).
Цены и сроки
| Ступень | Цена | Срок |
|---|---|---|
| Разбор задачи и примеров | бесплатно | 1 рабочий день |
| Аудит данных и методика разметки | от 90 000 ₽ | 1–2 недели |
| Датасет-прототип с контролем качества | от 150 000 ₽ | 2–3 недели |
| Пилот: пайплайн + обучение модели | от 480 000 ₽ | 4–6 недель |
| Датасет-контур масштабирования | 0,9–1,2 млн ₽ | по дорожной карте |
| Сопровождение потока разметки | от 50 000 ₽/мес | постоянно |
Цены — «от», без НДС (УСН, п. 2 ст. 346.11 НК РФ). Сентябрь 2026. Ставки специалистов — 2 800–3 800 ₽/ч; рыночные ориентиры — в кейсах и ценах.
Смежные услуги и материалы
ML-моделирование
Обучение и дообучение моделей на вашем датасете. Прототип от 90 000 ₽.
Данные как сервис
Датапайплайны: сбор, качество, витрины, API. Аудит от 90 000 ₽.
OCR и извлечение данных
Дообучение извлечения под ваши документы. От 90 000 ₽.
Подготовка данных для поиска и ассистентов — гайд «Как подготовить данные для RAG»; оценка качества ответов моделей — гайд по метрикам.
Почему «дешёвая толпа аннотаторов» обходится дорого
Рынок предлагает разметку «по копейке за объект», и соблазн понятен. Но дешёвая разметка без методики — это лотерея: аннотаторы по-разному понимают инструкцию, спорные случаи решаются «как быстрее», согласие никем не измеряется. Модель учится противоречиям, а вы узнаёте об этом только на проде. Переделка датасета, повторное обучение и сортировка последствий стоят кратно дороже изначально правильного процесса — поэтому мы начинаем с методики (от 90 000 ₽), а не с «прогоните тысячу объектов попробовать».
Второй аргумент за методику — юридический: датасет из персональных данных или документов компании — актив с требованиями 152-ФЗ по доступу, хранению и обезличиванию. Наш процесс закрывает это на входе: обезличивание, контур, NDA, версионирование. На выходе вы получаете не «файл с разметкой», а документированный датасет, который можно показывать заказчикам, аудиторам и использовать годами.