Разработчик экосистемы ВЫШКА Cloud

+7 (4852) 60-91-96 Обсудить проект
Словарь ИИ · определения

Что такое база знаний?

Актуально на 20 сентября 2026. MLOps — практики автоматизации жизненного цикла моделей: данные, обучение, реестр, деплой, мониторинг, переобучение. Разобрали: как работает контур MLOps — шаги цикла, специфика MLOps для LLM и зачем бизнесу и где применяется у НЬЮ-ССТ.

База знаний — структурированное хранилище документов и фактов компании, подготовленное для работы ИИ-ассистента: регламенты, инструкции, каталоги и переписка приведены к формату, пригодному для поиска по смыслу, цитирования и контроля свежести.

Опубликовано: 21 сентября 2026 · Обновлено: 21 сентября 2026 · ООО «НЬЮ-ССТ»

База знаний — это контентная половина корпоративного ассистента. Модель отвечает не «из головы», а по документам компании: положила их в индекс — получает источник, не положила — получает догадки. Качество ответов ассистента ограничено качеством базы знаний сверху: самая дорогая модель на устаревшем и захламлённом индексе отвечает хуже, чем средняя модель на чистом и свежем.

Отличие от сетевой папки принципиальное. В хранилище файлов документы лежат для человека, который сам откроет нужный PDF и прочитает его. В базе знаний те же документы разобраны для машины: текст извлечён, разбит на фрагменты, переведён в векторные представления и снабжён метаданными — источником, датой, разделом, владельцем. Как именно текст режется на куски и почему это влияет на точность, разобрано в понятии RAG и его производном RAG-пайплайне.

Из чего состоит база знаний

  • Источник правды. Регламенты, стандарты, договоры, описания услуг, базы тикетов. У каждого документа — владелец и дата действия.
  • Извлечённый текст. Сканы и PDF проходят распознавание; таблицы и схемы сохраняются в машиночитаемом виде, а не картинкой.
  • Фрагменты и векторы. Текст делится на фрагменты, каждый переводится в вектор моделью эмбеддингов и складывается в векторную базу данных.
  • Метаданные и права. Кто может спрашивать про этот документ, до какой даты он действителен, из какого раздела пришёл фрагмент.
  • Процедура обновления. Регламент: кто добавляет, кто проверяет, что происходит со ссылкой на отменённый документ.

Как ассистент работает с базой

Схема одинакова почти везде: вопрос пользователя превращается в вектор, из базы достаются ближайшие по смыслу фрагменты, они подставляются в контекст модели вместе с вопросом, и модель формулирует ответ с указанием источников. На стыке работают два механизма повышения точности: семантический поиск находит перефразированные формулировки, а реранкер пересортировывает найденное по релевантности к конкретному вопросу. Слова вопроса и документы встречаются в одном пространстве — как строятся эмбеддинги для русского языка, показано в обзоре моделей эмбеддингов.

Зачем бизнесу и где применяется у НЬЮ-ССТ

  • Ответы с источником. Сотрудник и клиент получают не мнение модели, а цитату из действующего регламента — проверяемую ссылку вместо «мне кажется».
  • Единая точка правды. Разрозненные инструкции собираются в один индекс; поиск занимает секунды вместо рассылки «кто помнит, как правильно».
  • Ускорение онбординга. Новый сотрудник спрашивает ассистента, а не копает структуру сетевых дисков.
  • Контроль устаревания. Даты действия в метаданных превращают «актуален ли документ» из вопроса веры в вопрос запроса.

У НЬЮ-ССТ базы знаний строятся под ИИ-ассистентов на данных компании: аудит документов, разметка прав доступа, настройка индекса и регламента обновления. Разработка решения с базой знаний — от 0,9–1,2 млн ₽; ревизия существующей базы и настройка пополнения — от 90 000 ₽.

Риски и безопасность

Первый риск — права доступа. База, в которую ассистент видит всё, а пользователи — не всё, превращает вопрос в канал утечки: «процитируй проект приказа из закрытого раздела» срабатывает так же легко, как вопрос про график отпусков. Разграничение переносится в индекс: фрагмент наследует права документа.

Второй — персональные данные. В базу попадают переписка и кадровые документы; перед индексацией их чистят или обезличивают — подходы разобраны в статье об анонимизации данных для LLM. Третий — устаревание: ссылка на отменённый регламент опаснее отсутствия ответа. Четвёртый — промпт-инъекция через вредоносный текст внутри самого документа, попавшего в индекс.

Типовые ошибки

Ошибка первая — «залить всё». Когда в индекс уходит архив за десять лет с дублями и черновиками, ассистент цитирует отменённую версию, потому что она длиннее. Ошибка вторая — база без владельца: документы добавляет тот, кто вспомнил, никто не отменяет старые. Ошибка третья — сканы без распознавания: страница-картинка не ищется по смыслу. Ошибка четвёртая — отсутствие метрик: никто не измеряет долю вопросов без ответа и долю ответов с неверной ссылкой, поэтому деградация базы незаметна.

Экономика

Стоимость складывается из трёх частей: построение (аудит, извлечение текста, индексация), эксплуатация (пересборка индекса, хранение, инференс при каждом ответе) и содержание (поддержание свежести). Самая недооценённая — третья: без регламента обновления база тихо гниёт, и вложения в построение обесцениваются за год. Обратная сторона — эффект масштаба: каждая новая услуга или отдел использует ту же базу и тот же поиск.

База знаний и векторная база: как они связаны

Их часто путают. Векторная база — программный продукт, хранилище эмбеддингов с быстрым поиском ближайших соседей; это двигатель. База знаний — содержимое: сами документы, правила их отбора, права, владельцы и регламент обновления; это топливо и дисциплина. Можно построить превосходную векторную базу на мусорном корпусе — и получить быстрый поиск по неправильным документам. Поэтому проект базы знаний начинается не с выбора векторной СУБД, а с аудита: какие документы отвечают на реальные вопросы, какие устарели, какие дублируют друг друга.

Практический ориентир: полезная база знаний компании среднего размера — это десятки и сотни документов, а не десятки тысяч. Отбор важнее полноты: ассистент, который отвечает по пятидесяти актуальным регламентам, полезнее ассистента, который тонет в архиве вместе с черновиками и отменёнными версиями. Расширение базы — управляемый процесс с метриками, а не заливка всего подряд.

Метрики здоровья базы

  • Покрытие. Доля реальных вопросов, на которые в базе есть материал. Всё, что ниже — вопросы без ответа и повод пополнить индекс.
  • Свежесть. Доля документов с непросроченной датой действия и датой проверки владельцем.
  • Точность цитирования. Доля ответов, где указан корректный источник; проверяется выборочной разметкой.
  • Скорость пополнения. Сколько дней проходит от появления документа до его работы в базе.

Эти четыре цифры, снятые ежемесячно, дают базе знаний то, что серверу даёт мониторинг: объективную картину вместо ощущений. И они же — план работ: низкое покрытие — собирать вопросы, падение свежести — трясти владельцев, ошибки цитирования — править фрагментацию и реранкинг.

База знаний и корпоративные системы

База знаний редко живёт в вакууме: её источники — СЭД, 1С, CRM и файловые хранилища. Интеграция решает два вопроса. Первый — первичная загрузка: документы выгружаются из систем-источников с их реквизитами и статусами, а не пересылаются почтой. Второй — синхронизация: изменение документа в СЭД запускает обновление фрагмента в индексе, отмена — исключение. Без автоматической синхронизации база отрывается от источников за квартал и начинает противоречить им; с ней — остаётся зеркалом действующего документооборота.

Практичный масштаб интеграции зависит от динамики документов: при десятке изменений в месяц хватает ручного регламента с уведомлениями; при сотнях нужна автоматическая связка. Начинают с ручного режима на пилотном разделе — и автоматизируют те пути, где ручной уже не справляется, а не наоборот.

Частые возражения и честные ответы

«Документы и так есть в 1С — зачем ещё база?» Затем, что поиск в учётной системе заточен под реквизиты документов, а не под смысловые вопросы сотрудников; база знаний не заменяет 1С, а даёт по ней человеческий способ спрашивать. «Ассистент наговорит лишнего?» Наговорит, если отвечать ему нечем: база с источниками и правилами цитирования держит ответ в рамках документов. «Кто будет всё это поддерживать?» Владелец базы и регламент — при правильно выбранном объёме это часы в месяц, а не вторая ставка; попытка обслуживать неограниченный архив — вот что съедает людей.

Версионирование базы знаний

База, которая меняется без следов, не поддаётся аудиту. Рабочая дисциплина: каждое состояние индекса имеет версию — состав документов, дату сборки, параметры фрагментации; изменения фиксируются журналом «что добавлено, что исключено, кем и почему»; по спорному ответу можно восстановить, какая версия базы была активна в момент диалога. Это стоит минут, а закрывает два дорогих сценария: разбор инцидента («ассистент сослался на отменённый документ» — проверяется журналом за минуту) и откат (вернуться к предыдущей версии индекса — штатная операция, а не реконструкция).

С чего начать

Возьмите один процесс с измеримой болью — например, вопросы сотрудников к регламентам — и один раздел документов. Соберите базу по нему, дайте ассистенту отвечать с цитатами и замерьте долю правильных ответов. Дальше расширение — механическая работа. Карта ваших документов и план базы знаний — в бесплатном разборе ИИ-ландшафта.

  • раздел документов с явным владельцем и датами действия;
  • пятьдесят реальных вопросов сотрудников как контрольная выборка;
  • индекс с метаданными и правами, унаследованными от источника;
  • ассистент с обязательным цитированием и честным «не нашёл»;
  • ежемесячные метрики: покрытие, свежесть, точность цитат.

Частые вопросы

В папке документы лежат для человека, который сам найдёт и прочитает файл. В базе знаний текст извлечён, разбит на фрагменты, переведён в векторы и снабжён метаданными и правами — по этому индексу ищет и цитирует ИИ-ассистент.

Переписывать не нужно, но привести в порядок да: убрать дубли и отменённые версии, распознать сканы, проставить владельцев и даты. Чем чище источник, тем точнее ответы.

Это определяется правами доступа, перенесёнными в индекс: если документ закрыт для сотрудника, ассистент не цитирует его в ответе. Без этого база становится каналом утечки.

Регламентом обновления: у документа есть владелец и срок действия, новые версии заменяют старые в индексе, отменённые исключаются, а метрики отслеживают долю вопросов без ответа.

Бесплатный разбор ТЗ

Пришлите ТЗ, описание процесса или ссылку на закупку — оценим объём, дадим смету «от…» и честно скажем, какой формат вам нужен: пилот или полный контракт.

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Не хватает ответа на ваш вопрос?

Разбор задачи бесплатный и без звонков «просто так»: за 1 рабочий день вернём оценку объёма, смету «от…» и честный ответ, нужен ли вам пилот, MVP или полный контракт.

Бесплатный разбор ТЗ Контакты

Цены и рыночные данные приведены по состоянию на сентябрь 2026 года. НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ). Материал носит информационный характер и не является публичной офертой.