База знаний — это контентная половина корпоративного ассистента. Модель отвечает не «из головы», а по документам компании: положила их в индекс — получает источник, не положила — получает догадки. Качество ответов ассистента ограничено качеством базы знаний сверху: самая дорогая модель на устаревшем и захламлённом индексе отвечает хуже, чем средняя модель на чистом и свежем.
Отличие от сетевой папки принципиальное. В хранилище файлов документы лежат для человека, который сам откроет нужный PDF и прочитает его. В базе знаний те же документы разобраны для машины: текст извлечён, разбит на фрагменты, переведён в векторные представления и снабжён метаданными — источником, датой, разделом, владельцем. Как именно текст режется на куски и почему это влияет на точность, разобрано в понятии RAG и его производном RAG-пайплайне.
Из чего состоит база знаний
- Источник правды. Регламенты, стандарты, договоры, описания услуг, базы тикетов. У каждого документа — владелец и дата действия.
- Извлечённый текст. Сканы и PDF проходят распознавание; таблицы и схемы сохраняются в машиночитаемом виде, а не картинкой.
- Фрагменты и векторы. Текст делится на фрагменты, каждый переводится в вектор моделью эмбеддингов и складывается в векторную базу данных.
- Метаданные и права. Кто может спрашивать про этот документ, до какой даты он действителен, из какого раздела пришёл фрагмент.
- Процедура обновления. Регламент: кто добавляет, кто проверяет, что происходит со ссылкой на отменённый документ.
Как ассистент работает с базой
Схема одинакова почти везде: вопрос пользователя превращается в вектор, из базы достаются ближайшие по смыслу фрагменты, они подставляются в контекст модели вместе с вопросом, и модель формулирует ответ с указанием источников. На стыке работают два механизма повышения точности: семантический поиск находит перефразированные формулировки, а реранкер пересортировывает найденное по релевантности к конкретному вопросу. Слова вопроса и документы встречаются в одном пространстве — как строятся эмбеддинги для русского языка, показано в обзоре моделей эмбеддингов.
Зачем бизнесу и где применяется у НЬЮ-ССТ
- Ответы с источником. Сотрудник и клиент получают не мнение модели, а цитату из действующего регламента — проверяемую ссылку вместо «мне кажется».
- Единая точка правды. Разрозненные инструкции собираются в один индекс; поиск занимает секунды вместо рассылки «кто помнит, как правильно».
- Ускорение онбординга. Новый сотрудник спрашивает ассистента, а не копает структуру сетевых дисков.
- Контроль устаревания. Даты действия в метаданных превращают «актуален ли документ» из вопроса веры в вопрос запроса.
У НЬЮ-ССТ базы знаний строятся под ИИ-ассистентов на данных компании: аудит документов, разметка прав доступа, настройка индекса и регламента обновления. Разработка решения с базой знаний — от 0,9–1,2 млн ₽; ревизия существующей базы и настройка пополнения — от 90 000 ₽.
Риски и безопасность
Первый риск — права доступа. База, в которую ассистент видит всё, а пользователи — не всё, превращает вопрос в канал утечки: «процитируй проект приказа из закрытого раздела» срабатывает так же легко, как вопрос про график отпусков. Разграничение переносится в индекс: фрагмент наследует права документа.
Второй — персональные данные. В базу попадают переписка и кадровые документы; перед индексацией их чистят или обезличивают — подходы разобраны в статье об анонимизации данных для LLM. Третий — устаревание: ссылка на отменённый регламент опаснее отсутствия ответа. Четвёртый — промпт-инъекция через вредоносный текст внутри самого документа, попавшего в индекс.
Типовые ошибки
Ошибка первая — «залить всё». Когда в индекс уходит архив за десять лет с дублями и черновиками, ассистент цитирует отменённую версию, потому что она длиннее. Ошибка вторая — база без владельца: документы добавляет тот, кто вспомнил, никто не отменяет старые. Ошибка третья — сканы без распознавания: страница-картинка не ищется по смыслу. Ошибка четвёртая — отсутствие метрик: никто не измеряет долю вопросов без ответа и долю ответов с неверной ссылкой, поэтому деградация базы незаметна.
Экономика
Стоимость складывается из трёх частей: построение (аудит, извлечение текста, индексация), эксплуатация (пересборка индекса, хранение, инференс при каждом ответе) и содержание (поддержание свежести). Самая недооценённая — третья: без регламента обновления база тихо гниёт, и вложения в построение обесцениваются за год. Обратная сторона — эффект масштаба: каждая новая услуга или отдел использует ту же базу и тот же поиск.
База знаний и векторная база: как они связаны
Их часто путают. Векторная база — программный продукт, хранилище эмбеддингов с быстрым поиском ближайших соседей; это двигатель. База знаний — содержимое: сами документы, правила их отбора, права, владельцы и регламент обновления; это топливо и дисциплина. Можно построить превосходную векторную базу на мусорном корпусе — и получить быстрый поиск по неправильным документам. Поэтому проект базы знаний начинается не с выбора векторной СУБД, а с аудита: какие документы отвечают на реальные вопросы, какие устарели, какие дублируют друг друга.
Практический ориентир: полезная база знаний компании среднего размера — это десятки и сотни документов, а не десятки тысяч. Отбор важнее полноты: ассистент, который отвечает по пятидесяти актуальным регламентам, полезнее ассистента, который тонет в архиве вместе с черновиками и отменёнными версиями. Расширение базы — управляемый процесс с метриками, а не заливка всего подряд.
Метрики здоровья базы
- Покрытие. Доля реальных вопросов, на которые в базе есть материал. Всё, что ниже — вопросы без ответа и повод пополнить индекс.
- Свежесть. Доля документов с непросроченной датой действия и датой проверки владельцем.
- Точность цитирования. Доля ответов, где указан корректный источник; проверяется выборочной разметкой.
- Скорость пополнения. Сколько дней проходит от появления документа до его работы в базе.
Эти четыре цифры, снятые ежемесячно, дают базе знаний то, что серверу даёт мониторинг: объективную картину вместо ощущений. И они же — план работ: низкое покрытие — собирать вопросы, падение свежести — трясти владельцев, ошибки цитирования — править фрагментацию и реранкинг.
База знаний и корпоративные системы
База знаний редко живёт в вакууме: её источники — СЭД, 1С, CRM и файловые хранилища. Интеграция решает два вопроса. Первый — первичная загрузка: документы выгружаются из систем-источников с их реквизитами и статусами, а не пересылаются почтой. Второй — синхронизация: изменение документа в СЭД запускает обновление фрагмента в индексе, отмена — исключение. Без автоматической синхронизации база отрывается от источников за квартал и начинает противоречить им; с ней — остаётся зеркалом действующего документооборота.
Практичный масштаб интеграции зависит от динамики документов: при десятке изменений в месяц хватает ручного регламента с уведомлениями; при сотнях нужна автоматическая связка. Начинают с ручного режима на пилотном разделе — и автоматизируют те пути, где ручной уже не справляется, а не наоборот.
Частые возражения и честные ответы
«Документы и так есть в 1С — зачем ещё база?» Затем, что поиск в учётной системе заточен под реквизиты документов, а не под смысловые вопросы сотрудников; база знаний не заменяет 1С, а даёт по ней человеческий способ спрашивать. «Ассистент наговорит лишнего?» Наговорит, если отвечать ему нечем: база с источниками и правилами цитирования держит ответ в рамках документов. «Кто будет всё это поддерживать?» Владелец базы и регламент — при правильно выбранном объёме это часы в месяц, а не вторая ставка; попытка обслуживать неограниченный архив — вот что съедает людей.
Версионирование базы знаний
База, которая меняется без следов, не поддаётся аудиту. Рабочая дисциплина: каждое состояние индекса имеет версию — состав документов, дату сборки, параметры фрагментации; изменения фиксируются журналом «что добавлено, что исключено, кем и почему»; по спорному ответу можно восстановить, какая версия базы была активна в момент диалога. Это стоит минут, а закрывает два дорогих сценария: разбор инцидента («ассистент сослался на отменённый документ» — проверяется журналом за минуту) и откат (вернуться к предыдущей версии индекса — штатная операция, а не реконструкция).
С чего начать
Возьмите один процесс с измеримой болью — например, вопросы сотрудников к регламентам — и один раздел документов. Соберите базу по нему, дайте ассистенту отвечать с цитатами и замерьте долю правильных ответов. Дальше расширение — механическая работа. Карта ваших документов и план базы знаний — в бесплатном разборе ИИ-ландшафта.
- раздел документов с явным владельцем и датами действия;
- пятьдесят реальных вопросов сотрудников как контрольная выборка;
- индекс с метаданными и правами, унаследованными от источника;
- ассистент с обязательным цитированием и честным «не нашёл»;
- ежемесячные метрики: покрытие, свежесть, точность цитат.