Задача: дать команде ИИ — без утечек и хаоса
Типовой заказчик — продуктовая ИТ-компания или крупная команда внутренней разработки: инженеры уже осторожно пользуются публичными ИИ-сервисами — кто с личных аккаунтов, кто копируя куски кода «туда-сюда». Руководство видит и пользу (скорость), и риск (код, ключи и архитектура утекают в непонятно какие контуры). Задача: дать команде легальный корпоративный ассистент — код-ревью, вопросы по кодовой базе, тесты, документация — под контролем ИБ и с измеримым эффектом.
Второй типовой мотиватор — онбординг: новый инженер тратит недели на понимание кодовой базы и внутренних регламентов; ассистент с доступом к репозиториям и wiki отвечает на «глупые вопросы» мгновенно и не устаёт.
Почему это сложно
Сложность первая — границы данных: код компании — её главный актив; отправка его во внешние API должна быть либо запрещена, либо явной и контролируемой. Вторая — качество на внутреннем контексте: публичные модели не знают ваших конвенций, легаси и внутренней архитектуры; без RAG-слоя по репозиториям ассистент даёт «книжные» ответы. Третья — секреты: в диффах и логах встречаются токены и ключи — фильтрация обязана стоять до модели, а не после инцидента. Четвёртая — привычки: если корпоративный ассистент хуже публичного чата, им не будут пользоваться; контур обязан выигрывать за счёт контекста — знаний именно вашей кодовой базы.
Архитектура: шлюз, контекст, фильтры
Архитектура контура инженерных ассистентов (текстовая схема)
IDE-плагин · бот в корп. мессенджере · комментарий в CI (ревью)
▼
Единый шлюз (FastAPI): авторизация · роли · квоты · журнал запросов
▼
DLP-фильтр ДО модели: секреты/токены/ключи ──► маскирование
▼
Сбор контекста (RAG): репозитории · wiki · регламенты · ADR
векторный индекс по кодовой базе, обновление при коммитах
▼
LLM-слой, два типовых варианта:
A) GigaChat / YandexGPT API (российский контур, без своего GPU)
B) свой vLLM-кластер + квантованные открытые модели (полный контроль)
▼
Guardrails: проверка ответов, запрет выдачи секретов и лицензионно
грязных фрагментов ──► ответ инженеру + лог в журнал
▼
Метрики использования: задачи · сценарии · качество (лайки инженеров)
Технологические решения контура. Оркестрация запросов и контекста — паттерны «LangChain и LlamaIndex»: сбор релевантных фрагментов кода и документов, сборка промпта, стриминг ответа. Внешние модели — GigaChat или YandexGPT — дают старт без закупки GPU; собственный вариант — vLLM-сервинг с квантованием моделей под доступные ускорители — полный контроль и предсказуемая стоимость на масштабе; Kubernetes обслуживает оба сценария. Фильтры ответов и запросов — guardrails: секреты маскируются до модели, лицензионно проблемные фрагменты не выдаются.
Этапы внедрения
| Этап | Что получается | Бюджет | Срок |
|---|---|---|---|
| Аудит процессов и ИБ-границ | карта сценариев, что можно во внешние API, требования ИБ, план метрик | от 90 000 ₽ | 1–2 недели |
| Пилот на одной команде | 2–3 сценария (ревью-помощник, вопросы по коду, тесты) + индекс по её репозиториям | от 480 000 ₽ | 4–6 недель |
| Промышленный контур | все команды, интеграции IDE/CI/мессенджер, квоты, дашборд использования | 0,9–1,2 млн ₽ | по ТЗ |
| Сопровождение | обновление индексов, новые модели, контроль качества и стоимости | по регламенту | — |
Бюджеты — прайс НЬЮ-ССТ на сентябрь 2026, «от», без НДС (УСН, п. 2 ст. 346.11 НК РФ). Сроки — типовые вилки проектов этого класса.
Типовые метрики «до/после»
Ниже — типовые вилки результатов внедрений инженерных ассистентов этого класса, а не отчёт конкретной компании. Замер — на пилотной команде: до/после по времени ревью, скорости онбординга, доле рутинных задач, закрытых с ассистентом.
- Время код-ревью: типовое снижение на 20–40% — ассистент делает первый проход, человек — решение.
- Онбординг на кодовую базу: −30–50% времени до первой самостоятельной задачи.
- Покрытие тестами: +10–30% на новых модулях за счёт генерации заготовок тестов.
- Документация: обновление README/ADR перестаёт копить долг — типовой рост актуальных документов в 2–3 раза.
- Утечки: использование непрофильных публичных ИИ-сервисов падает к нулю — всё идёт через контролируемый шлюз с журналом.
Безопасность: код, секреты и ИИ-актив
Три слоя защиты. Первый — до модели: DLP-фильтрация секретов и токенов в запросах, маскирование чувствительных фрагментов, ролевые ограничения на контекст (не каждой команде нужен чужой репозиторий). Второй — контур модели: либо российский API по договору с обязательствами по конфиденциальности, либо полностью свой vLLM — выбор фиксируется на аудите вместе с ИБ. Третий — сам ассистент как ИИ-актив: индексы по кодовой базе, промпты и настройки — актив компании по 243-ФЗ; доступ к ним учитывается и защищается, как и любой другой критичный актив. Побочный эффект — дисциплина: единый шлюз с журналом закрывает вопрос «кто что отправлял в ИИ», который без контура не имеет ответа.
Об этом разборе. Это обезличенное типовое внедрение из нашей практики проектирования: имена компаний не раскрываются (NDA), метрики даны типовыми вилками класса проектов; фактические значения фиксируются в КП и на приёмке. Ассистент — инструмент инженера; ответственность за код и решения остаётся на команде.