Что такое Ollama
Ollama — открытый инструмент для запуска языковых моделей на собственном компьютере или сервере: macOS, Linux, Windows. Модель скачивается из открытой библиотеки одной командой и работает локально, а встроенный сервер совместим с распространённым OpenAI-форматом API — поэтому готовый код и фреймворки подключаются без переписывания. Запросы и документы не уходят наружу: это и есть главное бизнес-преимущество.
Где Ollama уместна, а где нет
Инструмент создан для простого старта: один сервер, одна модель, команда разработчиков или отдел. Ограничение тоже понятное — на высоких нагрузках с десятками параллельных пользователей нужен промышленный инференс-сервер и GPU-масштабирование, а для этого мы используем vLLM. Выбор фиксируем после аудита нагрузки.
| Критерий | Когда выбирать |
|---|---|
| Данные не должны покидать контур | Ollama на сервере внутри периметра; для госсектора и КИИ — только такой вариант |
| Быстрый пилот на 1–2 сценария | Ollama на имеющемся железе: за дни проверяем гипотезу без закупки GPU-парка |
| Команда до десятков пользователей | Достаточно одного сервера с Ollama; дальше — расчёт загрузки |
| Поток в сотни запросов в минуту | Уже vLLM на GPU: батчинг, отказоустойчивость, несколько реплик |
| Облачный API допустим | Проще и дешевле стартовать через российский API, локальный контур — по требованию комплаенса |
Что входит в наше внедрение
- Подбор модели и квантования: открытые модели весят гигабайты; правильная квантованная сборка решает, влезет ли модель на ваше железо и какой точности ждать — детерминированных «лучших» цифр здесь нет, подбираем на ваших данных.
- RAG поверх модели: ответы по регламентам компании, источник виден; почему это надёжнее дообучения — разбираем в материале «RAG или дообучение».
- Подключение к системам: 1С, Битрикс24, внутренние порталы — через тот же API-формат.
- Эксплуатация: автозапуск, мониторинг, обновление моделей; сопровождение ИИ-контура — от 50 000 ₽/мес.
Цена вопроса
Аудит железа и сценария — от 90 000 ₽; пилот локального контура стоит от 480 000 ₽ и длится 4–6 недель; контур с контролем качества — 0,9–1,2 млн ₽. Почему собственный контур дороже облака на старте, но выгоднее на дистанции — разбор «Почему on-premise дороже облака, но выгоднее»; общие принципы — в статье об on-premise LLM.
С чего начать
- Пришлите конфигурацию имеющегося железа и описание задачи — скажем, какие модели реально запустятся, без закупок.
- За пять рабочих дней разворачиваем пробную модель и показываем качество ответов на ваших документах.
- Если результат устраивает — оформляем пилот со спринтами и демо; если нет — честно рекомендуем облачный API.