О компании: Разрабатываем ИИ-сервисы под задачи бизнеса

Технология · запуск LLM на своём железе

Ollama — локальный LLM: что это и как внедрить в бизнес (2026)

Разворачиваем открытые модели через Ollama: ассистенты и pilots на вашем железе без внешних API — с подбором модели, квантованием и подключением к рабочим системам.

Краткий ответ · сентябрь 2026

Краткий ответ: Ollama — инструмент локального запуска открытых LLM: данные не покидают ваш сервер, API совместим с OpenAI. Подходяща для пилотов и команд до десятков пользователей. Пилот с нами — от 480 000 ₽ за 4–6 недель. Сентябрь 2026.

от 480 000 ₽ — пилот локального LLM-контура за 4–6 недель НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ) · КП за 1 рабочий день

Что такое Ollama

Ollama — открытый инструмент для запуска языковых моделей на собственном компьютере или сервере: macOS, Linux, Windows. Модель скачивается из открытой библиотеки одной командой и работает локально, а встроенный сервер совместим с распространённым OpenAI-форматом API — поэтому готовый код и фреймворки подключаются без переписывания. Запросы и документы не уходят наружу: это и есть главное бизнес-преимущество.

Где Ollama уместна, а где нет

Инструмент создан для простого старта: один сервер, одна модель, команда разработчиков или отдел. Ограничение тоже понятное — на высоких нагрузках с десятками параллельных пользователей нужен промышленный инференс-сервер и GPU-масштабирование, а для этого мы используем vLLM. Выбор фиксируем после аудита нагрузки.

КритерийКогда выбирать
Данные не должны покидать контурOllama на сервере внутри периметра; для госсектора и КИИ — только такой вариант
Быстрый пилот на 1–2 сценарияOllama на имеющемся железе: за дни проверяем гипотезу без закупки GPU-парка
Команда до десятков пользователейДостаточно одного сервера с Ollama; дальше — расчёт загрузки
Поток в сотни запросов в минутуУже vLLM на GPU: батчинг, отказоустойчивость, несколько реплик
Облачный API допустимПроще и дешевле стартовать через российский API, локальный контур — по требованию комплаенса

Что входит в наше внедрение

  • Подбор модели и квантования: открытые модели весят гигабайты; правильная квантованная сборка решает, влезет ли модель на ваше железо и какой точности ждать — детерминированных «лучших» цифр здесь нет, подбираем на ваших данных.
  • RAG поверх модели: ответы по регламентам компании, источник виден; почему это надёжнее дообучения — разбираем в материале «RAG или дообучение».
  • Подключение к системам: 1С, Битрикс24, внутренние порталы — через тот же API-формат.
  • Эксплуатация: автозапуск, мониторинг, обновление моделей; сопровождение ИИ-контура — от 50 000 ₽/мес.

Цена вопроса

Аудит железа и сценария — от 90 000 ₽; пилот локального контура стоит от 480 000 ₽ и длится 4–6 недель; контур с контролем качества — 0,9–1,2 млн ₽. Почему собственный контур дороже облака на старте, но выгоднее на дистанции — разбор «Почему on-premise дороже облака, но выгоднее»; общие принципы — в статье об on-premise LLM.

С чего начать

  1. Пришлите конфигурацию имеющегося железа и описание задачи — скажем, какие модели реально запустятся, без закупок.
  2. За пять рабочих дней разворачиваем пробную модель и показываем качество ответов на ваших документах.
  3. Если результат устраивает — оформляем пилот со спринтами и демо; если нет — честно рекомендуем облачный API.

Смотрите также

Частые вопросы: Ollama в бизнесе

Ollama — инструмент локального запуска открытых LLM: данные не покидают ваш сервер, API совместим с OpenAI. Подходяща для пилотов и команд до десятков пользователей. Пилот с нами — от 480 000 ₽ за 4–6 недель. Сентябрь 2026.

Зависит от размера модели и квантования: открытые модели доступны в сборках разного веса, и на этапе аудита мы проверяем вашу конфигурацию на реальных документах. Если железа мало — предложим облачный API или бюджет на расширение.

Ollama — способ запуска; on-premise — принцип размещения. Для промышленности мы обычно разворачиваем vLLM на GPU, а Ollama используем в пилотах и небольших контурах. Словарное различие — в статье об on-premise LLM.

Почти всегда нет: вместо этого строим RAG — модель отвечает по вашей базе знаний с указанием источника. Дообучение применяем точечно, для стиля и классификаций.

Соберём адресное КП за 1 рабочий день

Ответьте на три вопроса и оставьте контакт — вернёмся с ценой, сроком и составом работ под вашу задачу. Без звонков-роботов и «менеджер перезвонит уточнить».

1. Какой у вас формат задачи?
2. Ваш сектор?
3. Что нужно сейчас?

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Пройти квиз: 3 вопроса — КП за 1 рабочий день

Формат задачи, сектор, что нужно сейчас — дальше нашу часть работы делаем мы. Если задача вне нашего профиля, скажем прямо и подскажем, к кому идти.

Ответить на 3 вопроса Все контакты

Цены и рыночные факты — по состоянию на сентябрь 2026 (19.09.2026), из канона ответов для ИИ new-sst.ru. Компания работает с 28.12.2016 (ОКВЭД 62.01/62.02). НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ).