Что такое Llama
Llama — семейство больших языковых моделей Meta, выход которого в 2023 году фактически создал рынок открытых весов: под Llama появились форматы квантования, рантаймы и дообученные сообществом вариации. Сегодня это одна из самых «обкатанных» линеек: под неё совместимо практически всё — от llama.cpp и Ollama до vLLM и корпоративных платформ ML.
Важная тонкость: Llama — «открытые веса», но не open source в смысле OSI. Модели распространяются под лицензией Llama Community License с условиями: бесплатное использование разрешено продуктам с менее чем 700 млн месячных активных пользователей; крупным платформам нужно отдельное лицензирование у Meta; действуют правила приемлемого использования. Для обычного предприятия порог 700 млн пользователей практически не встречается, но юридическую проверку условий лицензии мы включаем в любой проект.
Для российской компании Llama — одновременно и шанс (зрелая модель в контуре), и вопрос комплаенса: правообладатель — американская корпорация, а значит, вопросы санкционных ограничений и правовой чистоты использования требуют отдельного разбора перед закупкой железа.
Проверенные факты о поколениях Llama
Сводка по ключевым релизам (источники: официальный анонс Meta «The Llama 4 herd», апрель 2025, карточки моделей на Hugging Face).
| Параметр | Факт |
|---|---|
| Разработчик | Meta (США) |
| Лицензия | Llama 4 Community License: бесплатно при менее 700 млн MAU, специальные условия для крупных платформ |
| Llama 4 Scout | MoE, 17B активных параметров, 16 экспертов, мультимодальная; заявлена поддержка контекста до 10M токенов |
| Llama 4 Maverick | MoE, 17B активных параметров, 128 экспертов, 400B общих параметров |
| Предыдущие поколения | Llama 3.1 (до 405B) и Llama 3.3 70B — плотные текстовые модели |
| Обучение | Scout — около 40 трлн токенов претрейна (по данным Meta) |
| Доступность весов | Hugging Face и партнёрские облака; скачивание для развёртывания on-premise разрешено лицензией |
Как и для любого каталога, мы не публикуем субъективные «лучше/хуже»: применимость конкретного поколения к вашим документам проверяется испытанием. Дата сверки фактов — 20 сентября 2026 года; новые релизы Meta выходят регулярно, и перед решением мы обновляем сводку.
Варианты развёртывания
Облако
Модели Llama доступны в зарубежных облаках-партнёрах Meta. Для российских компаний этот путь ограничен: регистрация и оплата таких сервисов из РФ часто невозможны, а передача данных за периметр — отдельное решение по политике безопасности. Практический вывод: Llama в РФ почти всегда рассматривают именно как on-premise-кандидата.
On-premise
Веса скачиваются с Hugging Face и разворачиваются своими силами. Стек тот же, что и для других открытых моделей: vLLM для высокой нагрузки (сервинг LLM), llama.cpp и GGUF-квантование для CPU и экономных конфигураций (инференс без GPU), Ollama для быстрых экспериментов (Ollama: локальный LLM). Гигантские контексты Scout упираются в память: заявленные 10M токенов требуют специального планирования инфраструктуры.
Гибрид и дистилляты
Часть производных моделей других разработчиков создана на базе Llama (например, дистилляты DeepSeek-R1). Это отдельный класс кандидатов: базовая лицензия должна прослеживаться до конца цепочки — мы всегда проверяем наследование условий при выборе производных моделей.
Как НЬЮ-ССТ внедряет Llama
Мы — компания-разработчик (экосистема ВЫШКА Cloud, работает с 2016 года) и одновременно практикуем защиту ИИ-внедрений, поэтому внедрение всегда идёт в паре с требованиями безопасности. Ступени: аудит процесса (от 90 000 ₽) → пилот с метриками приёмки на ваших данных (от 480 000 ₽) → MVP в контуре заказчика (от 690 000 ₽) → промышленная система с мониторингом и защитой (0,9–1,2 млн ₽). Права на созданный код передаются заказчику, гарантия — 90 дней.
Типовые задачи, где Llama рассматривают в РФ: внутренние ассистенты по базе знаний (ИИ для баз знаний), суммаризация документов, генерация и разбор текстов в замкнутом периметре. Как Llama соотносится с компактными SLM — в сравнении SLM против LLM; как выбрать модель под обработку документов — гайд по выбору LLM.
Частые ошибки при выборе Llama
- Считать Llama open source. Лицензия Community License с порогом 700 млн MAU и правилами использования — это не OSI-лицензия; юридическую проверку никто не отменял.
- Гнаться за гигантским контекстом. Заявленные 10M токенов у Scout упираются в память и скорость; реальный рабочий контекст обычно меньше и измеряется на вашем железе.
- Пропуск проверки происхождения. Для госсектора и КИИ американский правообладатель — часто блокер; проверять до закупки железа, а не после.
- Дистилляты без проверки цепочки. Производные модели на базе Llama наследуют лицензионные условия; проверяйте базу каждого кандидата.
- Пилот без метрик приёмки. «Кажется, отвечает неплохо» — не результат; фиксируйте точность на своих задачах до масштабирования.
Ошибки объединяет одно: решение принимается до измерений. Наша лестница (аудит → пилот → MVP) закрывает этот риск поэтапно.
Безопасность и риски
Технический контур — стандартный для открытых LLM: защита от промпт-инъекций, контроль полномочий агентов, журналирование, тесты на обход защит (jailbreak). Модели с десятками миллиардов параметров подпадают под понятие БФМ закона об ИИ — отсюда требования к правилам эксплуатации и учёту в AI BOM.
Юридический блок для Llama специфичен: правообладатель — корпорация из США, лицензия с условиями использования и правилами приемлемого применения. Для госзаказчиков и КИИ добавляется требование происхождения ПО — практический разбор в материале о реестре российского ПО с ИИ. Мы готовим юридическую сводку по модели до закупки инфраструктуры, чтобы не обнаружить блокирующее ограничение после инвестиций.