Что такое Kandinsky
Kandinsky — семейство генеративных моделей Сбера: по текстовому описанию модель создаёт изображения (text-to-image), редактирует их, а старшие поколения — и видео (text-to-video). Семейство развивается с 2022 года командами Sber AI (публикации и открытый код — в организации ai-forever на GitHub и Hugging Face), а потребительский доступ к генерации — через платформу Fusion Brain (fusionbrain.ai) и сервисы Сбера, включая интерфейс на сайте Сбербанка.
Для бизнеса генерация изображений — прикладной инструмент: иллюстрации для карточек товаров, черновики макетов, визуализация концепций, контент для рассылок. Отличие от «нейросетей ради развлечения» — воспроизводимость: фиксированные веса, пайплайн проверки и правовая база использования результата.
Российское происхождение семейства практически важно: доступность без VPN, оплата в рублях через платформу Сбера и российский правообладатель для комплаенса. Публичный веб-сервис и открытые веса — разные способы использования, и ниже мы их разделяем.
Проверенные факты о семействе
| Версия | Что известно |
|---|---|
| Kandinsky 3.x | text-to-image модель на latent diffusion; около 12 млрд параметров (K3.0); код на GitHub (ai-forever), веса на Hugging Face; заявлена пермиссивная лицензия Apache 2.0 |
| Kandinsky 4.0 | генерация видео (text-to-video, image-to-video) в разрешениях до HD; развернута на платформе Fusion Brain; веса видео-версии открыто не публиковались |
| Kandinsky 5.0 | семейство моделей нового поколения (ноябрь 2025): изображения и 10-секундное видео; открытые веса на Hugging Face, включая компактную Video Lite (2B, сентябрь 2025) |
| Платформа | Fusion Brain — доступ к генерации Сбера через веб и API |
| Правообладатель | Сбер (права на программные продукты серии) |
Сверка — по официальным страницам Сбера, репозиториям ai-forever и карточкам моделей на Hugging Face, 20 сентября 2026 года. Условия лицензий версий и условия конкретных весов проверяются в карточке модели перед коммерческим использованием.
Варианты использования
Платформа Fusion Brain
Самый быстрый старт: генерация изображений и видео через веб-интерфейс и API платформы. Подходит для маркетинга и контент-команд: нет инфраструктуры, есть лимиты и правила сервиса. Данные запросов (промпты) обрабатываются платформой — учитывайте это в политике.
Открытые веса в своём контуре
Версии 3.x (изображения) и 5.0 (изображения и видео, включая Video Lite) скачиваются с Hugging Face и разворачиваются на своих GPU-серверах: полный контроль над промптами и результатами, интеграция в продуктовый пайплайн. Модель 3.x требует GPU с большим объёмом видеопамяти; компактная Video Lite экономнее. Квантование здесь помогает меньше, чем в LLM: диффузионные модели упираются в память и скорость обхода шагов диффузии.
Гибрид
Типовая схема: прототипирование и штучные задачи — на платформе, промышленный поток (сотни изображений в день для каталога) — на своих весах с автопроверкой результатов.
Как НЬЮ-ССТ внедряет генерацию изображений
Лестница: аудит задач и объёмов (от 90 000 ₽) → пилот: выбор модели и режимов, метрики приемлемости картинок для вашего бренда (от 480 000 ₽) → MVP: пайплайн генерации с проверкой и маршрутизацией в ваши системы (от 690 000 ₽) → промышленный контур с контролем авторских рисков (0,9–1,2 млн ₽). Мы не обещаем «идеальные картинки с первого промпта»: Промышленное применение — это пайплайн с фильтрами брака и человеком в контуре.
Смежные направления: ИИ для маркетинга и контента (там же — генерация текстов и адаптация кампаний), мультимодальные VLM (анализ изображений), ИИ-ассистенты. Для видео- и голосовых сценариев — голосовое направление.
Практический пример маршрута
Рамка контент-проекта: маркетинг начинает с платформы Fusion Brain — штучные иллюстрации для рассылок без инфраструктуры; когда объём вырастает до потока (карточки каталога, баннеры), разворачиваются свои веса и строится пайплайн: генерация по шаблонам промптов, автопроверка технических параметров, ревью дизайнером, публикация с учётом маркировки. Правовая база фиксируется до старта потока: лицензия версии, правила сервиса, режимы использования изображений. Так компания платит за инфраструктуру только тогда, когда объём это оправдывает, а переход между платформой и своими весами не ломает процессы: пайплайн, проверки и правовая база остаются прежними.
Частые ошибки при внедрении генерации изображений
- Начинать с веса, а не с задачи. Сначала объём и назначение картинок (штучные концепты или поток для каталога) — потом выбор между платформой и своими весами.
- Не фиксировать лицензию версии. Открытость в семействе чередуется по версиям: 3.x и 5.0 открыты, 4.0 — платформенная; выбор закрепляется карточкой модели.
- Поток без фильтра брака. Генерация нестабильна: промышленное применение требует автоматической отбраковки и человека в контуре.
- Публикация без маркировки. ИИ-контент в публичных коммуникациях сопровождается информационным предупреждением — это требование закона об ИИ.
- Игнор бренд-требований. Приемлемость картинки для бренда проверяется метриками и ревью, а не энтузиазмом автора промпта.
Генерация окупается там, где построен пайплайн: от промпта до проверки и публикации. Его мы и собираем на этапах MVP.
Безопасность, права и риски
Юридический блок — главный для генерации: кто владеет результатом, можно ли использовать изображения в рекламе, как отметить ИИ-контент. По закону об ИИ результаты генерации в публичном пространстве сопровождаются информационным предупреждением; права на результаты генерации и opt-out правообладателей данных разобраны в наших материалах о правах на результаты генерации и opt-out. Правообладатель программ семейства — Сбер; условия использования контента из конкретного сервиса — в его правилах.
Технические риски: дипфейки и выдача сгенерированного за реальное — при использовании генерации в коммуникациях обязательна маркировка; обратная сторона — атаки сгенерированным контентом на ваших сотрудников (как распознать дипфейк). Активы генерации вносим в AI BOM; большие генеративные модели — это БФМ (>1 млрд параметров, порог) с правилами эксплуатации.