<aside> 📌

Время прочтения статьи — 30-60 минут. Предполагается, что читатель знаком с базовыми понятиями математического анализа и теории вероятностей.

</aside>

<aside> ⚠️

Как обучать модели для задач CV рассказываем на нашем курсе CV Rocket. Присоединяйтесь до 15 сентября со скидкой 20%!

</aside>

Введение

Рисунок 1. Примеры возможностей генеративных моделей: из шума появляются изображения, видео, звук и другие сложные объекты

Рисунок 1. Примеры возможностей генеративных моделей: из шума появляются изображения, видео, звук и другие сложные объекты

Flow Matching — современный подход генеративного моделирования. Основная идея — научить модель постепенно превращать простое распределение, например, случайный шум, в сложные данные — изображения, видео, звук, 3D-сцены или действия робота.

В рамках статьи разберём устройство Flow Matching'а: как задаётся путь от шума к данным, чему учится модель и как после обучения из случайного шума появляется новый объект. Обсудим главный недостаток подхода — медленная генерация (чтобы получить один объект, нужно выполнить много последовательных шагов).

Один из способов его решения — дистилляция. Мы заменим многошаговый процесс генератором, который за одно вычисление нейронной сети произведёт нам нужные картинки.

Однако такую модель нельзя просто обучить регрессией по принципу: «Вот — вход, вот — правильный ответ». Мы разберём, почему это так и как из задачи дистилляции естественным образом возникает минимаксная постановка: две модели начинают играть друг с другом, а результатом игры становится качественная генеративная модель!

Сферы применения

Flow Matching сегодня — один из ключевых подходов в современных генеративных моделях, «равный» диффузионным моделям (в каком-то смысле считается, что это одно и то же).

Известные примеры применения — Stable Diffusion 3.5, FLUX.2 и Kandinsky от Сбера. Эти модели способны превращать текстовое описание в новое изображение — от реалистичной фотографии до сложной фантастической сцены.

Рисунок 2. Пример генерации изображений в Stable Diffusion 3.5

Рисунок 2. Пример генерации изображений в Stable Diffusion 3.5

Но изображениями применение Flow Matching'а не ограничивается. С его помощью можно генерировать и более сложные объекты — например, видео вместе со звуком. MiniMax H3 получает текстовое описание сцены и постепенно превращает случайный шум не просто в одну картинку, а в целую последовательность кадров и соответствующий ей звук.

[Рисунок 3. Пример генерации видео со звуком в MiniMax H3](attachment:eab56cea-f473-4d77-b6de-847ec128237e:wiAoEG6rEDs3n8XPH3aJP_out07_3-1-2.mp4)

Рисунок 3. Пример генерации видео со звуком в MiniMax H3

Тот же принцип работает и с музыкой. Например, Music 3 использует Flow Matching для генерации музыкальных фрагментов по текстовому описанию. Можно за несколько минут сделать композицию и выложить её на музыкальную платформу.

[Рисунок 4. Пример генерации аудио в MiniMax Music 3](attachment:45b0cf0b-f100-4572-9940-a6afdcb5efe6:music3-en-audio-02-202608132135.mp3)

Рисунок 4. Пример генерации аудио в MiniMax Music 3

Но генеративные модели идут ещё дальше: сегодня они умеют создавать уже не отдельные изображения или видео, а целые интерактивные миры, с которыми можно взаимодействовать в реальном времени. Например, семейство Genie от Google DeepMind позволяет сгенерировать виртуальное окружение из изображения или текстового описания, а затем исследовать его, управляя персонажем. Получается, можно придумать игру и почти сразу оказаться внутри неё!

[Рисунок 5. Пример интерактивного мира, сгенерированного моделью Genie](attachment:67252769-e328-42c0-b09b-86992dedcc72:pg.mp4)

Рисунок 5. Пример интерактивного мира, сгенерированного моделью Genie

Определение

Flow Matching — один из современных подходов генерации изображений, видео, звука. Его основная идея очень похожа на интуитивное «расшумление»: мы начинаем со случайного шума и постепенно превращаем его в осмысленный объект — например, в чёткое изображение.