← На главную

FLUX 3 обходит Runway Gen-4.5, генерируя 20-сек видео с нативным звуком

24.07.2026 06:17 · hackernews

Вышла в ранний доступ FLUX 3 — новая мультимодальная foundational model, которая учится на изображениях, видео и аудио одновременно в единой архитектуре. Разработчики отказались от изолированного обучения на отдельных типах данных: каждая модальность рассматривается как проекция одной и той же реальности, а их пересечения дают более полную картину мира. Изображения фиксируют пространство и структуру, видео возвращает время и физическую динамику, аудио связывает механические явления со звуком, а язык добавляет абстракции и цели. Когда модель учится сразу на всём, взаимные ограничения — звук обязан совпасть с ударом, движение — с массой, будущее — с прошлым — превращают разрозненные сигналы в свидетельства об одном физическом мире.

FLUX 3 опирается на метод Self-Flow для выравнивания генерации и понимания внутри одной архитектуры. Подход масштабировали по вычислительным ресурсам и данным, тренируя модель сразу на видео, изображениях и аудио. В предварительных тестах Self-Flow обходит классический Flow Matching (FM): ошибка генерации по Fréchet distance на каждой модальности ниже, а после файнтюнинга выше успешность выполнения манипуляционных задач.

Модель смешивает модальности и генерирует видео с аудио по тексту, картинке или референсному клипу. FLUX 3 Video выдаёт ролики длиной до 20 секунд с нативным звуком. Поддерживается text-to-video, image-to-video, video-to-video с переносом персонажей в новые сцены, продолжение аудио-видео, контролируемые переходы по ключевым кадрам, многоязычные диалоги и агентная склейка отдельных клипов в многосценовые секвенции. Модель одинаково уверенно справляется со стилями от любительской съёмки до анимации и кинематографики, генерирует сложную типографику и анимированный дизайн. В ранних сравнениях на 10-секундных 720p-клипах FLUX 3 предпочли в 69% случаев против Grok Imagine Video, в 60% против Kling v3 Pro, в 77% против Runway Gen-4.5 и в 93% против Luma Ray 3.2. Особенно сильно модель проявляет себя в передаче мимики, связывании звука с физическими событиями и мультиязычности, а визуальные референсы позволяют сохранять консистентность персонажей в сценах длиной несколько минут.

Блок Image показывает значительный прирост в обработке сложных промптов и рендеринге текста на разных языках, но его ранний доступ откроют только в ближайшие недели. Понимание мира у FLUX 3 расширяется и на предсказание действий. Действия можно предсказывать нативно внутри модели или использовать видео-бэкбон как основу для специализированных action-моделей. Второй путь уже опробован с mimic robotics: вместе создали FLUX-mimic — видео-action модель, объединяющую бэкбон FLUX 3 с экспертизой mimic в ловкой робоманипуляции, включая тесты на реальных производственных задачах на Audi.

План запуска предполагает несколько этапов: генерация и редактирование видео и аудио через API и приватные веса (FLUX 3 Video), предсказание действий для избранных партнёров (FLUX-mimic и FLUX 3 Action), синтез и редактирование изображений (FLUX 3 Image), а также открытые веса мультимодального бэкбона для создания контента и предсказания действий (FLUX 3 Dev). Команда уже работает над следующим поколением моделей, цель — объединить предсказание восприятия, действий и языка в одной унифицированной системе.

Читать оригинал →