Ранняя версия мультимодальной модели FLUX 3 уже управляет роботами. Black Forest Labs открыли ранний доступ mimic robotics, и вместе они сделали FLUX-mimic — следующее поколение video-action моделей. Роботов протестировали и развернули прямо на производстве Audi.
FLUX 3 с самого начала обучали как единую модель на изображениях, видео и аудио. Самое тяжёлое — предсказание видео: на него ушло свыше 95% всех вычислительных затрат. Чтобы видео выглядело реалистично, модель вынуждена выучить контакт, движение, вес, причины и следствия. Ошибёшься в физике — и картинка сразу плывёт. Аудио на этом фоне даётся легко: в ролике 720p со звуком на него приходится меньше 0,5% токенов. Действия робота устроены так же — низкоразмерное представление состояния, жёстко привязанное к визуальным наблюдениям. Аудио, действия и видеокадры — это лишь частичные проекции одной физической реальности. Когда модель уже понимает физику видео и звука, предсказание действий для неё не новый скачок, а ещё один взгляд на тот же мир.
Эксперимент подтвердил догадку. В большое обучение добавили предсказание действий и следили за качеством генерации видео. Человеческие оценки text-to-video и image-to-video сначала просели на 10%, но через 3500 шагов вернулись к прежнему уровню — и модель теперь вдобавок предсказывала действия. Никакого постоянного штрафа за новую модальность: бэкбон просто разобрался, как она вписывается в его картину мира. Один и тот же бэкбон тянет и видео, и управление роботом.
FLUX-mimic построен именно так: лёгкий action decoder считывает действия из промежуточных признаков видео-предсказательного пути FLUX. Работает это за счёт двух качеств — насколько хороша выученная модель мира и насколько удобно внутреннее представление для декодирования. Метод Self-Flow объединил генеративное обучение и обучение представлений, улучшив оба показателя. FLUX 3 — это и есть отмасштабированный Self-Flow: десятки миллионов часов общего видео, чтобы выучить динамику мира, и сотни тысяч часов манипуляций людей и роботов, чтобы бэкбон сразу подходил для физического интеллекта.
mimic отправил FLUX-mimic на реальные заводские операции: комплектование деталей в лотки, установку электронных блоков в плотные крепления, сборку компонентов и работу с мягкими материалами вроде уплотнений и кабелей — с тем, с чем обычная автоматика никогда не справлялась. Бенчмарки показали, что action decoder обходит прежние vision-language-action модели, даже когда бэкбон FLUX полностью заморожен. С файнтюнингом бэкбона достигнуты state-of-the-art показатели успешности.
Качественные представления означают, что новая задача требует меньше демонстрационных данных. Робот на FLUX-mimic естественно восстанавливается после ошибок: промахнулся при захвате — поправился и взял снова. Такому поведению не учили специально, оно вытекает из понимания физики мира. По скорости бэкбон на одном NVIDIA RTX 5090 GPU выдаёт представление менее чем за 80 мс, а полная система робота с оптимизациями mimic — за 101 мс. Кристоф Шнайдер из Audi Production Lab подтверждает: роботы решают сложную работу с мягкими телами, невозможную для обычной робототехники, и это может серьёзно помочь сотрудникам, поднять эффективность и расширить гибкую автоматизацию на производстве и в логистике. Так одна модель с визуальным интеллектом в ядре одновременно генерирует контент и управляет роботами на конвейере.