← На главную

Explorative Modeling: лучшая из K генераций — 6.2× меньше данных

01.08.2026 15:23 · hackernews

Explorative Modeling — новый подход к генеративному моделированию, который добавляется к существующим моделям как третья ось pretraining, а ещё позволяет полностью end-to-end генерацию. Проблема в том, что когда у задачи много правильных ответов, модель, обученная предсказывать напрямую, выдаёт их среднее. Среднее тысяч собак — коричневое пятно, а не собака. Это видно даже в простой игре: если дротики летят случайно по кольцам, лучший способ минимизировать ошибку — целиться в центр, хотя туда дротики почти не попадают.

Современные модели обходят это факторизацией генерации: авторегрессия предсказывает по кусочкам, диффузия идёт от шума маленькими шагами. Но это ломает end-to-end: на inference модель кормит себя своими же неточными выходами, ошибки накапливаются (exposure bias). Explorative Modeling предлагает факторизовать не генерацию, а обучение. На каждом шаге модель делает K случайных генераций (например, с разным шумом), и градиенты получает только та, что ближе всего к данным. В простейшем случае это цикл for: for i in range(K): generation = model.generate(); losses.append(loss_fn(generation, data)); min(losses).backward(). С ростом K предсказания перестают усредняться и начинают покрывать реальные данные. Одно пятно превращается в три кучки точек, размытое изображение — в чёткие картинки, «the the the» — в нормальный текст. K задаёт generative expressivity — число различных ответов, которые модель может выдать. Раньше эта величина была фиксирована архитектурой, а exploration превращает её в масштабируемую ось, как параметры и данные.

Добавление exploration к SOTA-рецепту RAE даёт ту же точность с 6.2× меньшим количеством данных и 4.1× меньшими FLOPs, а на ImageNet 256 получается FID 1.43. На оптимально настроенном SiT — 2.5× меньше данных и до 52% лучшая FLOP-эффективность. На видео и языке improvement тоже растёт с K. Выигрыш от exploration увеличивается с масштабом: от 7% до 36% при росте данных и от 13% до 23% при росте параметров. Exploration уменьшает переобучение: на фиксированном датасете модели с большим K достигают FVD 30.0 против 37.5 без него.

Как полностью end-to-end модель, Explorative Policy справляется с задачами поведения так же, как Diffusion Policy, но за один forward pass вместо 100. Explorative World Model обходит Diffuser со средним счётом 130.0 против 127.2, используя в среднем 2.3 forward pass вместо 192. Применять стоит там, где у предсказания много правильных ответов. Для LLM, где следующий токен часто почти однозначен, выигрыш пока скромный, но идеи вроде multi-token prediction или латентного conditioning могут помочь. В будущем — Reverse XM и gradient-based exploration. Главная мысль: мы масштабируем размер моделей и данные, но не то, сколько разных ответов модель может выдать.

Читать оригинал →