← На главную

Top-p и Muon побеждают коллапс энтропии в асинхронном RL

08.07.2026 16:19 · hackernews

Исследователи столкнулись с проблемой при обучении крупных моделей с асинхронным RL. Основная трудность — расхождение KL-дивергенции между инференсом и тренировкой: политика тренировщика (trainer policy) отличается от политики сэмплирования (sampling policy). Раньше это пытались компенсировать через importance-sampling и quantization-aware training для низкоточных роллаутов в NVFP4 с реплеем экспертов. Но при большем масштабе этих мер стало недостаточно.

Главная новая проблема — коллапс энтропии. Сильная модель перестаёт исследовать, и награда выходит на плато за несколько сотен шагов. Авторы выяснили, что top-p sampling значительно помогает избежать этого. Если сэмплировать токен с очень низкой вероятностью, которая ведёт к низкой награде, градиенты обновления logits работают так: наказанный токен (x₃) уменьшается, а доминирующий (x₁) получает больший прирост. Это ещё сильнее заостряет распределение и снижает энтропию. Top-p sampling просто не даёт таким токенам попасть в выборку — и проблема исчезает.

Но наивное внедрение top-p увеличивает расхождение между тренировкой и инференсом: тренер считает вероятности по всем токенам, а роллауты сэмплируют только из top-p подмножества. Расхождение растёт, и через несколько шагов коллапс всё равно наступает. Решение — sampling distribution replay. В роллауте запоминают keep-set (множество разрешённых токенов) и на тренере перенормируют вероятности с учётом этой маски. Тогда энтропия модели остаётся примерно постоянной, а расхождение тренировки и инференса — в границах.

Дополнительный эффект: для токенов, чья вероятность превышает порог top_p_threshold, keep-set состоит из одного элемента, перенормированная вероятность всегда 1, и градиенты обнуляются. Эмпирически большая часть сэмплируемых токенов попадает под это правило — они исключаются из градиентных расчётов. Это снижает шум градиента, и алгоритм оптимизации концентрируется только на токенах с высоким обучающим сигналом.

Кроме того, авторы сообщают о пользе от использования Muon optimizer и удаления недетерминированных операций в тренере.

Читать оригинал →