Исследователи из группы Цзяньяна Чжана выяснили, что для Reinforcement Learning (RL) дообучения больших языковых моделей (LLMs) не обязательно трогать все параметры. Оказалось, что обучение всего одного слоя трансформера может дать почти столько же выигрыша, сколько полное RL-обучение — а в отдельных случаях даже больше.
Они ввели метрику layer contribution — долю улучшения, которую даёт тренировка отдельного слоя, по сравнению с полным RL-тренингом. Проверили это на семи моделях двух семейств — Qwen3 и Qwen2.5, с тремя разными RL-алгоритмами: GRPO, GiGPO и Dr. GRPO. Задачи включали математические рассуждения, генерацию кода и агентное принятие решений. Результат оказался удивительно стабильным: почти все RL-улучшения концентрируются в нескольких слоях, а часто — в одном единственном.
Причём картина везде одинаковая: самые полезные слои находятся в середине стека трансформера, а слои около входа и выхода дают существенно меньше. Ранжирование слоёв по вкладу почти не меняется при смене датасета, задачи, семейства модели или RL-алгоритма. Это значит, что текущая практика обновлять все параметры равномерно — не оптимальна. Похоже, RL-адаптация использует лишь узкий канал внутри сети, и исследователи предлагают пересмотреть подход к пост-тренингу LLMs, сосредоточившись на ключевых слоях.