← На главную

DeepSeek-R1 учит reasoning RLVR, GPT-5.6 даёт рассуждение Light-Ultra

20.07.2026 14:35 · hackernews

Почти два года назад OpenAI выпустила o1 — модель, которая популяризировала LLM с «рассуждением». DeepSeek-R1 вышел через четыре месяца и показал, как тренировать такие модели через reinforcement learning with verifiable rewards (RLVR). А на прошлой неделе вышло семейство GPT-5.6 — три модели (Luna, Terra, Sol) с пятью-шестью уровнями усилий рассуждения.

Суть reasoning model проста: модель выдаёт промежуточный reasoning trace — пошаговый разбор задачи. Это не «настоящее» мышление, а просто механизм. Есть два пути улучшить результат: training scaling (больше вычислительных ресурсов на обучение) и inference scaling (больше вычислений во время ответа).

DeepSeek-R1 показал, что одно RLVR без SFT может научить модель рассуждать. В процессе модель учится писать объяснения между тегами <think> и </think>, перепроверять себя и исправлять ошибки. Эти моменты называют «Aha moments». Сами теги <think> — лишь косметика: они не дают модели способности думать, а просто отмечают блок рассуждения для интерфейса.

Современные модели пошли дальше — они умеют выборочно включать или выключать режим рассуждения. Например, Qwen3 использует enable_thinking=True/False. В GPT-5.6 уже полноценные уровни усилий: от Light до Ultra. Реализация, скорее всего, простая — в system prompt подмешивается инструкция вроде «Reasoning effort: high» или «low». Разные уровни меняют длину ответа и точность: чем больше токенов, тем выше качество, но растёт и цена. Кривая отдачи нелинейная — на максимуме каждый дополнительный токен даёт всё меньше выгоды.

Как это тренируют? Два основных подхода. Первый — effort-conditioned RLVR, где модель штрафуют за длину ответа: при низком усилии штраф большой, при высоком — маленький. Второй — SFT на примерах с разной длиной рассуждения. Обычно методы комбинируют. Классный пример — недавний Inkling от Thinking Machine Labs: он использует непрерывное значение усилий от 0.2 до 0.99, где штраф за токен зависит от запрошенного уровня.

Разные модели реализуют это по-своему. DeepSeek V4 имеет три режима: Non-think, Think High и Think Max — с разными контекстными окнами и штрафами. Nemotron 3 Ultra от NVIDIA добавляет medium-effort через учительские данные и случайное усечение reasoning trace. Kimi K2.5 использует метод Toggle — чередование budgeted-фазы (с ограничением длины) и unconstrained-фазы, что даёт 25–30% экономии токенов без потери точности. GLM-5 переносит переключение рассуждения на multi-turn сценарии и вызовы инструментов.

Получается, что выбор размера модели и уровня усилий — это две независимые оси. Можно взять маленькую модель с высоким усилием и получить результат, сравнимый с большой моделью на низком усилии, но дешевле. Всё упирается в нужное соотношение точности, цены и задержки.

Читать оригинал →