← На главную

Ring-2.5-1T-Zero выработала антропоморфизм, самопроверку и тревогу

16.07.2026 21:38 · hackernews

Масштабирование zero RL до триллиона параметров дало неожиданные результаты: модель не просто лучше решает задачи, а сама вырабатывает антропоморфизм, самопроверку и даже «контекстную тревогу». Речь про reinforcement learning с верифицируемым вознаграждением, без размеченных человеком данных. Раньше такие эксперименты ставили на маленьких моделях — не хватало ресурсов. Теперь группа исследователей представила стабильный пайплайн для обучения на большом масштабе. В него вошли clipped importance sampling, поправка на соотношение training и inference, а также mixed-precision control.

Наивное масштабирование давало плохую читаемость, много повторяющихся токенов и неадаптивную глубину рассуждений. Новый pipeline решает эти проблемы. Главные выводы из экспериментов. Первый: увеличение модели до 1T параметров резко повышает sample efficiency и потолок производительности. Второй: обучение идёт последовательно — сначала фаза discovery, затем фаза sharpening. Третий и самый любопытный: модель сама, без специальных хитростей, развивает продвинутые когнитивные паттерны — anthropomorphism, structured formatting, self-verification, parallel reasoning и context anxiety. Ручные эвристики становятся не нужны.

Модель назвали Ring-2.5-1T-Zero. Её проверили на семи математических бенчмарках — результаты конкурентоспособны. Кроме того, авторы предложили не смотреть только на финальный ответ, а оценивать качество chain-of-thought по трём измерениям: comprehensibility, reproducibility и efficiency. В этих метриках модель показала явное преимущество — её рассуждения структурированные и ёмкие.

Исследователи надеются, что описанные emergent phenomena помогут сообществу лучше понять поведение при масштабировании до 1 триллиона параметров. Статья Ring-Zero доступна на arXiv.

Читать оригинал →