Исследователи из лаборатории Machine Learning Systems Lab вместе с коллегами из NVIDIA и Flower Labs разработали метод, который позволяет самоулучшающимся AI-агентам обходить «потолок» фиксированных тестов. Название — The Red Queen Gödel Machine. Обычно агент правит собственный код, пробует варианты и оставляет те, что работают лучше, но его развитие ограничено тем, насколько хорошо выбранный бенчмарк различает улучшения. Как объясняет аспирант Алекс Якоб, тест не просто измеряет прогресс — он его определяет. Агент упирается в потолок, когда выжимает из теста всё.
Авторы предложили развивать агента и оценщик вместе. Оценщик тоже становится лучше, планка поднимается, и это создаёт петлю самоулучшения. При этом система остаётся привязана к надёжным ground-truth проверкам: старый оценщик заменяется новым только если тот лучше справляется с эталонными примерами. В экспериментах метод улучшил результаты в написании и рецензировании научных статей, а также в написании и оценке олимпиадных математических доказательств. Соэволюционировавшие «писатели» статей достигали в 1.78–1.86 раза более высокой вероятности принятия, а «проверяющие» — на 9% выше точности соответствия земной истине.
Ещё один важный вывод — экономия. В одном эксперименте для соэволюции AI-рецензентов и авторов использовали NVIDIA Nemotron 3 Ultra вместе с ChatGPT-5.5. Гибридная схема почти догнала производительность одного ChatGPT при рецензировании, но при этом сократила затраты на поисковые токены примерно в 13 раз. Профессор Ник Лейн предупреждает: результат узкий, не стоит его переоценивать. Но он показывает, что если открытые модели берут на себя основную часть поиска, а сильные закрытые модели направляют процесс, это путь к гораздо более способным открытым агентным системам с меньшими затратами. Даниель Буркхардт из NVIDIA добавил, что открытые модели могут играть важную роль в продвинутых агентных системах, и что Nemotron созданы для эффективных рассуждений и агентных нагрузок.
Работа предварительная, авторы говорят, что нужны более длинные горизонты поиска, чтобы понять, насколько масштабируется подход. Статья The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators выложена на arXiv. Исходный метод будет открыт, а команда продолжает проверять его на более широком круге задач.