Gauntlet — открытый пайплайн, который пропускает статью через пять независимых рецензентов-персонажей и этап синтеза. Учёные проверили его на 20 работах с конференций ISCA 2025 и HPCA 2026. Десять исследователей написали собственные анализы, а затем сравнили — вслепую — человеческие рецензии с рецензиями Gauntlet на чужие для них статьи. Из 20 сравнений evaluators предпочли Gauntlet в 15 случаях, человек выиграл в 4, ещё один — ничья. Преимущество значимое по парным статистикам (paired Wilcoxon, p < 0.01). Сильнее всего Gauntlet отрывается по параметру Critical Rigor, и почти не проигрывает только на Calibration.
Там, где люди всё же побеждают, дело не в глубине, а в доверии и полезности. Например, человек может уверенно написать неверное утверждение — но оно звучит убедительно. Или описать механизм, но не объяснить его по-настоящему. Или дать широкий, но не приоритизированный обзор.
Дополнительный эксперимент — автоматическая абляция на 98 статьях — показал, что выигрыш даёт именно многопользовательская структура. Один и тот же пайплайн, запущенный с одним «богатым» агентом (тот же сетап, но один персонаж), проигрывает полной версии на 96% статей. Ключевой компонент — этап синтеза, где рецензии сталкиваются и пересобираются.
Всё выложили в открытый доступ: сами анализы, оценки и полный рубрикатор.