← На главную

AI-бенчмарки перестают различать модели — спасает ручная курация

04.08.2026 16:10 · hackernews

AI-бенчмарки — основной способ оценить, насколько продвинулась модель. Они помогают решать, когда пора выпускать систему в продакшен и чего от неё ждать. На старте бенчмарк отлично разделяет модели: одни справляются хуже, другие лучше. Но у подобных тестов есть неприятное свойство: они быстро перестают работать. Со временем сильные модели подбираются к потолку, все начинают получать почти одинаковые баллы, и бенчмарк больше ничего не говорит о качестве модели. Различить модели становится очень сложно, а ценность теста падает. Это состояние называется насыщением. Оно — ключевая проблема для тех, кто строит и использует оценки.

Мубашара Ахтар и 36 её соавторов провели систематическое исследование того, как и почему это происходит. Они дали явное определение насыщению, собрали 60 бенчмарков для языковых моделей и проанализировали их по 14 свойствам, которые имеют отношение к этому явлению. Результат: почти половина рассмотренных тестов уже насыщена. Причём чем старше бенчмарк, тем выше вероятность, что он в насыщении — доля таких тестов растёт вместе с возрастом.

Устойчивость к насыщению связана с экспертной курацией. Тесты, которые вручную обновляют, пересматривают и поддерживают в актуальном состоянии, дольше сохраняют способность различать модели. А вот публичные тестовые данные на это не влияют: сами по себе они не ускоряют и не замедляют насыщение.

Итог: правильный дизайн бенчмарка может заметно продлить его жизнь. То, как устроен тест и как организована его поддержка, влияет на то, насколько долго он будет полезен. Вместо того чтобы плодить одноразовые тесты, которые быстро устаревают, стоит строить более устойчивые подходы к оценке моделей. Такие подходы позволят дольше использовать уже созданные тесты и эффективнее строить новые.

Читать оригинал →