Исследователи из Redwood Research и Anthropic построили три бенчмарка для оценки «концептуального мышления» моделей — способности рассуждать о вопросах, где нет эмпирической проверки и приходится опираться на аргументацию. Это нужно, чтобы ИИ мог помогать снижать риски от продвинутого ИИ, но такие задачи часто не имеют быстрой обратной связи.
Бенчмарки объединили в индекс Conceptual Reasoning Index (CRI). Он считается как взвешенное среднее: LMCA — 60%, ACCoRD — 20%, DTBench capabilities — 20%. Первый бенчмарк, LMCA, содержит 560 позиционных текстов и 1461 аргумент против них. Модель должна оценивать качество аргументов по рубрике, сравнивая свои оценки с человеческими. Оценки ставил концептуальный исследователь Эмери Купер, часть перепроверяли другие эксперты. Второй, ACCoRD, проверяет логическую согласованность: например, если модель называет вероятность P(A) и P(A&B), должно выполняться P(A) ≥ P(A&B). В индекс вошли 567 проверенных ограничений. Третий, DTBench capabilities, содержит 407 вопросов по теории решений — про ситуации, где модели нужно предсказывать собственное поведение или взаимодействие с собственными копиями.
По состоянию на 10 августа 2026 года лучший результат у Opus 5: 73,6 балла (95% доверительный интервал ±2,1). Оценка потолка CRI — около 91 балла, то есть даже лучшая модель заметно ниже. Причём результаты растут примерно линейно с конца 2024 года и пока не выходят на плато. LMCA и ACCoRD ещё далеки от насыщения: по оценкам, LMCA начнёт насыщаться примерно через год. А вот DTBench capabilities уже почти решён: модель Claude Fable 5 отвечает правильно на 98% вопросов этого бенчмарка. Для расчёта её CRI использовали Opus 5 как fallback, когда Fable 5 отказывался отвечать.
Авторы планируют обновлять индекс по мере выхода новых моделей и бенчмарков, убирать насыщенные и, возможно, менять веса. Доступ к LMCA можно запросить через форму, а живые результаты CRI публикуются на conceptualreasoning.ai.