Команда Schema представила новый подход к решению ARC-AGI-3 — теста на общий искусственный интеллект, где модели видят только сетку 64×64 пикселей и набор разрешённых действий. Никаких инструкций, правил или указания цели нет.
Модели-фронтендеры показывали на этом тесте мизерные результаты — в июле 2026 года лучший показатель на полузакрытом наборе составлял 7.78% по метрике RHAE (Relative Human Action Efficiency). Это сравнение количества действий агента с первым прохождением человека.
Schema подходит к задаче как учёный-физик. Он не настраивает веса модели, а меняет процесс вокруг неё. Всё кодируется в виде исполняемой программы: сначала из сырых пикселей извлекаются объекты и их свойства (state grounding), затем выводится правило перехода между состояниями (mechanism discovery). Программа редактируется, перезапускается на всех сохранённых переходах, и только после полного совпадения используется для планирования.
Результат впечатляет. Связка Claude Opus 4.8 и Fable 5 на публичном наборе даёт 98.98% RHAE. С GPT-5.6 Sol (xhigh + max) — 95.35%. Оба результата самопроверенные и не верифицированы ARC Prize. Для сравнения, базовый Claude Code на том же Opus 4.8 показывает 42.83% — разница в 56 процентных пунктов.
Лучшие результаты достигаются за счёт двух ключевых преимуществ. Во-первых, программа-модель позволяет проверять гипотезы на всей истории переходов — агент не забывает, что было 300 шагов назад. Во-вторых, внутри верифицированной модели можно бесплатно запускать поиск в ширину, исследуя тысячи состояний без единого реального действия в игре.
Разные модели по-разному открывают эти правила. Fable 5 быстрее сомневается в собственной репрезентации мира и ставит решающие эксперименты. Opus 4.8 тратит больше действий на проверку альтернатив в рамках уже существующей модели.
Вывод простой: то, как ты используешь модель, часто важнее, какая у тебя модель.