Что за фигня происходит с AI reasoning? В 2026 году модель от OpenAI сходу решила знаменитую открытую математическую проблему (unit distance problem), а ещё раньше взяла золото на International Mathematical Olympiad. И тут же выясняется, что те же самые large reasoning models (LRM) могут проваливать тщательно продуманные тесты, используя «surface-level shortcuts» — просто угадывая ответ по внешним признакам, без всякой логики. Внутренний процесс таких моделей, известный как chain of thought (цепочка рассуждений), оказался под градом сокрушительных научных претензий.
В чём суть претензий? LRM генерируют длинные текстовые «размышления» перед тем, как выдать ответ. Разработчики преподносят эти следы как понятный человеку ход мысли. Но исследователи из Apple назвали это «Illusion of Thinking» и показали, что при небольшом изменении условий точность моделей полностью обрушивается. Группа из Santa Fe Institute (где работает Мелани Митчелл) выяснила: до 60% thinking tokens практически не влияют на итоговый ответ, их можно просто выкинуть. Субрао Камбхампати из Arizona State University пошёл дальше: в его лаборатории полностью заменили правильные reasoning traces на бессмысленный текст, и модель продолжила выдавать верные результаты.
Ещё жёстче: в New York University показали, что вместо понятных шагов можно вставлять строки точек — meaningless filler tokens, — и это работает не хуже. Уильям Меррилл, соавтор той работы, говорит прямо: «Нет никакой гарантии, что chain of thought вообще имеет смысл». Павел Измайлов из Anthropic сомневается, что reinforcement learning вообще стимулирует модели порождать честное описание своих внутренних процессов.
В OpenAI с этим категорически не согласны. Себастьян Бубецк настаивает: старые критические статьи устарели, модели начиная с GPT-5.5 не страдают такими недостатками. Компания публикует лишь отредактированные версии цепочек, причёсанные другим AI — Codex, — но утверждает, что модель «рассуждает как человек», и встроенный верификатор типа Lean ей не нужен.
Камбхампати предлагает альтернативную картину: LRM — это те же LLM, обученные на «приблизительном извлечении» (approximate retrieval) из гигантского корпуса примеров. Thinking tokens работают как бормотание, помогающее нащупать подходящий шаблон в многомерном пространстве embeddings. Их содержание вторично; они лишь загружают контекстное окно так, чтобы модель предсказала правдоподобный ответ, похожий на правильные рассуждения. Поэтому в верифицируемых доменах (код, математические доказательства с теми же AlphaProof Nexus и Lean) LRM особенно хороши: результат можно однозначно проверить.
Митчелл напоминает, что AlphaFold тоже чёрный ящик, но никто не спорит с его пользой. Однако в науке хочется получать правильный ответ по правильной причине, чтобы моделям можно было доверять за пределами проверяемых задач. Таль Линзен из NYU и Google подчёркивает: нужно, чтобы система надёжно применяла алгоритм, как бы мы ни называли этот процесс. Камбхампати же называет всю эту историю «wishful mnemonics» — по аналогии с тем, как в 1970-х программисты давали кускам кода имена вроде «UNDERSTAND», обманывая сами себя. Пока мы не поймём, что на самом деле крутится под капотом, AI reasoning останется эффектной, но довольно мутной метафорой — как лошадиные силы в автомобиле, где никто не ждёт настоящих копыт.