В телеметрии Codex нашли странную аномалию у модели gpt-5.5. Ответы этой модели подозрительно часто заканчиваются ровно на 516 токенах рассуждений (reasoning_output_tokens = 516). Плюс есть дополнительные всплески на 1034 и 1552 токена — то есть кратные 516.
Посчитали. Всего проанализировали 390 195 записей о токенах за февраль–июнь 2026 года. Из них 3 363 случая, когда количество токенов рассуждений в ответе составило ровно 516. И всплеск колоссальный: gpt-5.5 дала лишь 19,3% всех ответов, но на неё пришлось 82% всех точных совпадений с 516. Соотношение exact-516 к ответам, где токенов больше или равно 516, у gpt-5.5 — 44%, у всех остальных моделей вместе — лишь 1,3%. Для сравнения: у gpt-5.4 такое же соотношение — 19,8%, у gpt-5.2 — 0,34%, а у специализированных кодовых версий gpt-5.3-codex и gpt-5.3-codex-spark — 0%.
Аномалия растёт во времени. В феврале доля точных 516 среди ответов с ≥516 токенов была 0,11%, в марте — 2,45%, в апреле — 4,25%, а в мае резко взлетела до 53,3%. В июне немного снизилась — до 35,84%.
Параллельно упала общая интенсивность токенов рассуждений. Среднее число токенов снизилось с 268 в феврале до 107 в мае. P90 тоже упал — с 772 до 344. То есть модель стала выдавать меньше токенов рассуждений в среднем, но при этом чаще «застревает» на ровно 516.
Автор отчёта подчёркивает: это не равномерный рост использования рассуждений. Это именно кластеризация на фиксированных значениях, которая выглядит как работа порогового механизма — ограничения бюджета рассуждений, маршрутизации, триггера на fallback или внутреннего шедулера.
Предлагают команде Codex проверить, нет ли у gpt-5.5 скрытого поведения, при котором ответ обрезается на 516 токенах. И уточнить: является ли 516 нормальной точкой остановки, жёстким лимитом бюджета, признаком деградированного тира обслуживания или каким-то другим внутренним порогом. Для сверки советуют сравнить gpt-5.5 с gpt-5.2, gpt-5.4 и кодовыми вариантами, а также прогнать одинаковые сложные задачи через разные модели и отдельно оценить качество ответов, которые остановились ровно на 516 токенах, versus те, что рассуждали дольше.