Современные LLM кодируют входные тексты как векторы в embedding space. Одно из самых приятных открытий — многие естественные концепты (пол, эмоции, столицы) соответствуют направлениям в этом пространстве. Эту идею часто называют Linear Representation Hypothesis. Особо смелая версия гипотезы утверждает, что существует направление «правды». Маркс и Тегмарк изучали такую возможность, а позже появилось ещё несколько работ на эту тему.
Исследователи из AI safety кормят моделям истинные и ложные утверждения и тренируют классификаторы, разделяющие их embeddings. Это работает на удивление хорошо и даже частично обобщается. Может ли суперинтеллект отражать истинность высказываний прямо в геометрии embeddings?
Эта мечта напоминает проект Рассела, Уайтхеда и Гильберта — построить систематический способ решать вопрос об истине математических утверждений. Гёдель разрушил эту мечту, показав, что истина не сводится к доказуемости. Тарский усилил парадокс: достаточно выразительный язык не может содержать собственный тотальный предикат истины. Проблема остановки Тьюринга — ещё одна диагональная конструкция. Ноcон Янофски обобщил эти парадоксы самореференции: проблемы возникают, когда вещи начинают иметь дело с собственными свойствами.
Transformer-based LLM устроены похоже: они представляют входы как векторы в пространстве, где направления соответствуют концептам, а сами концепты можно выразить на естественном языке. Не вся геометрия embeddings легко вербализуема, но важные части — да; в частности, концепт правдивости часто оказывается представлен (см. пост Anthropic о J-space).
Теперь диагональная атака. Пусть t(s) — выход truth probe на строке s. Возьмём предложение «The truth probe’s score for this sentence evaluates to FALSE». Если предложение истинно, корректный probe должен выдать TRUE, но тогда из самого предложения следует, что probe выдал FALSE — противоречие. Если оно ложно, то probe выдаст TRUE… Парадокс. Универсальный truth probe невозможен: никакой probe, определимый над пространством представлений модели, не может точно уловить истину для языка, достаточно богатого, чтобы описать сам probe и его выводы.
Автор проверил это на практике с моделью Qwen3.5-4B. Он обучил логистическую регрессию на разнице средних embeddings набора предложений с метками TRUE/FALSE. На 36 тестовых примерах probe отсекал по порогу 0.5 и показал точность 94% (AUC 0.98), ошибки только на арифметических фразах вроде «five times seven is thirty-five». Однако на диагональных атакующих предложениях результат стал бессмысленным. При этом дело не в любой самореференции: предложение «This sentence is written in English» модель оценивает точно.
Можно ли спасти идею через трюк с неподвижной точкой? Теорема Ловера о неподвижной точке говорит, что парадоксы лжеца возникают, когда отображение значений истинности не имеет неподвижной точки. Если представить TRUE/FALSE как {0, 1}, отрицание v -> 1-v не имеет неподвижной точки. Но если расширить множество до интервала [0, 1], отрицание получит неподвижную точку 1/2, и стандартное предложение лжеца получит самосогласованную оценку 0.5. Однако это не спасает от всех диагональных атак: чтобы гарантировать неподвижную точку для любых операций, нужно ограничиться непрерывными функциями на [0, 1] (по теореме Брауэра). Высказывание «This sentence has truth score less than 0.5» не является непрерывной функцией от истинностного значения и снова порождает парадокс. Универсальный truth probe по-прежнему невозможен.
Truth probes, проецирующие на одно направление, отлично работают в простых случаях. Но они не оракулы истины и никогда ими не станут. Градуированная семантика на [0, 1] с непрерывными операциями может приписать классическому лжецу значение 1/2, но лишь ценой запрета точных утверждений о величине истинности. Обычные логистические truth probes не обладают такой рефлексивной семантикой только потому, что их выходы лежат в [0, 1]. Многим кажется абсурдным использовать суперинтеллект как оракул истины, но на практике модели уже заменяют поиск Google, и люди всё чаще делегируют им окончательное суждение об истине. Некоторые даже верят, что есть платоновское пространство представлений, к которому сходятся все модели и которое отражает «истинное» устройство мира. Этот пост предупреждает: такой подход ведёт к парадоксам. При этом truth probes остаются полезным инструментом для понимания поведения моделей и раннего обнаружения misaligned поведения — точно так же, как неполнота и неопределимость истины не остановили математику.