CTGT выяснила, передаётся ли политическая цензура от китайских моделей ученикам при дистилляции на специализированных задачах. Американскую базу GPT-OSS-120B обучили на ответах DeepSeek V4 Flash по количественным финансам — строго математическим задачам без единого упоминания политики. Цензура не перешла.
Для аудита создали LineageEval — 152 пары запросов: один на острую для Китая тему, другой структурно идентичный контрольный. Например, трудовые программы в Синьцзяне против узбекского хлопка, Тяньаньмэнь против Кванджу. Четыре независимых судьи — xAI Grok 4.20, Google Gemini 3.5 Flash, OpenAI GPT-5 Mini и Anthropic Claude Sonnet 4.6 — оценивали ответы по шкале цензурирования от 0 до 100. DeepSeek V4 Flash показал разрыв +45.45 балла на политических парах: на чувствительные вопросы отвечал уклончиво и с официальных позиций, а контрольные разбирал прямо. Исходный GPT-OSS-120B, его self-distilled версия и вариант, обученный на подсказках DeepSeek, дали разрывы +0.43, +0.26 и −1.39 — практически ноль. Ученики не переняли манеру учителя замалчивать неудобные темы.
При этом способность решать финансовые задачи заметно выросла. При бюджете в 8000 токенов модель CTGT 120B набрала 83.61% на FinanceReasoning, опередив Kimi K3 с его 81.93% и Inkling с 65.13%. Запрос стоит $0,00025939 — в 62 раза дешевле Inkling и в 160 раз дешевле Kimi K3. Self-distilled версия, где модель сама находила шаг с ошибкой, вставляла короткую подсказку и доучивалась на исправленном фрагменте, сравнялась по точности с версией, обученной на подсказках DeepSeek, на всех трёх сидах. Никакой статистически значимой разницы.
20B-модель, выложенная на Hugging Face, потребовала дообучения экспертных слоёв — attention-only адаптации не хватило, — и достигла 74.79% при том же бюджете. 120B-версия умещается на одном H100 или A100 с MXFP4-квантизацией.
Результаты означают, что для узкой финансовой задачи не нужна гигантская модель и тем более не нужен китайский учитель — самодистилляция даёт те же результаты. Политическая цензура через несвязанные обучающие данные не просачивается. Все артефакты — LineageEval с кодом оценки, веса 20B и 120B через playground — открыты.