Исследователи построили управляемую песочницу, чтобы понять, как языковые модели усваивают знания. Современные LM учатся сразу на всём подряд, поэтому непонятно: новый навык появился благодаря обучению или он уже был в данных? Чтобы разобраться, они ограничили саму обучающую выборку. Собрали корпус LittleCurriculum — 88B токенов, вычищенных из FineWeb-Edu через пятиступенчатый фильтр по стандартам Common Core для K-5. Всё, что преподают после пятого класса (факты, понятия, слова), из корпуса убрали.
На этом корпусе с нуля обучили модели LittleLearner трёх размеров — 0.6B, 1.3B и 5B. Это чат-модели с интерпретируемой границей знаний. Для каждой есть парная контрольная модель Unfiltered — та же архитектура, те же токены и рецепт, но без фильтра.
Главный вывод экспериментов: масштабирование, post-training через SFT+GRPO и in-context learning лишь усиливают то, что модель уже выучила из учебной программы. Ни одно из вмешательств не даёт значимого улучшения на задачах, выходящих за её пределы. Фильтр предобучения фактически задаёт потолок возможностей.
Масштабирование улучшает результаты внутри контролируемой области знаний и немного помогает на задачах той же траектории, но почти не влияет на более продвинутые. Post-training через GRPO на MathCAMPS заметно поднимает точность на задачах K-5, но не способен вернуть способности за пределами K-5, даже если учить на внешних данных. In-context learning с протестированными промптами тоже не открывает у 5B LittleLearner новых рассуждений.
Раз граница точно известна, можно ставить чистые эксперименты. Авторы предлагают три направления. RL: может ли подкрепление создать новую способность, если априорные знания ограничены K-5? Continual learning: ввести отрицательные числа и смотреть, как модель их усваивает, насколько эффективно, и отвечает ли она, сомневается или галлюцинирует. Сравнение с детьми: нужна ли модели и ребёнку одинаковая экспозиция для изучения дробей и делают ли они похожие ошибки на текстовых задачах?
Благодаря известной границе любую свою идею можно превратить в чистый эксперимент. Статья лежит на arXiv (2608.13545), авторы просят её цитировать.