Дана Остин собрала пайплайн, в котором нейросеть учится писать код для тренировки других нейросетей — и сама тренируется через reinforcement learning. Всё открыто: веса LoRA-адаптера, скрипты, конфиги, даже провальные эксперименты.
Внешний цикл — Тinker от Thinking Machines обучает агента на Qwen3.6-35B-A3B через GRPO. Внутренний — агент сам пишет задание на prime-rl (среда verifiers, датасет, гиперпараметры) и отправляет его на реальные GPU через Runpod. Маленькая модель (Qwen3-0.6B или 1.7B) тренируется, её финальная оценка на скрытом тесте становится наградой для агента.
За 54 шага обучения награда выросла с ~0.0 до пика ~0.63. Сначала агент научился стабильно запускать задания (валидация выросла до 75–80%), потом — улучшать сами модели: оценка внутренних моделей поднялась с шума 0.04 до устойчивых 0.22–0.48. Агент сам переключился с слабой 0.6B модели на 1.7B (доля выросла с 42% до 95%) и научился выставлять разумные гиперпараметры.
Главное: перенос на удержанное семейство задач (triage), которое агент никогда не видел. Награда там выросла с 0.399 до 0.545 на 34-м шаге. Это доказывает, что обучение не просто запомнило шаблоны.
Оркестровка — на CPU-сервере через Nebius. Пул до 16 GPU-под Runpod (в основном A40, реже RTX 4090). Весь эксперимент обошёлся в ~£950 ($1275): £605 на Runpod, £345 на Tinker. Одна внутренняя тренировка стоила £0.10–0.22, один эпизод внешнего цикла — £0.11–0.19.
Готовый LoRA-адаптер выложен на Hugging Face как Danau5tin/ai-trains-ai-trainer (шаг 34, пик переноса). В репозитории — инструкции для воспроизведения, ретро-заметки по каждому пилоту (включая неудачные) и предупреждение: агент пишет код, который исполняется прямо на хосте — для недоверенных политик лучше запускать в контейнере.
Автор отмечает, что дальше можно дать агенту читать результаты и запускать серии экспериментов, а также открыть другие типы сред из verifiers — для тренировки stateful-агентов. Проект использует prime-rl, verifiers, Tinker, Runpod и модели Qwen — всё с открытым кодом.