← На главную

Рекорд speedrun-дообучения LoRA от Saivineeth147: 6:05 на Qwen2.5-1.5B

20.07.2026 04:24 · hackernews

В интернете запустили открытое соревнование по speedrun-дообучению LoRA. Задача — как можно быстрее натренировать Qwen2.5-1.5B до точности ≥ 57% на GSM8K, используя один L40S. Текущий рекорд — 6 минут 5 секунд, его поставил @Saivineeth147. Он использовал sequence packing, маскировку лосса только на completion и всего 2 эпохи. Для сравнения, базовая настройка с обычным LoRA r=16 и 3 эпохами работала почти 12 минут и давала 59.4%.

Соревнование построено на жёстких правилах. Оборудование заморожено: один L40S (48 ГБ) через Modal sandbox. Модель и данные — только заданные, без учителей и синтетики. Всё воспроизводимо: любой желающий может запустить скрипт верификации на тех же мощностях, и Modal даёт на это бесплатные креды. Запуск проверяет чит-коды, сетевую активность и целостность данных автоматически через Claude. Если всё чисто — поддерживающий комментирует /verify, и система прогоняет сабмикшен три раза с разными seed'ами.

Второй трек — SQuAD v1.1 с моделью SmolLM2-1.7B и порогом ≥ 75.5%. База там — 11 минут 8 секунд. Сделано два трека намеренно: техника должна выигрывать на разных задачах и архитектурах, чтобы считаться универсальной. Если хитрость работает только на одном треке — это рекорд, но не метод.

Что можно менять внутри? Всё остальное: rank, тип квантизации (QLoRA NF4 vs bf16), расписание learning rate, кастомные ядра (Unsloth, Liger), torch.compile, DoRA, rsLoRA, PiSSA, NEFTune шум, LoRA+ с асимметричными LR для матриц A и B. Идея в том, чтобы устроить честное соревнование идей, как это уже сделал nanoGPT speedrun для претрейнинга — оттуда, кстати, вылупился оптимизатор Muon.

Сейчас занята только одна тактика — паковка последовательностей. Остальные приёмы свободны. Кто хочет — может побить 6 минут 5 секунд. MIT-лицензия, всё открыто.

Читать оригинал →