Разработчики из Feyn представили семейство моделей Pulpie — они вычищают основной контент из HTML-страниц, убирая навигацию, рекламу, футеры и прочий шум. На обычной странице около 70% блоков — это «бойлерплейт», мусор. А качество финальной очистки напрямую влияет на то, как хорошо работают языковые модели — и на этапе претрейнинга, и при инференсе.
Младшая модель pulpie-orange-small (210M параметров) набирает 0.862 ROUGE-5 F1 на бенчмарке WebMainBench — практически вровень с Dripper (0.864), у которого параметров почти втрое больше (600M). Секрет в архитектуре. Pulpie — это энкодер, который за один прямой проход маркирует каждый HTML-блок как контент или мусор. Dripper устроен как декодер — он генерирует метки по одному токену, каждый раз перечитывая всю модель из GPU-памяти. Это делает его медленным и дорогим.
Разница на практике огромна. На NVIDIA L4 pulpie-orange-small обрабатывает 13,7 страниц в секунду против 0,68 у Dripper. При стоимости L4 $0,39/час очистка миллиарда страниц обойдётся в $7 900 с Pulpie и в $159 000 с Dripper — в 20 раз дешевле при том же качестве. На A100 отрыв по скорости — 7,1 раза, хотя по качеству модель-учитель (Pulpie Orange Large, 2,1B) даже обгоняет Dripper на 0,9 F1.
Для обучения Pulpie пришлось создать датасет с разметкой на уровне блоков. Взяли 16 670 англоязычных страниц из Common Crawl, разбили на блоки через MinerU-HTML и промаркировали их с помощью DeepSeek V3.2. Потом проверили разметку моделью Dripper 0.6B — согласованность составила 93,3%. Оставили 14 959 страниц, где две модели сошлись хотя бы на 70% блоков. Затем на этих данных дообучили учителя на базе EuroBERT-2.1B. А уже из него методом дистилляции (Hinton et al., 2015) получили две компактные модели.
Исследование AICC показало, что замена эвристического экстрактора на модельный при прочих равных даёт прирост средней точности на 1,08 процентного пункта на 13 бенчмарках. Более того, такая модель обогнала модели, обученные на FineWeb и RefinedWeb — одних из самых тщательно отфильтрованных корпусов. А эвристики вроде Trafilatura заметно портят структурированные данные: код на них получает всего 0,13 сходства против 0,91 у модельного подхода, формулы — 0,61 против 0,94.
Все три версии Pulpie (small, base, large) открыты и доступны на Hugging Face. Рекомендуемая для продакшна — pulpie-orange-small как самая быстрая и дешёвая при качестве, практически не уступающем топовым решениям.