← На главную

Ян Лекун представил I‑JEPA и V‑JEPA для видео

10.07.2026 13:45 · hackernews

Ян Лекун предложил JEPA — Joint Embedding Predictive Architectures — в ответ на главную проблему самоконтролируемого обучения: как научить модель понимать мир без меток, не схлопываясь в тривиальные решения и не тратя ёмкость на неважные детали. Ответ — предсказание в пространстве представлений (latent space), а не в пикселях.

В основе I‑JEPA — instantiation для изображений. Вместо реконструкции картинки модель учится предсказывать представления одних участков изображения по другим. Всё строится на Vision Transformer: изображение разбивается на патчи. Маскировочная стратегия ключевая — несколько целевых блоков (target blocks) и один большой контекстный блок (context block), перекрытие удаляется. Контекстный энкодер (student) обрабатывает только видимые патчи, целевой энкодер (teacher) видит всё изображение, его веса не обновляются градиентом, а копируются через экспоненциальное скользящее среднее (EMA) из student. Это предотвращает коллапс представлений. Предиктор — небольшой Transformer, который на вход получает эмбеддинги контекста и маск-токены с позиционными эмбеддингами, предсказывает эмбеддинги для целевых позиций. Loss — среднеквадратичная ошибка (MSE) между предсказанными и истинными представлениями целевых патчей.

Статья объясняет, почему это работает: чтобы предиктор мог успешно предсказывать представления, контекстный энкодер должен извлекать семантические, структурные признаки — объекты, отношения, физику. Шум на уровне пикселей бесполезен. Целевой энкодер, в свою очередь, выдаёт только то, что можно предсказать из контекста, игнорируя случайные детали.

Подход расширен на видео: V‑JEPA (2024) и V‑JEPA 2 (2025) предсказывают представления будущих кадров из прошлых. А LeJEPA (2025) предлагает заменить инженерные эвристики (как EMA) на обоснованный распределительный регуляризатор. В статье приводится полная пошаговая реализация I‑JEPA на PyTorch с нуля — от эмбеддинга патчей до цикла обучения. Она намеренно опускает FlashAttention, gradient checkpointing и другие инженерные оптимизации, чтобы сосредоточиться на математике.

Читать оригинал →