Лаборатория имени Лоуренса в Беркли (Lawrence Berkeley National Laboratory) — одна из ключевых научных площадок Министерства энергетики США (DOE). Там установлен Advanced Light Source (ALS), гигантский ускоритель размером с футбольное поле, который генерирует мощные рентгеновские лучи. Учёные используют эти лучи, чтобы изучать материалы от атомного уровня до живых растений. Но проблема в том, что детекторы на установке апгрейднули — и данные хлынули потоком, с которым люди не справляются.
Цифры такие: ежегодно все центры DOE, работающие с синхротронами и нейтронами, генерируют десятки петабайт данных. Это миллионы гигабайт — как будто стримить 2 миллиона часов HD-видео. Раньше такого завала не было. Старые детекторы делали один кадр за шесть секунд, а новые — 100 000 кадров в секунду. Разница на порядки, и ручной анализ просто не успевает.
Узкое место — сегментация. Это процесс, при котором компьютер выделяет границы разных структур на изображении: клеточные стенки, зёрна минералов, слои полупроводников. Вручную на один такой датасет уходили недели кропотливой работы экспертов.
Осенью 2025 года Белый дом запустил инициативу The Genesis Mission. Цель — ускорить научные открытия с помощью ИИ. Подразделение SYNAPS-I (Synergistic Neutron And Photon Science – Intelligence) объединило четыре национальные лаборатории: Argonne, Brookhaven, Oak Ridge и SLAC. Они решили превратить обработку данных из многомесячного тормоза в почти мгновенный процесс.
В основе пайплайна SYNAPS-I — две открытые модели от Meta: Segment Anything Model 3 (SAM 3) и DINOv3. DINOv3 — это самоконтролируемая модель зрения: она учится на сырых картинках без разметки и отлично понимает, что где находится. SAM, в свою очередь, рисует точные границы вокруг объектов. Вместе они работают как команда: SAM делает пиксельную маску, DINO подсказывает, что это за структура и как она связана с окружающим образцом.
Команда SYNAPS-I дообучила обе модели на научных данных с установок DOE и развернула их на 300 GPU A100 в суперкомпьютерном центре NERSC. Результат: полностью реконструированное и промаркированное 3D-изображение возвращается учёному прямо к стенду, пока эксперимент ещё идёт. Всё занимает примерно 15 минут.