← На главную

GPT-5.6 Sol отклонил лонсдейлит Claude Opus 5 в поиске BEOL-материалов

12.08.2026 07:51 · hackernews

В бенчмарке для больших языковых моделей поставили задачу: предложить динамически стабильные, новые и BEOL-совместимые кристаллические материалы, у которых теплопроводность κ, статическая диэлектрическая проницаемость ε0, модуль Юнга Y и модуль сдвига G попадают в нужные окна. Для каждого кандидата модель обязана приложить рецепт синтеза, совместимый с BEOL-температурами и процессами, который эксперт признал бы стоящим попытки. Новизна значит, что материал никогда не осаждали тонкой плёнкой в BEOL-совместимых условиях.

Моделям выдали набор инструментов, похожий на то, что есть у вычислительного материаловеда: веб-поиск через Exa, песочницу с python и bash и пакетами pymatgen, mp_api и ASE, а также ML-инструменты для расчёта динамической стабильности, решёточной теплопроводности, статической диэлектрической проницаемости и тензора податливости. У модели нет условия остановки: она работает, пока не упрётся в ошибку или не исчерпает бюджет в 100 миллионов токенов. Для бенчмарка используют открытый фреймворк Inspect от UK AI Security Institute.

Свойства считают через машинное обучение. Динамическую стабильность и «гармоническую» теплопроводность получают с Pheasy и Phonopy: генерируют случайные конфигурации, методом сжатого sensing подгоняют силовые постоянные, а энергии и силы оценивает универсальный MLIP PET-MAD. Моды с мнимыми частотами ниже −1 THz считаются динамически нестабильными. Решёточную теплопроводность считают в приближении трёхфононного рассеяния, решая уравнение Больцмана в приближении времени релаксации, с учётом изотопов. Статическую диэлектрическую проницаемость даёт GMTNet, обученный на базе JARVIS DFPT: отдельно предсказывают электронную часть ε∞ и эффективные заряды Борна, из которых с помощью оптических мод собирают ионный вклад. Механические свойства получают из тензора податливости, деформируя ячейку в 12 конфигурациях и предсказывая напряжения той же моделью.

Рецепты синтеза оценивают по рубрикам со штрафами двух типов: критичные и исправимые. Критичный штраф автоматически означает, что рецепт не попробуют. Автоматический грейдер — worst of three GPT-5.6 Sol с веб-поиском OpenAI, он лучше всего коррелировал с человеческими оценками.

В статье разобран пример: Claude Opus 5 предложил гексагональный алмаз, лонсдейлит, через seeded microwave-plasma CVD на 300-мм Si-подложке с буфером из AlN или h-BN и наноалмазными затравочными кристаллами. Грейдер вернул WOULD NOT ATTEMPT: один критичный штраф и пять исправимых. Критичный в том, что процесс не даёт достоверного пути к упорядоченной фазе P6₃/mmc: рост идёт от кубических наноалмазных затравок, а буфер не контролирует укладку. Также плохо прописаны плазма, газы, последовательность осаждения и утилизация отходов, а Raman, GIXRD и SAED могут принять дефектный кубический алмаз за гексагональный.

Читать оригинал →