← На главную

JuliaHub: смена Dyad на Claude Code уронила счёт claude-fable-5 вдвое

29.07.2026 14:56 · hackernews

JuliaHub прогнала свежие frontier-модели через своего агента Dyad на пяти задачах физического моделирования — от проверки конститутивных уравнений до полноценного полётного симулятора NASA HL-20. Каждая попытка проходит в изолированном контейнере: агент читает спецификацию, выводит физику, пишет модель на языке Dyad, компилирует, симулирует и верифицирует результат, а затем закрытый эталонный графер сравнивает траектории, игнорируя красоту кода. Модель может выдать компилирующийся и «зелёный» результат с полностью неверной физикой — именно это и проверяли.

По взвешенному среднему баллу (самым сложным задачам — больший вес) лидирует claude-fable-5 от Anthropic с результатом 0.889. Он единственный прошёл все 12 попыток на четырёх базовых задачах и показал лучший счёт на нерешённой HL-20 — 0.69. Цена убедительности: $9.60 за прогон, $124.76 за всё исследование, в среднем 16.1 минуты на попытку. Второе место — gpt-5.6-sol от OpenAI (0.814) при $1.74 за прогон и 13.4 минутах. Он строил одни из самых сильных независимых проверок, но однажды перепутал компоненту скорости в релятивистской задаче, подогнав её под собственное неверное прочтение спецификации. Третий — gpt-5.6-terra (0.786, $1.25, 12.6 минут) — экономит на всём, чаще правит файлы методом проб и ошибок, и умудрился обрезать время симуляции, оставив точную физику без проверки. Замыкает четвёрку gpt-5.6-luna (0.727, $3.26, 25 минут) — много читает и итерирует, но почти не сверяется с внешними ориентирами, отчего на сложных задачах его собственные проверки верифицируют лишь сами себя.

На самой трудной задаче — HL-20 с шестью степенями свободы, аэродинамикой из 170 таблиц и восемью сценариями — не справился никто. Fable потратил треть времени на чтение спецификаций и служебных записок NASA, рендерил PDF как изображения, чтобы уточнить константу, написал 16 файлов, скомпилировавшихся с первой попытки, и провёл батарею фальсификационных тестов. Sol быстрее всех извлёк данные из меморандумов и за 27 минут прошёл 24 проверочных кейса, но его траектория «голландского шага» ушла в пике ниже уровня моря, а модель сочла поведение руля корректным. Terra не стал читать руководство по настройке смесителя управления и «изобрёл» его сам, получив худший полноценный полёт. Luna 23 раза билась об одну ошибку компиляции, в итоге обнулила вертикальную аэродинамическую силу и тангаж — аппарат падал, не вращаясь.

Главный вывод оказался не в рейтинге моделей. Разница по взвешенному баллу между лучшей и худшей моделью составила 0.162. А когда ту же самую frontier-модель запустили не в Dyad, а в обычном агенте Claude Code с теми же инструментами, счёт рухнул с 0.899 до 0.533 при почти идентичной цене — разрыв 0.366, вдвое больше. В Dyad верификация встроена в процесс, а общего назначения агент может проверять физику, но ничто не заставляет его это делать. Так что выбор инструмента важнее выбора модели. Если нужна максимальная вероятность корректной физики — берите claude-fable-5. Если лучший балл на доллар — gpt-5.6-sol. Но в обоих случаях — только внутри Dyad.

Читать оригинал →