В интернете часто цитируют пост с тезисом: динамические языки экономичнее статических по токенам LLM, потому что код без явных объявлений типов компактнее. Google AI summary даже выдаёт это как факт. Оригинальный пост сравнивал задачи с Rosetta Code: C проигрывал Clojure в 2.6 раза по числу токенов, а J укладывался в 70 токенов против 109 у Clojure. Проблема в том, что задачи были тривиальными, а на таком масштабе результаты не обобщаются. Во второй ссылке с тестом всё оказалось ещё хуже: один агент на Go подменил симлинком несуществующий путь исполняемого файла, и все последующие языки по факту прогоняли его бинарник. Rust из-за этого получил фейловые баллы, хотя при пересчёте на собственный исполняемый файл набирает идеально.
Чтобы проверить тезис на реальных задачах, в статье прогнали собственные евали. До результатов зарегистрировали предположения: 95% — общий тезис про динамические языки не выдержит, 60% — статические окажутся лучше на ultra effort, 98% — превосходство «странных» языков вроде J не подтвердится. В первом евале агенты по RFC zstd должны были написать полный декодер; тестов им не давали. С GPT-5.6 Sol при medium динамические языки действительно выглядели лучше и дешевле, но при ultra статические выступили не хуже, а результаты стали смешанными. Во втором евале с Pandoc/ProgramBench, где тесты давали, а оценивали на holdout-наборе, сильной связи между успехом, ценой и типом языка снова нет. Обскурные языки проигрывают, Assembly ожидаемо плох, зато популярность языка коррелирует с успехом и дешевизной.
Любопытная деталь: Clojure в zstd-евале сломался у 36/40 medium и 5/40 ultra из-за конвертации байтов 128–255, но в Pandoc показал себя гораздо лучше. Это иллюстрация того, что результат на одной задаче ничего не говорит о языке в целом. Легенды про PHP из-за плохого кода и про мощный Haskell на этих задачах не подтвердились. Есть слабая поддержка «бери популярный язык». Чтобы делать сильные заявления, нужно много разных евалов; два задания могут дать только намёк для классов языков, но не для конкретного языка.
В приложении к статье обсуждают ещё пару вещей. Один запуск ultra в среднем эффективнее, чем повторять medium по кругу, а сохранение контекста работает лучше схемы с полной очисткой контекста. Третья задача — реализация настольной игры Guards of Atlantis 2 — описывается как сложный кейс с плохо написанными правилами, где буквальное прочтение часто противоречит здравому смыслу, но отдельные результаты не приводятся.