Модель 3.7 Flash заметно обошла 3.6 Flash в задачах программирования — отладке и решении проблем. Она точнее с первого раза генерирует код и лучше справляется с продакшн-кодом. В тесте FrontierCode 1.1 Main результат вырос с 34.4% до 43.6%, в DeepSWE v1.1 — с 49.0% до 65.3%. В веб-разработке 3.7 Flash собирает более рабочие макеты и полноценные приложения за меньшее число запросов. При генерации UI модель строго следует референсу — скриншоту, картинке или целой дизайн-системе. На WebDev Arena от Arena.ai она получила Elo 1588 против 1538 у 3.6 Flash. Для сложных областей вроде финансов, права и бионаук у 3.7 Flash улучшились рассуждения и точность. На бенчмарке GDP.pdf, который проверяет обработку сложных документов, результат 34.0% против 22.0%. В AutomationBench модель завершает реальные бизнес-процессы эффективнее: 30.4% против 17.0%.
3.7 Flash обошла 3.6 Flash в программировании и веб-разработке
13.08.2026 17:23 · hackernews