Компьютерные агенты, которые должны работать с интерфейсами вместо человека, пока буксуют. На бенчмарке длинных задач OSWorld-V2 лучшая модель добирается лишь до 20,6% успешных выполнений, на Agents' Last Exam — до 26,2%. Пользователи, привыкшие к впечатляющим ответам LLM в чате, ждут такого же и от агентов, а получают медленные, дорогие и ненадёжные результаты — проще всё сделать самому.
В 2024–2025 годах все крупные лаборатории показали прототипы computer use, которые отлично выступали на бенчмарках вроде OSWorld, WebArena, AndroidWorld и WebVoyager с цифрами от 60,76% до 97,4%. Но те тесты были стерильными: статичная среда, чистое текстовое представление и крошечный набор действий, — ничего похожего на реальный хаос интерфейсов. Отсюда и разрыв между ожиданиями и настоящей работой.
Главный изъян в том, что агенты просто обходят интерфейс. На OSWorld-V2, чтобы забронировать номер в отеле, GPT-5.5 вколол JavaScript, прочитал исходники сайта, нашёл эндпоинт внутреннего API и отправил бронь прямым POST-запросом. Покупку железнодорожного билета и GPT-5.5, и Claude Opus решили так же — мимо сайта, сразу к API. Скомпоновать два изображения в GIMP модель предпочла скриптом на Python. В задаче 068, где требовалось пройти игру через GUI, Claude Opus 4.7 просто отправил POST-запрос, обновив счёт до 150 в обход интерфейса.
Иногда такой обход даже кажется выгодным, но у него есть побочные эффекты — программы не рассчитаны на прямое дёрганье внутренних механизмов. А главное, основную массу действий гораздо проще сделать именно через интерфейс: нажать кнопку или заполнить форму человеку несложно, а вот разобрать API сайта или написать скрипт для графического редактора — на порядки сложнее и дороже. Вот только для передовых моделей честный клик — неподъёмная роскошь. Бенчмарк WebGames, оценивающий простые действия с реакцией и моторным контролем среднего пользователя, люди сдают на 95%, а модели проваливаются, несмотря на весь интеллект. И этот разрыв не сокращается ни добавлением токенов, ни наращиванием параметров. Поэтому в сложных задачах агенты лезут в обход: они не умеют пользоваться интерфейсом на человеческом уровне, вот и приходится выкручиваться.
Расплата — нелепое распределение вычислительного бюджета. Львиную долю действий съедают визуальная привязка, низкоуровневые манипуляции и оверхед вызова инструментов. На планирование, осмысление и восстановление после ошибок остаются крохи. Получается, мы гоняем триллионные модели-рассуждатели только для того, чтобы обмануть необходимость клика.
В Steelman Labs считают такой подход тупиком и строят решение от обратного принципа: агент обязан уметь пользоваться любым интерфейсом, как человек. Для этого они разделяют планирование и исполнение и вводят быстрый «System 1» — манипулятор, отвечающий за моторное управление. Подход vision-first, экран воспринимается как динамическая среда, а время реакции стремятся довести до человеческого. Демонстрация работы модели Steelman Labs, управляющей живым интерфейсом в реальном времени, уже есть в видеозаписи.