На прошлой неделе OpenAI выпустила линейку GPT-5.6 — модели Sol, Terra и Luna. Основной упор в анонсе был на computer use: модели умеют навигировать по десктопным приложениям. Чтобы проверить, насколько у них с этим будет хорошо, Roboflow прогнала новые модели через собственный VLM-бенчмарк, который скоро выложат публично. Он покрывает детекцию, подсчёт объектов, OCR и извлечение данных.
Sol — лучшая vision-модель OpenAI на сегодняшний день. Особенно виден скачок в детекции и подсчёте: GPT-5.5 сильно отставала от топовых VLM. Terra и Luna слабее Sol, но обе заметно прогрессировали относительно GPT-5.5.
Детекция — главный прорыв. GPT-5.5 набрала 13.8 mAP@50, а Sol — 46.2. Terra и Luna идут следом: 44.7 и 43.3. То есть детекция превратилась из слабого места в практически полезный инструмент. Особенно хорошо Sol справляется с layout-детекцией документов: находит заголовки, таблицы, картинки и подписи. Неплохо показывает себя и на плотных сценах вроде упаковок таблеток или яиц, где много похожих объектов вплотную друг к другу.
Для лучших результатов промпты нужно просить вернуть абсолютные XYXY-координаты в пикселях изображения. Gemini 3.5 Flash, для сравнения, лучше работает с YXYX-координатами, нормализованными к диапазону 0–1000. Если использовать неправильный формат, результаты детекции GPT-5.6 падают примерно на 15 mAP-пунктов.
Бывают и странности: Sol иногда выдаёт боксы в случайных местах, без пересечения с объектами, и часто они образуют неестественные паттерны — ровные ряды или равномерные группы. OpenAI подтвердила, что модель становится менее стабильной на изображениях от 2000×2000 пикселей, особенно при низком reasoning effort. Повышение effort помогает, но растут токены, задержка и цена. Практичное решение — ресайз или кроп перед отправкой в OpenAI API.
Подсчёт объектов тоже подтянулся. Sol набрала 73.0% против 64.9% у GPT-5.5, Terra — 67.6%, Luna — 66.2%. Даже самая дешёвая Luna обошла прежний бейзлайн OpenAI. Sol справляется со сложными случаями вроде сильно перекрывающихся металлических кронштейнов и пулевых отверстий в отмеченных зонах. А вот блистерные упаковки оказались тяжёлыми: и пустые ячейки, и оставшиеся таблетки модель считает плохо.
По OCR результаты почти не изменились: Sol — 90.7%, GPT-5.5 — 91.2%. Текстовое извлечение чуть хуже: 82.5% против 87.6%. При этом Sol хорошо читает рукописные заметки и текст в сложных сценах: например, размер шины на грязной покрышке или счёт хоккейного матча. Но простую дату истечения на блистере прочитать не смогла.
Теперь о компромиссах. Sol тратит в среднем 10 секунд на изображение, Terra — 6, Luna — чуть больше 5. Luna даёт лучший баланс задержки и качества. По цене Sol — около 2.5 цента за изображение, Terra — 1 цент, Luna — меньше 0.5 цента. Gemini 3.5 Flash стоит 0.8 цента и при этом всё ещё лидирует в бенчмарках по детекции и подсчёту, так что для больших объёмов данных это более практичный выбор.
С GPT-5.6 OpenAI вплотную приблизилась к лидерам VLM. Детекция стала пригодной для реальных задач, подсчёт улучшился во всей линейке. Sol всё ещё дорогая, медленная и иногда нестабильная, но прогресс очевиден. Для агентов, понимания экранов, документов и визуальных рассуждений OpenAI теперь выглядит куда серьёзнее.