← На главную

Omnigent спасает Databricks от экспоненциальных расходов на AI-кодинг

07.08.2026 18:25 · hackernews

AI-кодинг в Databricks дал ощутимый прирост: в некоторых командах скорость разработки выросла на порядок. Но расходы на такие инструменты растут экспоненциально и в итоге могут догнать выручку. Компании, которые внедрили AI в масштабе, оказались в парадоксе: хочется дать всем мощные инструменты, но суммарный счёт съедает выгоду. Решение, которое нашли Databricks, Stripe, Coinbase, Uber и Ramp, — двойная задача: широкий доступ без трения и расходы в фиксированной рамке на пользователя.

Главный рычаг — не гнаться за максимальным интеллектом, а следить за efficiency frontier: моделями с лучшим соотношением цены и качества. Они обновляются чаще и дёшевеют быстрее, чем топовые. Публичные бенчмарки плохо показывают реальную разработку, поэтому компании строят свои. Databricks на своём тесте выявила сильные GLM и раскатала их внутри. Stripe не стала подключать Opus 4.7: она не лучше Opus 4.6, но дороже. У Databricks похожая история с Opus 5.0 и 4.8.

Следующий шаг — гибкость harness'ов. Модели часто заточены под конкретный инструмент: Claude Code, Codex, Cursor. Заставлять разработчиков переключаться вручную — дорого и ведёт к лок-ину. Поэтому в Databricks используют meta-harness Omnigent: общий интерфейс, который сам отправляет задачи на нужный harness с учётом сложности. Плюс умная маршрутизация: proxy решает, какая модель справится с задачей дешевле всего. Примеры — Cursor Router, AutoRouter от OpenRouter, Ramps Router и Smart Routing в Unity AI Gateway. Есть и схемы эскалации: в Claude’s Advisor Tool дешёвая модель ведёт задачу, а сложное отдаёт дорогой; в Devin Fusion от Cognition наоборот. Databricks говорит, что её Smart Router сокращает среднюю стоимость задачи более чем на 30% без потери качества.

Жёсткие бюджеты с обрезкой доступа в опрошенных компаниях — только крайняя мера. Вместо них — прозрачность, мягкие предупреждения, которые можно снять самому, автоматический перевод на дешёвую модель и блокировка как последний шаг. Самые активные пользователи часто самые продуктивные, рубить им доступ невыгодно. Ещё один резерв — токены. Запрос пользователя — лишь небольшая часть контекста, который агент собирает вокруг. Помогают компактизация контекста, менее болтливые harness'ы и настройка prompt caching. Databricks так сократила генерацию токенов почти на 50% без потери качества.

Все это собирается в AI Gateway — центральный слой для проксирования моделей, бюджетов, конфигурации и логов. Databricks отдала Unity AI Gateway и Omnigent в open source. Вывод: экспоненциальный рост расходов — решаемая задача, и для этого не нужно жертвовать продуктивностью.

Читать оригинал →