← На главную

Три принципа role-model: без дуэта топ-моделей и внешних рейтингов

03.07.2026 05:36 · hackernews

При разработке role-model — маршрутизатора моделей, протокола и расширения Pi — сформулированы три ключевых принципа, которые пригодятся как тем, кто использует готовые роутеры, так и тем, кто пишет свои.

Первый: держите модели разными. Часто можно встретить настройку, где последняя GPT работает бок о бок с последней Opus, и каждая решает свою подзадачу в кодинге. Это не ошибка, но с точки зрения маршрутизации — неоптимально. Обе модели — универсалы, сильны в написании кода и висят в одной ценовой и качественной категории. Принимать решение, какую из них позвать, почти невозможно: слишком сложно точно оценить сложность запроса, а потом ещё и решить, куда его отправить, когда модели идут нос к носу по всем метрикам. Вместо того чтобы сталкивать два фронт-модели, лучше сдружить одну фронт-модель с другой, которая выдаётся хотя бы по одной стороне треугольника «скорость — качество — стоимость». Пример: роутер с GPT 5.5, который средние и простые запросы перебрасывает на DeepSeek V4 Pro. Она заметно дешевле и ощутимо хуже на сложных задачах — решения о маршрутизации становятся очевидными.

Второй принцип: держите пул моделей маленьким. Это логично вытекает из первого. Добавлять много моделей — соблазнительно. Можно зарядить в role-model GPT 5.5, Kimi 2.7, DeepSeek V4 Pro и DeepSeek V4 Flash, плюс пару мелких GPT. Но если у каждой нет ярко выраженной специализации, пул только усложняет выбор. На практике такие конфиги сводятся к тому, что одна топ-модель берёт на себя всё сложное, а вторая — мелкие задачи, потому что у неё тёплый кэш. Правило: по умолчанию ограничьтесь двумя. Добавляйте новую, только если можете чётко сформулировать её роль. Увеличит ли она скорость, качество или снизит стоимость? Нет — не добавляйте.

Третий: используйте относительные, привязанные к реальности бенчмарки. Некоторые роутеры смотрят только на метаданные модели, например стоимость. Другие подмешивают внешние бенчмарки из источников вроде Artificial Analysis. Это лучше, чем ничего, но слабо помогает. Такие бенчмарки могут быть недостаточно детальными, не отражать вашу реальную рабочую нагрузку, быть не относительными и просто не иметь данных по определённым моделям.

Читать оригинал →