Manifest отказалась от роутинга моделей и полностью удалила свой LLM router. Его запустили в марте как ключевую функцию LLM gateway, в июне объявили устаревшим, а 1 сентября окончательно выключили. Роутер классифицировал каждый запрос по четырём уровням сложности — simple, standard, complex и reasoning — и подбирал под них модель подешевле. За четыре месяца на 7000 облачных пользователей результаты оказались неоднозначными, а в GitHub накопились проблемы и долгие обсуждения.
Главная беда — сложность задачи не вытащить из одного промпта. Промпт лишь триггер, а весь контекст всплывает потом: через вызовы инструментов, веб-поиски и так далее. Пример: «оцени тесты для репозитория $GIT_REPO и улучши их» может быть тривиальным для личного сайта на чистом HTML5 или невероятно трудным, если цель — репозиторий Linux kernel. Кэширование даёт куда более предсказуемую экономию. Cache reads стоят на 75–90% дешевле необработанных входных данных, а prefix cache отлично ложится на system prompts и историю диалогов — они всегда в начале промпта. Поэтому роутер, который уважает кэш, наоборот, старается «приклеиться» к уже выбранной модели и лишний раз не переключается.
LLM routers ломают согласованность поведения. Призывы «инженер не должен думать о выборе модели» Manifest не принимает: специалист обязан понимать компромиссы между моделями, как художник — разницу между кистями. Внутри Manifest каждый инженер сам выбирает модель и effort parameters под свою задачу. Прыжки между моделями во время работы снижают общее качество и отрывают людей от настоящего владения инструментами. Непредсказуемость тоже дорого обходится. В автоматизированных agentic-сценариях лишний слой неопределённости часто съедает больше, чем удаётся сэкономить: усложняются evals, system prompts, observability и вся обвязка. Проще изолировать разные запросы и сразу подбирать под них правильные модели и параметры.
В итоге Manifest признаёт, что роутинг может быть полезен где-то ещё, но на собственном опыте убедились: в большинстве случаев игра не стоит свеч. Сэкономленное на моделях всё равно тратится в другом месте, только оценить эти траты гораздо сложнее.