РУКОВОДСТВО · ОБНОВЛЕНО 2026-09-15
Маршрутизация AI-моделей: каскад, правила и контроль
Router выбирает маршрут до или после первого ответа, чтобы не платить максимальную цену за каждую задачу и сохранять требуемое качество.
Разделите запросы по проверяемым признакам, назначьте дешёвый основной маршрут и условия эскалации на более сильную модель. Проверяйте каскад целиком: router может ошибиться раньше модели. Ограничьте бюджет и число переходов, а fallback используйте для доступности только при совместимом контракте.
1. Опишите классы запросов
Разделите массовые простые операции, сложные рассуждения, изображения, длинные документы и tools. Для каждого класса задайте обязательные возможности и критерий приёмки. Язык или длина могут быть признаками, но редко достаточны сами. Не отправляйте чувствительный запрос провайдеру, который не соответствует политике данных.
2. Начните с явных правил
Детерминированный router проще отлаживать: тип файла, endpoint, требуемая schema, лимит времени и максимальная цена исключают неподходящие модели. Затем можно добавить классификатор сложности. Его обучают или настраивают на размеченных примерах и оценивают отдельно, особенно ошибки, отправляющие тяжёлую задачу слабому маршруту.
3. Спроектируйте каскад
Компактная модель отвечает первой, а валидатор проверяет формат, обязательные факты или тест. Неудача уходит на сильный маршрут вместе с исходным запросом и кратким сигналом проверки. Самооценка модели полезна как один признак, но плохо заменяет внешний критерий. Число ступеней и общая стоимость ограничены.
4. Отделите fallback доступности
При timeout или rate limit система может переключить provider, если модель поддерживает нужные input, tools и schema. Повтор записи требует idempotency. Пользователь должен получить понятный статус, если безопасного маршрута нет. Автоматический fallback на модель с другой политикой или худшим контрактом способен причинить больше вреда, чем явная ошибка.
5. Проверяйте экономику на трафике
Сравните единый сильный маршрут и router на теневом потоке. Измеряйте task success, критические ошибки, долю эскалации, p95, токены и стоимость принятой операции. Следите за drift состава запросов и изменениями моделей. Решение router логируйте с причиной, чтобы можно было восстановить путь без содержимого секретов.
Частые вопросы
Что такое model routing?
Выбор AI-модели для конкретного запроса по правилам или классификатору.
Чем каскад отличается от fallback?
Каскад повышает качество, fallback чаще обрабатывает недоступность.
Можно доверять confidence модели?
Его нужно калибровать и сочетать с внешними проверками.
Сколько моделей использовать?
Минимум, который даёт измеримый выигрыш без лишней сложности.
Как избежать бесконечного переключения?
Ограничить ступени, попытки, время и общий бюджет.