← Все инструкции

РУКОВОДСТВО · ОБНОВЛЕНО 2026-09-15

Маршрутизация AI-моделей: каскад, правила и контроль

Router выбирает маршрут до или после первого ответа, чтобы не платить максимальную цену за каждую задачу и сохранять требуемое качество.

Разделите запросы по проверяемым признакам, назначьте дешёвый основной маршрут и условия эскалации на более сильную модель. Проверяйте каскад целиком: router может ошибиться раньше модели. Ограничьте бюджет и число переходов, а fallback используйте для доступности только при совместимом контракте.

1. Опишите классы запросов

Разделите массовые простые операции, сложные рассуждения, изображения, длинные документы и tools. Для каждого класса задайте обязательные возможности и критерий приёмки. Язык или длина могут быть признаками, но редко достаточны сами. Не отправляйте чувствительный запрос провайдеру, который не соответствует политике данных.

2. Начните с явных правил

Детерминированный router проще отлаживать: тип файла, endpoint, требуемая schema, лимит времени и максимальная цена исключают неподходящие модели. Затем можно добавить классификатор сложности. Его обучают или настраивают на размеченных примерах и оценивают отдельно, особенно ошибки, отправляющие тяжёлую задачу слабому маршруту.

3. Спроектируйте каскад

Компактная модель отвечает первой, а валидатор проверяет формат, обязательные факты или тест. Неудача уходит на сильный маршрут вместе с исходным запросом и кратким сигналом проверки. Самооценка модели полезна как один признак, но плохо заменяет внешний критерий. Число ступеней и общая стоимость ограничены.

4. Отделите fallback доступности

При timeout или rate limit система может переключить provider, если модель поддерживает нужные input, tools и schema. Повтор записи требует idempotency. Пользователь должен получить понятный статус, если безопасного маршрута нет. Автоматический fallback на модель с другой политикой или худшим контрактом способен причинить больше вреда, чем явная ошибка.

5. Проверяйте экономику на трафике

Сравните единый сильный маршрут и router на теневом потоке. Измеряйте task success, критические ошибки, долю эскалации, p95, токены и стоимость принятой операции. Следите за drift состава запросов и изменениями моделей. Решение router логируйте с причиной, чтобы можно было восстановить путь без содержимого секретов.

Частые вопросы

Что такое model routing?

Выбор AI-модели для конкретного запроса по правилам или классификатору.

Чем каскад отличается от fallback?

Каскад повышает качество, fallback чаще обрабатывает недоступность.

Можно доверять confidence модели?

Его нужно калибровать и сочетать с внешними проверками.

Сколько моделей использовать?

Минимум, который даёт измеримый выигрыш без лишней сложности.

Как избежать бесконечного переключения?

Ограничить ступени, попытки, время и общий бюджет.

Источники

Калькулятор стоимости →