Каскад моделей
EN · Model CascadeКаскад моделей — маршрутизация запроса сначала к дешёвой модели и только при низкой уверенности — к более сильной; снижает затраты.Определение на английскомA cost-optimization pattern where a cheaper, faster model handles the first attempt at a task, and a more capable (but slower and more expensive) model is invoked only when the first model fails a confidence threshold or quality check. Cascades typically cut total cost 60-90% on workloads dominated by easy cases (a large fraction of support tickets, document classification, simple coding tasks), because most queries never reach the expensive model.
Пример
ИИ-агент клиентского сервиса встречает каждый запрос малой моделью (Haiku, GPT-5-mini), которая закрывает 70% запросов напрямую. Для 30%, где малая модель не уверена — по уверенности вывода, оценкам извлечения или самопроверке, — запрос эскалируется во фронтирную модель (Claude Opus 4, GPT-5). Средняя стоимость тикета падает с $0,18 до $0,06 без измеримой потери качества на случаях, обработанных каскадом.
Часто задаваемые вопросы
- Когда каскад моделей НЕ окупается?
- Когда распределение задач — в основном сложные случаи (дешёвая модель проваливается на 60%+ входов), когда бюджет задержки жёсткий (каскад добавляет второй вызов модели при эскалации) или когда дешёвая модель выдаёт *правдоподобно неверные* ответы, которые система не может легко распознать. Каскад выигрывает, только когда доминируют простые случаи И сбои дешёвой модели надёжно ловятся.
- Как решить, когда эскалировать?
- Типовые сигналы: низкие оценки извлечения, собственная оценка уверенности дешёвой модели, расхождение выводов двух проходов дешёвой модели или быстрая проверка LLM-судьёй. Настройка порога эмпирична — начните с консервативного (частые эскалации), измерьте качество и стоимость, затем ужесточайте до достижения целевого баланса.