Порог уверенности
EN · Confidence ThresholdПорог уверенности — значение, ниже которого результат ИИ-шага не принимается автоматически, а передаётся человеку; главный регулятор баланса между автоматизацией и риском.Определение на английскомA cutoff score below which an AI agent stops acting autonomously and instead escalates, asks for clarification, or routes to a Human-in-the-Loop (HITL) Approval Gate. Confidence can come from model log-probabilities, retrieval quality, self-consistency across samples, or a calibrated classifier. The threshold turns oversight from "review everything" into "review the uncertain tail," which is what makes human oversight economical at scale — you auto-approve the high-confidence body and spend human attention only where the agent is genuinely unsure.
Пример
Агент модерации автоматически одобряет посты с уверенностью в безопасности выше 0,9, автоматически удаляет явные нарушения ниже 0,1 и отправляет неоднозначную середину 0,1–0,9 модератору. Настройка двух порогов балансирует нагрузку на модераторов и долю ошибок — главный рычаг всей системы.
Часто задаваемые вопросы
- Как задать правильный порог уверенности?
- Начните консервативно (эскалируйте активно) и по размеченным исходам постройте precision/recall при разных порогах. Установите порог там, где цена пропущенных ошибок равна стоимости добавленной проверки человеком. Действия с серьёзными последствиями требуют более высокого порога (больше эскалаций); низкорисковые и обратимые могут работать при более низком. Перекалибруйте по мере дрейфа модели и данных.
- Можно ли доверять оценкам уверенности модели?
- Не автоматически — сырые вероятности токенов LLM часто плохо откалиброваны (уверенно ошибаются). Рассматривайте уверенность как один сигнал из нескольких (качество извлечения, самосогласованность, согласие отдельной модели-проверщика), а не единственное доверенное число, и проверяйте её на реальных исходах, прежде чем давать ей право блокировать действия.