Задержка агента
EN · Agent LatencyЗадержка агента — общее время от запроса пользователя до финального ответа или действия агента: инференс модели, выполнение инструментов, поиск и сетевые вызовы. Главный фактор пользовательского опыта в диалоговых агентах.Определение на английскомThe total time from when a user sends a request to when the AI agent delivers its final response or completes its action—encompassing LLM inference time, tool execution time, retrieval latency, and any intermediate processing. Agent latency is a critical UX and adoption metric: users tolerate different latencies depending on context (sub-second for chat, 2-5 seconds for complex queries, minutes for background tasks). Optimizing agent latency involves model selection (smaller models for simple tasks), caching (semantic and exact-match), parallel tool execution, streaming responses, and architecture choices (local vs. cloud inference).
Пример
Задержка агента поддержки складывается так: извлечение из базы знаний (200 мс) + инференс LLM (800 мс) + запрос к CRM (300 мс) + старт стриминга ответа (50 мс) = 1 350 мс до первого токена. Команда сокращает её до 600 мс: извлечение и запрос к CRM параллельно (300 мс), более быстрая модель для простых запросов (400 мс) и семантическое кэширование топ-100 вопросов (попадание в кэш: 50 мс всего).
Часто задаваемые вопросы
- Какая задержка приемлема для ИИ-агентов?
- Зависит от режима взаимодействия. Чат/мессенджеры: до 2 секунд до первого токена (стриминг делает более долгую генерацию приемлемой). Голос: до 600 мс суммарно (больше секунды ощущается неестественно). Фоновые задачи (черновики писем, анализ данных): минуты допустимы, пользователь не ждёт. Копилоты в реальном времени (автодополнение кода, помощь в письме): до 500 мс. Общее правило: соответствуйте ожиданиям по задержке того паттерна взаимодействия, который вы заменяете.