Настраивают batching (max_batch_size, timeout) для GPU utilization vs latency SLO; клиентские deadlines согласуют с серверными очередями.
Разбор
- Слишком большой timeout бьёт по p99 latency.
- Разные модели — разные batch threads.
- Warmup снижает cold latency.
- Наблюдают queue size и reject rate.
Итог
Batching — компромисс утилизации GPU и хвостовых задержек.