Квантизация, distillation, shorter context, batching, caching эмбеддингов/retrieval, speculative decoding для генерации, GPU/CPU выбор, ограничение max tokens.
Разбор
- Измерять p95 не только mean.
- Качество после compression на eval set.
- Холодный старт моделей.
- Асинхронный prefetch retrieval.
Итог
Latency режут сжатием модели и укорочением реального контекста/генерации.