Обучают в eager → валидируют метрики → экспортируют (TorchScript/ONNX/torch.export) → runtime (libtorch/Triton/TorchServe) → мониторят latency/drift; версионируют веса и препроцессинг.
Разбор
- Препроцессинг должен совпадать с train.
- Batching и warmup на инференсе.
- Canary и shadow traffic.
- Откат к предыдущему артефакту по метрикам.
Итог
Прод = согласованный препроцесс + экспортированный граф + наблюдение.