Урок 10: Динамический батчинг и обслуживание — группировка запросов в реальном времени
В продакшене запросы не приходят аккуратным батчем — они поступают по одному от разных пользователей. Запустите каждый отдельно, и пропускная способность рухнет. Решение в серверах инференса вроде Triton: динамический батчинг — подождать крохотное окно, накопить поступившие запросы и выполнить их вм
Лифт, который уезжает мгновенно с одним пассажиром, тратит поездки впустую. Динамический батчинг — это ожидание нескольких секунд, пока войдёт больше людей — не слишком долго, чтобы никто не раздражался — а затем поездка с полным лифтом.
- Динамический батчинг
- Сервер группирует отдельные запросы, поступающие в течение короткого окна, в один батч, до предела по размеру или времени.
- Максимальная задержка очереди
- Как долго сервер готов ждать, чтобы накопить батч перед запуском. Настраивает баланс задержки/пропускной способности.
- Экземпляры модели
- Несколько копий модели, работающих параллельно на одном GPU, чтобы обслуживать запросы одновременно.