Урок 14: Итоговый проект-бенчмарк — собираем всё вместе
Пора связать всё воедино. В этом уроке мы построим настоящий бенчмарк в стиле NVIDIA: переберём размеры батча и точность, измерим правильно (прогрев + synchronize) и сообщим пропускную способность и p99 для каждой конфигурации — затем выберем конфигурацию, которая укладывается в бюджет задержки, и о
Бенчмарк — как тестирование автомобиля на каждой передаче перед тем, как объявить «он быстрый»: вы измеряете каждую настройку в одинаковых условиях, записываете числа и выбираете передачу, подходящую для вашей дороги.
- Перебор в бенчмарке
- Систематическое измерение производительности по нескольким конфигурациям (батч, точность) в одинаковых условиях, чтобы выбрать лучшую.
- Бюджет задержки
- Максимальная задержка, которую может занять запрос (например, p99 < 50 мс). Вы выбираете самый большой батч, который всё ещё в неё укладывается.
- Triton Inference Server
- Сервер инференса от NVIDIA, который запускает модели из многих фреймворков с динамическим батчингом, параллелизмом и встроенными метриками.