Leçon 14 : Le projet Benchmark final — tout assembler
Le moment est venu de tout relier. Dans cette leçon, on construit un vrai benchmark façon NVIDIA : on balaie des tailles de batch et des précisions, on mesure correctement (warmup + synchronize), et on rapporte throughput et p99 pour chaque configuration — puis on choisit la configuration qui respec
Un benchmark, c'est comme tester une voiture dans chaque vitesse avant de déclarer « elle est rapide » : on mesure chaque réglage dans les mêmes conditions, on note les chiffres, et on choisit la vitesse adaptée à ta route.
- Benchmark sweep
- Mesurer systématiquement la performance sur plusieurs configurations (batch, précision) dans les mêmes conditions, pour choisir la meilleure.
- Latency budget
- La latence maximale autorisée pour une requête (par exemple p99 < 50ms). On choisit le plus grand batch qui la respecte encore.
- Triton Inference Server
- Le serveur d'inférence de NVIDIA qui fait tourner des modèles de plusieurs frameworks avec dynamic batching, concurrence et des métriques intégrées.