Inférence IA et performance GPU
Le parcours d'Inférence IA de NVIDIA, pensé aussi pour les débutants : tu pars de zéro absolu (qu'est-ce qu'un modèle, qu'est-ce qu'un GPU) et tu montes en puissance progressivement. Tu comprendras ce qu'est l'inférence, tu mesureras correctement la latence et le débit (warmup, torch.cuda.synchronize(), percentiles), tu identifieras si tu es compute-bound ou memory-bound, et tu accéléreras avec le batching, la précision mixte (FP16/BF16 + Tensor Cores), la quantification (INT8/FP8), la fusion de kernels, les CUDA Graphs et TensorRT — jusqu'à un projet de synthèse de benchmark façon Triton.