Инференс ИИ и производительность GPU
Курс NVIDIA по инференсу ИИ, доступный и для новичков: он начинается с абсолютного нуля (что такое модель, что такое GPU) и постепенно набирает темп. Вы разберётесь в инференсе, научитесь корректно измерять задержку против пропускной способности (прогрев, torch.cuda.synchronize(), процентили), определять, ограничены ли вы вычислениями или памятью, и ускорять с помощью батчинга, смешанной точности (FP16/BF16 + Tensor Cores), квантования (INT8/FP8), слияния ядер, CUDA Graphs и TensorRT — вплоть до итогового проекта-бенчмарка в стиле Triton.