Inferencia de IA y rendimiento en GPU
La ruta de NVIDIA hacia la inferencia de IA, pensada también para principiantes: empieza desde cero absoluto (qué es un modelo, qué es una GPU) y sube de nivel gradualmente. Vas a entender qué es la inferencia, a medir bien la latencia frente al throughput (warmup, torch.cuda.synchronize(), percentiles), a detectar si estás limitado por cómputo o por memoria, y a acelerar con batching, precisión mixta (FP16/BF16 + Tensor Cores), cuantización (INT8/FP8), fusión de kernels, CUDA Graphs y TensorRT — hasta un proyecto final de benchmark al estilo Triton.