Inferência de IA e Desempenho em GPU
O caminho da NVIDIA para Inferência de IA, pensado também para iniciantes: começa do zero absoluto (o que é um modelo, o que é uma GPU) e evolui aos poucos. Você vai entender o que é inferência, medir latência e throughput corretamente (warmup, torch.cuda.synchronize(), percentis), descobrir se está compute-bound ou memory-bound, e acelerar com batching, mixed precision (FP16/BF16 + Tensor Cores), quantization (INT8/FP8), kernel fusion, CUDA Graphs e TensorRT — até um projeto final de benchmark no estilo Triton.