Lección 2: ¿Por qué una GPU? Throughput vs. latencia
Una CPU está construida con pocos núcleos muy potentes que terminan una sola tarea rápido — eso es baja latencia. Una GPU está construida con miles de núcleos simples que realizan la misma operación sobre muchísimos datos a la vez — eso es alto throughput. Para sumar dos vectores de un millón de ele
Una CPU es como unos pocos chefs expertos cocinando un plato complejo rápido. Una GPU es como mil ayudantes de cocina, cada uno cortando un tomate — solo, cada uno es lento, pero juntos cortan mil tomates en el tiempo de uno solo.
- throughput
- La cantidad de trabajo que se completa por unidad de tiempo. Aquí gana la GPU: muchas operaciones idénticas en paralelo.
- latencia
- El tiempo que toma terminar una sola operación. Aquí gana la CPU: un núcleo potente termina una tarea rápido.
- kernel
- Una función que corre en la GPU. Se marca con __global__ y la lanzan miles de hilos a la vez.
- SIMT
- Single Instruction, Multiple Threads (una instrucción, múltiples hilos) — todos los hilos ejecutan la misma instrucción, cada uno sobre datos distintos.