Aula 28: Ocupância: warps ativos por SM
Cada Streaming Multiprocessor (SM) da GPU consegue manter apenas um número limitado de warps ativos ao mesmo tempo. Ocupância é definida como a razão: ocupância = warps ativos / máximo de warps possíveis por SM. Por que isso importa? Quando um warp fica sem trabalho ou espera pela memória, o SM pode
Imagine um garçom atendendo várias mesas ao mesmo tempo. Quando uma mesa ainda não terminou de escolher no cardápio, ele vai até outra mesa em vez de ficar parado esperando. Quanto mais mesas ativas ele tem, menos tempo ele perde esperando. Mas se ele tiver mesas demais, cada mesa recebe menos atenção — então mais mesas nem sempre é melhor.
- ocupância
- A razão entre os warps ativos em um SM e o máximo de warps que o SM suporta. Alta ocupância ajuda a esconder pausas de memória.
- SM
- A unidade de processamento da GPU que executa blocks. Seus recursos (registradores, shared memory) têm uma capacidade limitada compartilhada entre os blocks.
- ocultação de latência
- Quando um warp espera pela memória, o SM troca para outro warp. Mais warps ativos significa mais trabalho disponível para esconder essa espera.
- limite de recurso
- Registradores por thread, shared memory por block e o tamanho do block — cada um pode limitar quantos blocks cabem em um SM.