الاستدلال بالذكاء الاصطناعي وأداء الـ GPU
مسار NVIDIA للاستدلال بالذكاء الاصطناعي، وقد صُمِّم ليناسب المبتدئين أيضًا: يبدأ من الصفر المطلق (ما هو النموذج، وما هو الـ GPU) ويتصاعد تدريجيًا. ستفهم الاستدلال (inference)، وتقيس زمن الاستجابة (latency) مقابل معدل الإنتاجية (throughput) بشكل صحيح (warmup، وtorch.cuda.synchronize()، والمئينيات)، وتكتشف ما إذا كنت مقيَّدًا بالحوسبة (compute-bound) أم مقيَّدًا بالذاكرة (memory-bound)، وتُسرِّع الأداء باستخدام المعالجة الدُّفعية (batching)، والدقة المختلطة (FP16/BF16 + Tensor Cores)، والتكميم (INT8/FP8)، ودمج النوى (kernel fusion)، وCUDA Graphs، وTensorRT — وصولًا إلى مشروع ختامي لقياس الأداء (benchmark) بأسلوب Triton.