الدرس 14: مشروع Benchmark الختامي — تجميع كل شيء معًا
حان وقت ربط كل شيء معًا. في هذا الدرس نبني benchmark حقيقيًا بأسلوب NVIDIA: نمسح أحجام batch وprecision، ونقيس بشكل صحيح (warmup + synchronize)، ونُبلّغ عن throughput وp99 لكل config — ثم نختار الـconfig الذي يفي بميزانية الـlatency ونخدمه عبر Triton. هذه هي بالضبط العملية التي ينفّذها مهندس perform
الـbenchmark أشبه باختبار سيارة في كل تُرس قبل إعلان أنها 'سريعة': تقيس كل إعداد في نفس الظروف، وتسجّل الأرقام، وتختار التُرس الذي يناسب طريقك.
- Benchmark sweep
- قياس الأداء بشكل منهجي عبر عدة configs (batch وprecision) في نفس الظروف، لاختيار الأفضل.
- Latency budget
- أقصى latency مسموح به لطلب (مثلًا p99 < 50ms). تختار أكبر batch لا يزال يفي به.
- Triton Inference Server
- خادم inference من NVIDIA يشغّل نماذج من عدة frameworks مع dynamic batching وconcurrency ومقاييس مدمجة.