Gerçek NVIDIA Blackwell donanımı üzerinde model çalıştırma, LLM inference, GPU izleme ve performans analizi
NVIDIA Blackwell tabanlı yapay zekâ altyapılarını yalnızca sunumlar ve teknik dokümanlar üzerinden değil, gerçek cihaz üzerinde çalışan bir model ve ölçülebilir sistem çıktılarıyla inceleyin.
Eğitime Genel Bakış
NVIDIA Blackwell mimarisi; büyük dil modelleri, üretken yapay zekâ uygulamaları, yüksek başarımlı hesaplama ve veri merkezi ölçeğindeki GPU iş yükleri için geliştirilen yeni nesil NVIDIA platformlarının temelini oluşturur.
Bu eğitimde Blackwell mimarisi yalnızca ürün özellikleri ve teorik sunumlar üzerinden ele alınmaz. Absonet tarafından sağlanan NVIDIA Blackwell tabanlı gerçek donanım üzerinde sistem doğrulama, çalışma ortamının hazırlanması, model kurulumu, büyük dil modeli çıkarımı (LLM inference), GPU izleme ve performans analizi çalışmaları gerçekleştirilir.
Katılımcılar, kullanılacak donanımın kapasitesine uygun açık ağırlıklı bir yapay zekâ modelini gerçek cihaz üzerinde çalıştırır. GPU belleği, bağlam uzunluğu, batch boyutu, eşzamanlı istek sayısı ve hesaplama hassasiyeti gibi değişkenlerin gecikme, çıktı hızı ve kaynak tüketimi üzerindeki etkilerini inceler.
Programın amacı yalnızca bir modeli çalıştırmak değildir. Çalışan yapay zekâ altyapısının nasıl doğrulanacağını, performansın hangi metriklerle ölçüleceğini ve gözlenen darboğazların nasıl yorumlanacağını uygulamalı olarak göstermektir.
Bu program, Absonet’in kurumsal yapay zekâ eğitimleri içerisinde, donanım ve altyapı odağıyla konumlandırılmış uygulamalı bir eğitimdir. Model geliştirme ve dil modeli mimarileri üzerine daha geniş bir program arayan kurumlar, Kurumsal Large Language Models Eğitimini de inceleyebilir.
Gerçek NVIDIA Blackwell Donanımı Üzerinde Uygulama
Eğitim laboratuvarında kullanılacak NVIDIA Blackwell tabanlı sistem Absonet tarafından sağlanır. Teorik olarak ele alınan konular, aynı eğitim içerisinde gerçek donanım üzerinde uygulanır ve elde edilen sonuçlar katılımcılarla birlikte değerlendirilir.
Laboratuvar çalışmaları kapsamında:
- Blackwell donanım ve sistem bileşenleri doğrulanır.
- GPU modeli, bellek kapasitesi ve bağlantı topolojisi incelenir.
- NVIDIA sürücü, CUDA ve container bileşenleri kontrol edilir.
- Donanımla uyumlu bir büyük dil modeli cihaz üzerinde çalıştırılır.
- API veya komut satırı üzerinden canlı inference istekleri gönderilir.
- GPU kullanımı, bellek tüketimi, sıcaklık ve güç değerleri izlenir.
- İlk token süresi, token üretim hızı ve toplam sistem throughput değeri ölçülür.
- Farklı çalışma yapılandırmalarından alınan sonuçlar karşılaştırılır.
- Yaygın kurulum, kapasite, bellek ve yazılım uyumluluğu sorunları incelenir.
Donanım bilgisi: Eğitimde kullanılacak cihaz modeli, GPU sayısı, toplam GPU belleği, çalışma ortamı ve uygulamada kullanılacak model eğitim teklifinde ayrıca belirtilir.
Kurum Verisiyle Yerel ve Kontrollü Yapay Zekâ Uygulaması
Kurumsal yapay zekâ projelerinde yalnızca modelin performansı değil, kullanılan verinin nerede işlendiği ve kimlerin erişimine açık olduğu da önemlidir.
Bu eğitimde kullanılacak kompakt NVIDIA Grace Blackwell tabanlı sistemler Absonet tarafından eğitim ortamına getirilir. Katılımcılar, uygun güvenlik ve yetkilendirme kontrolleri altında, kurumlarının belirlediği örnek veri kümelerini harici bir bulut hizmetine yüklemeden yerel donanım üzerinde kullanabilir.
Böylece eğitim, genel amaçlı örnek verilerle sınırlı kalmaz. Kurumun gerçek kullanım senaryosuna daha yakın bir veri seti üzerinde model çalıştırma, inference, kaynak izleme ve performans analizi gerçekleştirilebilir.
Yerel Çalışmanın Sağladığı Avantajlar
- Verilerin eğitim süresince kurumun belirlediği kontrol alanında tutulabilmesi,
- Örnek verilerin üçüncü taraf yapay zekâ veya bulut servislerine gönderilmemesi,
- Kurumun kendi veri yapısına ve kullanım senaryosuna yakın uygulamalar gerçekleştirilebilmesi,
- Model davranışının gerçekçi veri hacmi ve sorgu yapılarıyla değerlendirilebilmesi,
- Gecikme, GPU belleği, throughput ve kaynak tüketiminin kurum senaryosu üzerinden ölçülebilmesi,
- Yapay zekâ altyapısı yatırımı öncesinde yerel çalışma yaklaşımının teknik olarak test edilebilmesi.
Bu yaklaşım sayesinde katılımcılar, yapay zekâ altyapısını yalnızca hazırlanmış laboratuvar senaryoları üzerinden değil, kurumlarının gerçek ihtiyaçlarına daha yakın ve kontrollü bir çalışma ortamında değerlendirme imkânı elde eder.
Eğitimin Amacı
Eğitim sonunda katılımcıların aşağıdaki yetkinlikleri kazanması hedeflenmektedir:
- NVIDIA Blackwell mimarisinin temel bileşenlerini açıklayabilmek,
- Blackwell GPU, Grace Blackwell Superchip ve farklı sistem platformları arasındaki ayrımı yapabilmek,
- Yapay zekâ iş yüklerinin GPU, bellek ve veri aktarımı gereksinimlerini değerlendirebilmek,
- NVIDIA sürücü, CUDA ve container bileşenlerinin uyumluluğunu kontrol edebilmek,
- Blackwell tabanlı bir sistemin donanım ve yazılım sağlığını doğrulayabilmek,
- Gerçek donanım üzerinde bir LLM inference ortamı hazırlayabilmek,
- BF16, FP8 ve donanım tarafından desteklenen düşük hassasiyet seçeneklerinin kullanım alanlarını değerlendirebilmek,
- Model belleği, KV cache, bağlam uzunluğu, batch boyutu ve eşzamanlılık ilişkisini yorumlayabilmek,
- Time to First Token, token throughput ve GPU kullanımı gibi temel performans metriklerini ölçebilmek,
- Performans darboğazlarının olası kaynaklarını belirleyebilmek,
- Üretim ortamları için temel GPU kapasite ve kaynak planlaması yapabilmek.
Kimler Katılmalı?
Bu eğitim aşağıdaki görevlerde çalışan teknik ekipler için hazırlanmıştır:
- Yapay zekâ altyapı mühendisleri,
- AI platform ve sistem mühendisleri,
- MLOps ve DevOps mühendisleri,
- Makine öğrenimi mühendisleri,
- Sistem ve veri merkezi yöneticileri,
- HPC mühendisleri ve araştırmacılar,
- GPU altyapısı tasarlayan sistem mimarları,
- Kurum içi üretken yapay zekâ platformlarından sorumlu teknik ekipler,
- NVIDIA GPU yatırımı planlayan teknik karar vericiler.
Eğitim İçeriği
Modül 1 — NVIDIA Blackwell Mimarisi ve Yapay Zekâ Platformları
- Hopper’dan Blackwell’e mimari geçiş,
- Blackwell mimarisinin hedeflediği yapay zekâ ve HPC iş yükleri,
- Blackwell GPU ürün ailesi,
- Grace Blackwell Superchip mimarisi,
- İş istasyonu, sunucu ve rack-scale platformlar arasındaki farklar,
- Tensor Core ve ikinci nesil Transformer Engine yaklaşımı,
- GPU belleği, bellek bant genişliği ve model kapasitesi ilişkisi,
- Scale-up ve scale-out yaklaşımları,
- NVLink, NVLink-C2C ve NVLink Switch kullanım alanları,
- Güç, soğutma ve veri merkezi gereksinimleri.
Modül 2 — Blackwell Sistem Kurulumu ve Donanım Doğrulama
- Linux üzerinde NVIDIA GPU bileşenleri,
- NVIDIA sürücü ve CUDA çalışma ortamı,
- Driver, CUDA runtime ve container uyumluluğu,
- NVIDIA Container Toolkit ve NGC container yapısı,
- GPU, bellek ve bağlantı topolojisinin görüntülenmesi,
nvidia-smiile temel sistem kontrolleri,- GPU sağlık ve hata kayıtlarının incelenmesi,
- NVIDIA DCGM ile sağlık, tanılama ve telemetri,
- Çoklu GPU sistemlerde bağlantı ve topoloji kontrolü.
Uygulama
- Eğitim cihazının sistem envanterinin çıkarılması,
- GPU, sürücü ve CUDA sürümlerinin doğrulanması,
- Container çalışma ortamının kontrol edilmesi,
- GPU belleği, sıcaklık, güç ve kullanım değerlerinin izlenmesi,
- Temel sağlık ve tanılama kontrollerinin gerçekleştirilmesi.
Modül 3 — Yapay Zekâ Modellerinde Hesaplama Hassasiyeti
- Transformer modellerinde hesaplama ve bellek gereksinimleri,
- FP32, FP16 ve BF16 kullanım alanları,
- FP8 hesaplama yaklaşımı,
- Blackwell üzerinde desteklenen düşük hassasiyet seçenekleri,
- Quantization kavramı,
- Ağırlık ve aktivasyon hassasiyeti,
- Ölçekleme faktörleri ve micro-scaling yaklaşımı,
- Hassasiyet seçiminin GPU bellek tüketimine etkisi,
- Hassasiyet seçiminin gecikme, throughput ve model çıktısına etkisi,
- Model, runtime ve kernel uyumluluğu.
Uygulama
- Desteklenen model üzerinde farklı çalışma seçeneklerinin incelenmesi,
- GPU bellek tüketiminin ölçülmesi,
- Gecikme ve throughput sonuçlarının karşılaştırılması,
- Model çıktılarının örnek veri üzerinden değerlendirilmesi.
Modül 4 — Gerçek Blackwell Donanımı Üzerinde LLM Çalıştırma
- Eğitimde kullanılacak modelin donanım kapasitesine göre seçilmesi,
- Açık ağırlıklı yapay zekâ modelleri,
- Model ağırlıkları, tokenizer ve yapılandırma dosyaları,
- Container tabanlı inference ortamının hazırlanması,
- NVIDIA TensorRT-LLM, NVIDIA NIM ve uyumlu model sunum ortamları,
- Model yükleme ve ilk inference işlemi,
- GPU bellek ihtiyacının değerlendirilmesi,
- Bağlam uzunluğu ve KV cache yönetimi,
- Batch boyutu ve eşzamanlı istek ayarları,
- Tek GPU ve desteklenen sistemlerde çoklu GPU çalışma yöntemleri,
- Tensor parallelism ve pipeline parallelism kavramları.
Uygulama
- Bir LLM’nin gerçek Blackwell donanımı üzerinde başlatılması,
- API veya komut satırı üzerinden inference isteği gönderilmesi,
- Model başlangıç süresinin ölçülmesi,
- GPU bellek kullanımının izlenmesi,
- Farklı bağlam uzunluğu ve batch ayarlarının test edilmesi,
- GPU belleği yetersizliği senaryolarının incelenmesi,
- Model ve çalışma ortamı uyumluluk sorunlarının giderilmesi.
Modül 5 — LLM Inference ve Performans Analizi
- Time to First Token,
- Inter-token latency,
- Token/saniye,
- Toplam sistem throughput değeri,
- Eşzamanlı kullanıcı ve istek kapasitesi,
- GPU kullanım oranı ve GPU bellek tüketimi,
- Batch boyutu ile gecikme arasındaki ilişki,
- Uzun bağlam kullanımının KV cache üzerindeki etkisi,
- Warm-up işlemleri ve tekrarlanabilir test koşulları,
- Sentetik benchmark ile gerçek kullanım senaryosu arasındaki fark,
- Performans sonuçlarının kayıt altına alınması ve karşılaştırılması.
Uygulama
Katılımcılar gerçek Blackwell cihazı üzerinde kontrollü bir inference testi gerçekleştirir. Farklı istek yükleri altında ilk token süresi, token üretim hızı, toplam throughput, GPU bellek kullanımı, GPU kullanım oranı, sıcaklık ve güç tüketimi ölçülür.
Elde edilen sonuçlar, yapay zekâ altyapısının kapasitesi ve gözlenen performans darboğazları açısından değerlendirilir.
Modül 6 — GPU İzleme ve Sorun Giderme
nvidia-smikullanım senaryoları,- NVIDIA Data Center GPU Manager (DCGM) ve NVML,
- GPU metriklerinin sürekli izlenmesi,
- Güç, sıcaklık ve clock davranışının yorumlanması,
- GPU belleği yetersizliği sorunları,
- CUDA ve sürücü uyumsuzlukları,
- Container çalışma ortamı sorunları,
- Model yükleme hataları,
- Kernel ve hesaplama hassasiyeti uyumluluğu,
- Düşük GPU kullanımının olası nedenleri,
- Çoklu GPU sistemlerde topoloji sorunları,
- DCGM Exporter ve Prometheus ile izleme yaklaşımı,
- Üretim ortamları için alarm ve kapasite yaklaşımı,
- Yapay zekâ modellerinde veri ve model güvenliği,
- Confidential computing kavramları.
Uygulamalı Final Çalışması
Eğitimin sonunda katılımcılar:
- Blackwell tabanlı sistemi doğrular.
- NVIDIA yazılım ve container ortamını kontrol eder.
- Uyumlu bir yapay zekâ modelini sisteme yükler.
- Modeli gerçek donanım üzerinde çalıştırır.
- Kontrollü bir inference yükü oluşturur.
- Gecikme, throughput ve GPU telemetrisini toplar.
- En az iki farklı çalışma yapılandırmasını karşılaştırır.
- Gözlenen darboğazları ve iyileştirme seçeneklerini raporlar.
Final çalışmasının amacı yalnızca modelin çalıştırılması değil, elde edilen sistem çıktılarının ölçülmesi, yorumlanması ve teknik olarak raporlanmasıdır.
Ön Gereksinimler
- Linux komut satırı kullanım deneyimi,
- Temel container bilgisi,
- GPU ve CUDA kavramlarına temel düzeyde aşinalık,
- Yapay zekâ ve büyük dil modelleri hakkında temel bilgi,
- Transformer mimarisine genel düzeyde aşinalık.
Python bilgisi faydalıdır ancak zorunlu değildir.
Eğitim Süresi
2 gün / 14 saat
Standart iki günlük programın odağı:
- NVIDIA Blackwell mimarisi,
- Yapay zekâ altyapısı bileşenleri,
- Sistem ve donanım doğrulama,
- Gerçek donanım üzerinde LLM inference,
- Performans ölçümü,
- GPU izleme,
- Temel sorun giderme.
Kubernetes üzerinde GPU işletimi, ileri seviye çoklu GPU optimizasyonu, model fine-tuning veya kuruma özel kapsamlı laboratuvarların eklenmesi durumunda eğitim süresi ve içeriği ayrıca planlanabilir.
Eğitim Formatı
- Eğitmen eşliğinde sınıf içi eğitim,
- Absonet tarafından sağlanan gerçek NVIDIA Blackwell donanımı,
- Canlı LLM inference laboratuvarı,
- Uygulamalı performans ölçümü,
- GPU sağlık ve kaynak izleme çalışmaları,
- Kuruma özel kullanım senaryolarına göre uyarlanabilir içerik,
- Örnek komutlar ve laboratuvar dokümanları,
- Eğitim sonunda teknik değerlendirme.
Kurumlara Sağlayacağı Faydalar
- NVIDIA Blackwell yatırımını teknik açıdan değerlendirebilme,
- Yapay zekâ modelleri için uygun donanım kapasitesini planlayabilme,
- Model, GPU belleği ve çalışma ortamı ilişkisini anlayabilme,
- Performansı teorik değerler yerine gerçek iş yükü üzerinden ölçebilme,
- Yapay zekâ altyapısındaki darboğazları belirleyebilme,
- GPU kurulum ve işletim süreçlerinde kurum içi yetkinlik oluşturabilme,
- LLM altyapısı için daha gerçekçi kapasite ve maliyet planlaması yapabilme,
- Üretim ortamlarında GPU izleme ve sorun giderme becerisi kazanabilme.
Sık Sorulan Sorular
Eğitimde gerçek NVIDIA Blackwell cihazı kullanılacak mı?
Evet. Eğitimde kullanılacak NVIDIA Blackwell tabanlı sistem Absonet tarafından sağlanacaktır. Cihaz modeli, GPU sayısı, toplam bellek kapasitesi ve laboratuvar ortamı eğitim teklifinde açıkça belirtilecektir.
Eğitim sırasında gerçek bir yapay zekâ modeli çalıştırılacak mı?
Evet. Donanım kapasitesi ve eğitim hedefleriyle uyumlu açık ağırlıklı bir büyük dil modeli gerçek cihaz üzerinde çalıştırılacak; modelin kaynak tüketimi ve inference performansı canlı olarak ölçülecektir.
Eğitim yalnızca veri merkezi yöneticilerine mi yöneliktir?
Hayır. Program; sistem mühendisleri, AI altyapı ekipleri, MLOps ve DevOps mühendisleri, makine öğrenimi mühendisleri ve GPU yatırımı planlayan teknik karar vericiler için uygundur.
Eğitim içeriği kuruma göre uyarlanabilir mi?
Evet. Kullanılacak cihaz, model, inference ortamı, izleme araçları ve laboratuvar senaryoları kurumun teknik hedeflerine göre yeniden planlanabilir.
Kuruma Özel Eğitim ve Teklif
Eğitim içeriği; kullanılacak Blackwell platformuna, katılımcıların teknik seviyesine ve kurumun hedeflediği yapay zekâ iş yüklerine göre uyarlanabilir.
Eğitim takvimi, kullanılacak donanım ve kuruma özel laboratuvar kapsamı hakkında bilgi almak için bizimle iletişime geçebilirsiniz.

