Sementara Rubin sangat dinantikan, Nvidia terus mengoptimalkan Blackwell, efisiensi energi GB200 meningkat 4 kali lipat dalam tiga bulan
Nvidia terus mengoptimalkan stack perangkat lunak untuk memperpanjang siklus hidup platform Blackwell, sambil mempersiapkan peluncuran berskala besar arsitektur Rubin generasi berikutnya.
Dalam konteks percepatan penerapan platform Rubin generasi baru, Nvidia mengungkapkan bahwa hanya dalam tiga bulan, Nvidia berhasil meningkatkan throughput daya pemrosesan per megawatt (TPS/MW) GB200 NVL72 hingga 4 kali lipat saat menjalankan model DeepSeek R1 0528. Capaian ini berasal dari 38 optimasi besar yang selesai dalam empat bulan, didukung lebih dari 250 ribu pengujian konfigurasi simulasi dan total 1,4 juta jam GPU untuk verifikasi optimasi.
Di saat yang sama, platform GB300 "Blackwell Ultra" terus memecahkan rekor pada pengujian pelatihan AI. Pada skala 256 kartu, GB300 NVL72 mencapai rekor tertinggi 1648 TFLOPs per GPU dalam tugas pre-training DeepSeek-V3 671B, meningkat sekitar 3 kali dari GB200 yang mencatat 606 TFLOPs, dan angka ini telah meningkat 1,5 kali dalam enam bulan terakhir.
Efisiensi energi GB200 melonjak, optimasi mencakup lebih dari 90% model
Nvidia menyatakan, serangkaian optimasi pada platform GB200 NVL72 memungkinkan peningkatan throughput daya pemrosesan per megawatt hingga 4 kali lipat dalam tiga bulan saat menjalankan DeepSeek R1 0528 (konfigurasi input 1K/output 1K).

Peningkatan ini didukung oleh 38 iterasi optimasi besar yang diselesaikan dalam empat bulan, setelah lebih dari 250 ribu simulasi konfigurasi dan total 1,4 juta jam GPU untuk pengujian dan verifikasi. Nvidia menegaskan bahwa lebih dari 90% hasil optimasi tersebut dapat diaplikasikan untuk model lain dalam portofolio produk AI mereka, bukan hanya dirancang untuk satu tugas tertentu.
Artinya, pelanggan pusat data yang ada dapat memperoleh manfaat efisiensi energi hanya dengan pembaruan perangkat lunak, tanpa perlu mengganti perangkat keras—ini sangat bernilai secara ekonomi bagi perusahaan cloud berskala besar dan pelanggan enterprise yang sensitif terhadap biaya daya komputasi.
GB300 pecahkan rekor pelatihan, performa naik 1,5 kali dalam enam bulan
Di sisi pelatihan AI, GB300 NVL72 juga menunjukkan kinerja yang sangat kuat. Pada skala 256 kartu, dengan kerangka Megatron Core untuk pre-training model DeepSeek-V3 671B, GB300 NVL72 mencatat throughput 1648 TFLOPs per GPU, naik sekitar 3 kali dari GB200 sebelumnya yang mencatat 606 TFLOPs dan mencetak rekor tertinggi untuk tugas tersebut secara global.

Perlu dicatat, angka ini bukanlah batas perangkat keras statis. Performa GB300 NVL72 dalam kerangka Megatron Core telah meningkat dari 1088 TFLOPs/GPU pada November 2025 menjadi 1648 TFLOPs/GPU pada Juni 2026, total peningkatan sekitar 1,5 kali dalam enam bulan.

Pada optimasi kolaboratif dengan kerangka utama AI, kerja sama mendalam Nvidia dengan komunitas PyTorch dan JAX juga menghasilkan peningkatan signifikan. Pada TorchTitan (stack pelatihan asli PyTorch), performa pelatihan GB300 NVL72 untuk DeepSeek-V3 671B meningkat 6 kali dibandingkan konfigurasi baseline yang belum dioptimasi, naik dari 199 TFLOPs/GPU menjadi 1197 TFLOPs/GPU. Di bawah kerangka JAX, peningkatan lebih mencolok: hingga Juli 2026, throughput per GPU mencapai 4082 Tokens/s, setara dengan 1025 TFLOPs/GPU, meningkat sekitar 10 kali dibandingkan 418 Tokens/s pada Januari 2026.

Efisiensi ekspansi mendekati batas teoritis, jaringan 800 Gb/s jadi kunci
Pada skenario pelatihan berskala besar, efisiensi ekspansi selalu menjadi indikator utama utilitas infrastruktur AI. Nvidia mengungkapkan, dalam rentang ekspansi 256 hingga 1024 kartu, GB300 NVL72 mempertahankan efisiensi ekspansi mendekati batas teoritis di ketiga kerangka utama: Megatron Core mencapai 98,5%, TorchTitan dan JAX sama-sama mencapai 97%.
Nvidia mengaitkan performa ekspansi ini dengan chip jaringan Scale-Out 800 Gb/s yang tertanam di rak NVL72. Interkoneksi berkecepatan tinggi secara langsung memengaruhi biaya komunikasi dalam pelatihan multi-mesin, sehingga menjadi komponen infrastruktur inti yang mendukung efisiensi tinggi lintas kerangka seperti di atas.

Platform Rubin dipercepat, optimasi Blackwell terus berlanjut
Di saat pengumuman kemajuan optimasi di atas, platform Vera Rubin generasi berikutnya dari Nvidia telah memasuki tahap penerapan global. Menurut laporan, Vera Rubin NVL72 meningkatkan throughput token sekitar 10 kali dibanding Blackwell, dengan GB200 NVL72 sekitar 80.000 Tokens/s, sedangkan Vera Rubin NVL72 dapat mencapai 800.000 Tokens/s pada konsumsi daya yang sama yaitu 150MW.
Meski demikian, platform Blackwell sudah diterapkan di ribuan pusat data di seluruh dunia, dan strategi Nvidia mirip dengan era Hopper sebelumnya—sambil mendorong platform baru, Nvidia terus mengoptimalkan potensi perangkat keras yang telah diterapkan melalui perangkat lunak. Pendekatan ini tidak hanya memperpanjang siklus pengembalian investasi perangkat keras bagi pelanggan yang ada, tetapi juga memperkuat efek ketergantungan platform Nvidia dalam ekosistem infrastruktur AI. Di pasar, dengan kemajuan paralel Blackwell dan Rubin, Nvidia sedang membangun benteng perangkat lunak yang sulit disamai kompetitor dalam waktu dekat.
Disclaimer: Konten pada artikel ini hanya merefleksikan opini penulis dan tidak mewakili platform ini dengan kapasitas apa pun. Artikel ini tidak dimaksudkan sebagai referensi untuk membuat keputusan investasi.
Kamu mungkin juga menyukai
Indeks saham AS tampak tenang, namun arus bawah bergerak: Mitra Goldman Sachs mengungkap empat faktor pendorong pasar utama
Mitra Goldman Sachs, Bobby Molavi, menyatakan bahwa ketidakpastian regulasi AI, harga minyak yang menembus 100 dolar AS, imbal hasil obligasi pemerintah AS yang melebihi 5%, dan perbedaan pendapat dalam kebijakan The Fed secara bersamaan meningkat, mendorong risiko inflasi dan suku bunga lebih tinggi. Hal ini menyebabkan sektor AI dan perdagangan momentum yang sebelumnya unggul menjadi tertekan, sementara aliran dana beralih ke sektor perangkat lunak, defensif, dan energi, mempercepat penilaian ulang di pasar.
