Bitget App
Giao dịch thông minh hơn
Mua CryptoThị trườngGiao dịchFutures‌EarnAIQuảng trườngThêm
Khi Rubin được mong đợi, Nvidia tiếp tục tối ưu hóa Blackwell, hiệu suất năng lượng của GB200 tăng gấp 4 lần trong ba tháng

Khi Rubin được mong đợi, Nvidia tiếp tục tối ưu hóa Blackwell, hiệu suất năng lượng của GB200 tăng gấp 4 lần trong ba tháng

华尔街见闻华尔街见闻2026/07/22 08:27
Hiển thị bản gốc
Theo:华尔街见闻

Nvidia đang kéo dài vòng đời của nền tảng Blackwell thông qua việc tối ưu hóa liên tục ngăn xếp phần mềm, đồng thời chuẩn bị cho việc triển khai quy mô lớn kiến trúc Rubin thế hệ tiếp theo.

Trong bối cảnh triển khai nhanh chóng nền tảng Rubin thế hệ mới, Nvidia tiết lộ rằng chỉ trong ba tháng, TPS/MW (hiệu suất thông lượng tính toán trên mỗi megawatt) của GB200 NVL72 khi chạy mô hình DeepSeek R1 0528 đã tăng gấp 4 lần. Thành tựu này có được nhờ Nvidia thực hiện 38 tối ưu hóa lớn trong bốn tháng, dựa trên hơn 250.000 lần kiểm thử cấu hình mô phỏng cùng tổng cộng 1,4 triệu giờ kiểm chứng tối ưu hóa với GPU.

Đồng thời, nền tảng GB300 "Blackwell Ultra" liên tục phá vỡ các kỷ lục mới trong bài kiểm tra chuẩn huấn luyện AI. Ở quy mô 256 card, GB300 NVL72 thiết lập kỷ lục thế giới khi đạt 1648 TFLOPs/GPU trong nhiệm vụ huấn luyện trước DeepSeek-V3 671B, tăng khoảng 3 lần so với 606 TFLOPs của GB200, và chỉ số này đã tăng tổng cộng 1,5 lần trong 6 tháng qua.

Hiệu suất năng lượng GB200 tăng vọt, tối ưu hóa áp dụng cho hơn 90% mô hình

Nvidia cho biết, chuỗi tối ưu hóa cho nền tảng GB200 NVL72 đã giúp TPS/MW của hệ thống chạy DeepSeek R1 0528 (cấu hình 1K đầu vào/1K đầu ra) tăng 4 lần chỉ trong vòng ba tháng.

Khi Rubin được mong đợi, Nvidia tiếp tục tối ưu hóa Blackwell, hiệu suất năng lượng của GB200 tăng gấp 4 lần trong ba tháng image 0

Nền tảng của sự tăng trưởng này là 38 vòng lặp tối ưu hóa lớn mà Nvidia thực hiện trong bốn tháng, được kiểm thử qua hơn 250.000 cấu hình mô phỏng và tổng cộng 1,4 triệu giờ thử nghiệm trên GPU. Nvidia nhấn mạnh hơn 90% kết quả tối ưu hóa này có thể tái sử dụng trên nhiều mô hình khác nhau trong danh mục AI của họ, thay vì chỉ thiết kế riêng cho một nhiệm vụ duy nhất.

Điều này đồng nghĩa với việc khách hàng trung tâm dữ liệu hiện tại có thể nhận giá trị gia tăng rõ rệt về hiệu suất năng lượng chỉ qua cập nhật phần mềm mà không cần thay phần cứng — với các doanh nghiệp và nhà cung cấp dịch vụ đám mây quy mô lớn cực kỳ nhạy cảm về chi phí tính toán, đây là giá trị kinh tế trực tiếp.

GB300 tiếp tục lập kỷ lục huấn luyện, hiệu suất tăng 1,5 lần trong 6 tháng

Ở phía huấn luyện AI, GB300 NVL72 cũng cho thấy sức mạnh vượt trội. Ở quy mô 256 card, sử dụng framework Megatron Core để huấn luyện trước mô hình DeepSeek-V3 671B, GB300 NVL72 đạt thông lượng 1648 TFLOPs/GPU — cao hơn khoảng 3 lần so với 606 TFLOPs của GB200 trước đó, lập kỷ lục thế giới mới cho nhiệm vụ này.

Khi Rubin được mong đợi, Nvidia tiếp tục tối ưu hóa Blackwell, hiệu suất năng lượng của GB200 tăng gấp 4 lần trong ba tháng image 1

Điều đáng chú ý là con số này không phải giới hạn tối đa của phần cứng. Hiệu suất của GB300 NVL72 trên framework Megatron Core đã tăng từ 1088 TFLOPs/GPU vào tháng 11/2025 lên 1648 TFLOPs/GPU vào tháng 6/2026 — tăng tổng cộng 1,5 lần trong 6 tháng.

Khi Rubin được mong đợi, Nvidia tiếp tục tối ưu hóa Blackwell, hiệu suất năng lượng của GB200 tăng gấp 4 lần trong ba tháng image 2

Ở góc độ phối hợp tối ưu framework AI chính, sự hợp tác sâu giữa Nvidia với cộng đồng PyTorch và JAX cũng mang lại lợi ích rõ rệt. Trên TorchTitan (ngăn xếp huấn luyện bản địa PyTorch), hiệu năng huấn luyện DeepSeek-V3 671B của GB300 NVL72 tăng 6 lần so với cấu hình gốc chưa tối ưu, từ 199 TFLOPs/GPU lên 1197 TFLOPs/GPU. Trên JAX, mức tăng còn mạnh hơn — đến tháng 7/2026, thông lượng mỗi GPU đạt 4082 Tokens/s (tương ứng 1025 TFLOPs/GPU), tăng khoảng 10 lần so với 418 Tokens/s vào tháng 1/2026.

Khi Rubin được mong đợi, Nvidia tiếp tục tối ưu hóa Blackwell, hiệu suất năng lượng của GB200 tăng gấp 4 lần trong ba tháng image 3

Hiệu quả mở rộng gần với giới hạn lý thuyết, mạng 800 Gb/s là chìa khóa

Ở môi trường huấn luyện quy mô lớn, hiệu quả mở rộng luôn là chỉ số then chốt đánh giá tính thực tiễn của hạ tầng AI. Nvidia tiết lộ, trong dải mở rộng từ 256 đến 1024 card, GB300 NVL72 đều duy trì hiệu suất gần mức lý thuyết tối đa ở cả ba framework chính: Megatron Core đạt 98,5%, TorchTitan và JAX đều đạt 97%.

Nvidia cho rằng, thành tích tuyệt vời này nhờ vào chip mạng Scale-Out tích hợp trong rack NVL72 với tốc độ 800 Gb/s. Kết nối tốc độ cao trực tiếp quyết định chi phí truyền thông trong huấn luyện đa máy, góp phần đảm bảo hiệu suất mở rộng tổng thể và được xem là thành phần hạ tầng cốt lõi giúp duy trì hiệu quả đa framework như trên.

Khi Rubin được mong đợi, Nvidia tiếp tục tối ưu hóa Blackwell, hiệu suất năng lượng của GB200 tăng gấp 4 lần trong ba tháng image 4

Nền tảng Rubin tăng tốc triển khai, tối ưu Blackwell vẫn tiếp tục

Khi những cải tiến vừa được công bố, nền tảng Vera Rubin NVL72 thế hệ tiếp theo của Nvidia cũng bắt đầu triển khai trên toàn cầu. Theo báo cáo, hiệu suất thông lượng Token của Vera Rubin NVL72 cao gấp khoảng 10 lần so với Blackwell — GB200 NVL72 đạt khoảng 80.000 Tokens/s, trong khi Vera Rubin NVL72 có thể đạt 800.000 Tokens/s ở cùng mức công suất 150MW.

Tuy nhiên, nền tảng Blackwell đã được triển khai rộng khắp trong nhiều trung tâm dữ liệu toàn cầu, và chiến lược của Nvidia y hệt như thời Hopper trước đây — song song với nền tảng mới, tiếp tục khai thác tiềm lực phần cứng hiện tại bằng tối ưu phần mềm liên tục. Cách làm này không chỉ kéo dài chu kỳ thu hồi vốn đầu tư phần cứng cho khách hàng hiện hữu mà còn củng cố độ gắn kết hệ sinh thái hạ tầng AI với nền tảng Nvidia. Với thị trường, Nvidia đang từng bước xây dựng hàng rào phần mềm bất khả xâm phạm trong ngắn hạn với chiến lược song hành Blackwell và Rubin, tạo lợi thế cạnh tranh mà đối thủ khó có thể sớm vượt qua.

0
0

Tuyên bố miễn trừ trách nhiệm: Mọi thông tin trong bài viết đều thể hiện quan điểm của tác giả và không liên quan đến nền tảng. Bài viết này không nhằm mục đích tham khảo để đưa ra quyết định đầu tư.

PoolX: Khóa để nhận token mới.
APR lên đến 12%. Luôn hoạt động, luôn nhận airdrop.
Khóa ngay!

Bạn cũng có thể thích

Từ làn sóng Token đến thị trường máy chủ AI trị giá 1,3 nghìn tỷ USD: Năng lực suy luận AI bùng nổ toàn diện, các ông lớn như Dell bước vào thời kỳ vàng về “sản lượng, giá cả và thị phần”

Các nhà sản xuất hàng đầu toàn cầu về cụm máy chủ AI như Dell đang đồng thời tận hưởng hai lợi ích tăng trưởng: Thứ nhất là quy mô thị trường máy chủ AI đang mở rộng nhanh chóng, và thứ hai là tỷ trọng đơn hàng từ các khách hàng AI điện toán đám mây chủ chốt như các doanh nghiệp lớn và các dịch vụ đám mây mới cũng tăng mạnh, chứ không chỉ thụ động hưởng lợi từ việc phần cứng tăng giá.

智通财经2026/09/17 04:36
Từ làn sóng Token đến thị trường máy chủ AI trị giá 1,3 nghìn tỷ USD: Năng lực suy luận AI bùng nổ toàn diện, các ông lớn như Dell bước vào thời kỳ vàng về “sản lượng, giá cả và thị phần”

Dịch vụ đám mây GPU tăng giá mạnh: Nebius tăng giá thêm 20%, bên cung cấp sức mạnh tính toán có quyền thương lượng trở lại

Nebius sẽ tăng giá dịch vụ đám mây GPU khoảng 20% kể từ ngày 1 tháng 10, các loại chip từ H100 đến B300 đều được điều chỉnh lên, đây đã là đợt tăng giá thứ hai trong vài tháng qua, tổng mức tăng của B300 đạt tới 56%. Nhu cầu dự báo vượt quá 24 tháng, khách hàng tranh nhau mua Blackwell và thậm chí sẵn sàng trả giá cao hơn để đấu giá. Sự mất cân bằng cung cầu về năng lực AI đang tái định hình cục diện đàm phán của toàn ngành, quyền thương lượng đang âm thầm chuyển sang bên cung cấp.

华尔街见闻2026/09/17 04:26