Selamat kepada tim riset atas kemajuan inferensi DeepSeek V3/R1.
Pada NVIDIA GB200 NVL72, mereka mencapai 26k token input/detik dan 13k token output/detik per GPU — peningkatan kecepatan hampir 4× / 5× dibandingkan H100.
Mereka mencapainya dengan NVFP4 MoE, perhatian FP8, dan penskalaan ke bawah paralelisme ahli
Lihat Asli
Halaman ini mungkin berisi konten pihak ketiga, yang disediakan untuk tujuan informasi saja (bukan pernyataan/jaminan) dan tidak boleh dianggap sebagai dukungan terhadap pandangannya oleh Gate, atau sebagai nasihat keuangan atau profesional. Lihat Penafian untuk detailnya.
13 Suka
Hadiah
13
7
Posting ulang
Bagikan
Komentar
0/400
MEVSupportGroup
· 12jam yang lalu
Peningkatan 4 kali lipat terlalu gila!
Lihat AsliBalas0
shadowy_supercoder
· 13jam yang lalu
Ini terlalu ketat, ya.
Lihat AsliBalas0
DefiOldTrickster
· 13jam yang lalu
Kakek sudah terbiasa dengan badai besar, GPU juga bisa To da moon dalam satu detik.
Selamat kepada tim riset atas kemajuan inferensi DeepSeek V3/R1.
Pada NVIDIA GB200 NVL72, mereka mencapai 26k token input/detik dan 13k token output/detik per GPU — peningkatan kecepatan hampir 4× / 5× dibandingkan H100.
Mereka mencapainya dengan NVFP4 MoE, perhatian FP8, dan penskalaan ke bawah paralelisme ahli