Inferensi yang dioptimalkan dari koneksi lalat buah untuk DeepSeek-V4.1-Flash pada 2× Stasiun NVIDIA GB300 DGX!
Ini secara mengesankan mencapai prefill 56k tok/s dan decode c1 201,7 tok/s. Bagus sekali, kawan kecil.
Model flash mana yang menang?
DeepSeek v4.1 flash, Qwen 3.8 flash, or GLM 5.3 flash 🤯
Oke, saya kira saya tidak menyia-nyiakan semua uang itu
Deepseek V4.1 Flash 304 tok/s code, 135 tok/s prose Zero optimization, will have it max optimized by the morning.
Permainan labirin diselesaikan sekaligus menggunakan DeepSeek V4.1 Flash
它深度求索了不到半个小时完成的
Sudah sampai ujung arsip
Semua deepseek