Saya bersenang-senang bermain-main dengan model Qwen 3.8 kemarin.
Yang mengejutkan saya adalah model ini hampir menjadi model terdepan namun dapat dijalankan pada laptop M1 Max 5 tahun saya! Sekarang tidak super cepat, 16 token/dtk tapi tetap saja! Lihat video kecil yang saya buat tentang cara mengaturnya:
Saya melakukan hal ini, suara saya masuk melalui server rumah saya yang menjalankan Qwen 3.8
Jadi saya berupaya membuat decoding dan prefill secepat mungkin pada mesin veloGB10 saya untuk model 3.8 27b.
Jaringan 4x DGX Spark saya diaktifkan (Mikrotik CRS812 DDQ ), Kabel QFSP56 berkualitas tinggi dengan semua jalur diverifikasi untuk berjalan pada kecepatan maksimal. Ini adalah Rust/CUDA murni (dengan
Saya sedang membuat 'roblox' untuk anak saya, tetapi sepenuhnya AI lokal.
Melakukan Qwen 3.8 pada 5090 sebagai tulang punggung obrolannya.
Sudah sampai ujung arsip
Semua qwen38