Bagus! Menurut pengujian sebenarnya, model besar dengan skala 100 miliar berhasil diterapkan di DGX Spark!
! 100 miliar per mesin, kecepatan melonjak! (Lihat rekaman layar👇🏻) Namun, SGLang (sgl_project) dikatakan lebih cepat! Saya harus mengatakan bahwa ekosistem open source dalam negeri kini semakin kuat! Sangat disarankan agar semua orang mempelajari penerapan model lokal: instal Ling-3.0, Qwen 3.8 27B, Minimax…
Buat demo 3d percikan gaussian yang bagus.
Gunakan shader. three.js, banyak file. qwen 3.8 27B BF16 pada 4x 3090s satu tembakan:
Visual indah dari seseorang yang menjalankan, qwen 3.8 27B secara lokal pada sistem VRAM RTX 5090 32 GB dengan 115 token/detik
Catatan, pos pemeriksaan BF16 resmi Qwen3.8-27B adalah 55,6 GB
Qwen 3.8 27b
DeepSeek V4 Flash 0731 GPT 5.6 Luna Kebanyakan model murah gagal dalam tes ini.
Sudah sampai ujung arsip
Semua qwen38