Mia akankah ada flash GLM 5.3 untuk Pengguna VRAM Nvidia 5090 RTX 24 GB?
Suka Versi 27B yang dimodifikasi di EXL3? Saya juga mendapatkan hasil yang menakjubkan dengan Qwen 3.8 27B dengan 5090RTX dan jendela konteks maksimal saya mendapatkan 90-100 token per detik.
"Hai codex, buat LLM saya berjalan 5x lebih cepat"
Memperkenalkan Tama 🐣 Berikan agen Anda komputer dengan GPU Sinkronkan kode Anda, jalankan kotak, jalankan eksperimen secara paralel Saya mengarahkan Codex ke Qwen 3.8 dan menguji 5 metode decoding spesifikasi secara paralel, dan membuatnya 5x lebih cepat dari vLLM default…
Quad 3090s Mencapai 90 tok/s + di Qwen 3.8 Flash di llama.cp | Pastinya tidak keberatan menjalankan ini…
Quad 3090s Mencapai 90 tok/s + di Qwen 3.8 Flash di llama.cp | Pastinya tidak keberatan menjalankan model ini, tetapi saya merasa pengaturan saya saat ini lebih cerdas.
Ini adalah periode mutakhir!
Omarki dulu Kemudian agen lain memanfaatkan pilihan Anda. peringkat saya? Hermes Biarkan openclaw saja, mereka tidak serius unduh model flash qwen 3.8 8b dan jalankan secara lokal
Sudah sampai ujung arsip
Semua qwen38