Dan sekarang saya juga memiliki banyak yang menjalankan Qwen 3.8 27b di nvidia RTX 5090 saya.
Saya suka perkembangannya sejauh ini. Cukup terkunci. gram
Ornith-1.5-35B-A3B-oQ8e-mtp masih kuat dalam kecepatan dengan omlx di M3 Ultra bahkan dengan konteks 150K: 45 t/s
Sejujurnya itu tidak setingkat dengan Qwen 3.8 27B. Untuk mencoba mendapatkan hasil yang sama, saya terus-menerus mendorong, mengarahkan, dan 🤬 melakukannya.
2 x 4090s menjalankan Qwen 3.8 27B dengan total lebih dari 300 tok/s.
8 sesi bersamaan dengan vLLM, Qwen3.8-27B-INT8-W8A16-MTP, konteks 128k. Lebih dari 1 juta token per jam untuk digunakan oleh agen AI saya. Tanpa membayar untuk sub atau API. Tanpa memberikan data saya kepada perusahaan AI.
Jika Anda menguji Qwen 3.8 Max, jangan sia-siakan dengan petunjuk kecil.
Gunakan ketika konteks panjang benar-benar penting. Coba ini: 1. Berikan basis pengetahuan lengkap perusahaan Anda. 2. Berikan beberapa SOP sekaligus. 3. Tambahkan percakapan pelanggan Anda sebelumnya. 4. Sertakan keberatan umum dan
Sudah sampai ujung arsip
Semua qwen38