Flash DeepSeek V4 vs Flash Qwen 3.8 vs Flash GLM 5.3 vs Flash Gemini 3.7
Flash DeepSeek V4 • Flash Qwen 3.8
GLM 5.3 Lampu Kilat • Gemini 3.7 Kilat
konteks 262K. Pada RTX 5070 Ti 16GB.
🤯 Qwen 3.8 27B Q3 mencapai ~25 tok/s sementara fork llama.cpp adaptif mengalirkan cache KV antara RAM ↔ VRAM. Stok llama.cpp mulai meronta-ronta sekitar ~120 ribu konteks. GPU konsumen yang sama. 2x+ konteks yang dapat digunakan. Ini bisa menjadi hal yang besar bagi LLM lokal.
Model Qwen 3.8 Max yang mendasarinya sangat besar
2,4 triliun total parameter. Namun hanya sekitar 95 miliar yang diaktifkan untuk tugas individu. Pendekatan gabungan para ahli ini memungkinkannya menarik bagian-bagian model yang relevan, alih-alih mengaktifkan semuanya.
Sudah sampai ujung arsip
Semua qwen38