FRAMEWIREEnglishDiperbarui Aug 29Kabel langsung
0:00 / 0:00

Flash DeepSeek V4 vs Flash Qwen 3.8 vs Flash GLM 5.3 vs Flash Gemini 3.7

Fede(URU) 🇺🇾Aug 293
0:00 / 0:00

Flash DeepSeek V4 • Flash Qwen 3.8

GLM 5.3 Lampu Kilat • Gemini 3.7 Kilat

Fabiano FirmoAug 291
0:00 / 0:00

konteks 262K. Pada RTX 5070 Ti 16GB.

🤯 Qwen 3.8 27B Q3 mencapai ~25 tok/s sementara fork llama.cpp adaptif mengalirkan cache KV antara RAM ↔ VRAM. Stok llama.cpp mulai meronta-ronta sekitar ~120 ribu konteks. GPU konsumen yang sama. 2x+ konteks yang dapat digunakan. Ini bisa menjadi hal yang besar bagi LLM lokal.

SachinAug 291
0:00 / 0:00

Model Qwen 3.8 Max yang mendasarinya sangat besar

2,4 triliun total parameter. Namun hanya sekitar 95 miliar yang diaktifkan untuk tugas individu. Pendekatan gabungan para ahli ini memungkinkannya menarik bagian-bagian model yang relevan, alih-alih mengaktifkan semuanya.

Julian Goldie SEOAug 291