konteks 262K. Pada RTX 5070 Ti 16GB.
🤯 Qwen 3.8 27B Q3 mencapai ~25 tok/s sementara fork llama.cpp adaptif mengalirkan cache KV antara RAM ↔ VRAM. Stok llama.cpp mulai meronta-ronta sekitar ~120 ribu konteks. GPU konsumen yang sama. 2x+ konteks yang dapat digunakan. Ini bisa menjadi hal yang besar bagi LLM lokal.
Model Qwen 3.8 Max yang mendasarinya sangat besar
2,4 triliun total parameter. Namun hanya sekitar 95 miliar yang diaktifkan untuk tugas individu. Pendekatan gabungan para ahli ini memungkinkannya menarik bagian-bagian model yang relevan, alih-alih mengaktifkan semuanya.
Perplexity Portable Computer menjalankan seluruh agen AI di mesin Anda sendiri.
Bukan chatbot. Agen lengkap yang menjelajahi, menjalankan alat, membaca file Anda, dan menyelesaikan tugas. Semuanya, lokal. Model, orkestrator, alat, akses file. Data Anda tidak meninggalkan Anda
Bagian yang mengejutkan bukanlah model 27B - melainkan klaim perangkat kerasnya
Qwen 3.8 27B dilaporkan berjalan secara lokal pada 8GB RTX 4060 melalui Unsloth IQ4_XS, dengan konteks 64k, 14,6GB pada disk, ~150 tok/s prefill, dan ~5 tok/s decode dengan MTP asli.
Sudah sampai ujung arsip
Semua qwen38