FRAMEWIREEnglishDiperbarui Aug 29Kabel langsung
0:00 / 0:00

konteks 262K. Pada RTX 5070 Ti 16GB.

🤯 Qwen 3.8 27B Q3 mencapai ~25 tok/s sementara fork llama.cpp adaptif mengalirkan cache KV antara RAM ↔ VRAM. Stok llama.cpp mulai meronta-ronta sekitar ~120 ribu konteks. GPU konsumen yang sama. 2x+ konteks yang dapat digunakan. Ini bisa menjadi hal yang besar bagi LLM lokal.

SachinAug 292
0:00 / 0:00

Model Qwen 3.8 Max yang mendasarinya sangat besar

2,4 triliun total parameter. Namun hanya sekitar 95 miliar yang diaktifkan untuk tugas individu. Pendekatan gabungan para ahli ini memungkinkannya menarik bagian-bagian model yang relevan, alih-alih mengaktifkan semuanya.

Julian Goldie SEOAug 291
0:00 / 0:00

Perplexity Portable Computer menjalankan seluruh agen AI di mesin Anda sendiri.

Bukan chatbot. Agen lengkap yang menjelajahi, menjalankan alat, membaca file Anda, dan menyelesaikan tugas. Semuanya, lokal. Model, orkestrator, alat, akses file. Data Anda tidak meninggalkan Anda

Julian Goldie SEOAug 291
0:00 / 0:00

Bagian yang mengejutkan bukanlah model 27B - melainkan klaim perangkat kerasnya

Qwen 3.8 27B dilaporkan berjalan secara lokal pada 8GB RTX 4060 melalui Unsloth IQ4_XS, dengan konteks 64k, 14,6GB pada disk, ~150 tok/s prefill, dan ~5 tok/s decode dengan MTP asli.

nomadAug 29