Saya menjadi orang digital. Saya tidak menyangka itu adalah Paman Liang. Dengarkan aku, Paman Liang, bicara padaku tentang deepseek.
DFlash 2 baru saja dirilis, dan inferensi lokal kini berada di level lain.
Menurut AA, Qwen3.8 27B kira-kira berada di antara GLM-5.2 Max dan DeepSeek Flash 0731 Max. Q4_K_M berjalan pada satu RTX 5090 32 GB: 75 tok/dtk berkelanjutan, hingga 200 tok/dtk puncak, konteks 131 ribu, satu sesi aktif.
Qwen 3.8 27B Q4_K_M - 90 token/detik pada satu NVIDIA RTX 4090 (VRAM 24 GB) dengan Dflash2!
(MTP 60 tps -> 90 tps Dflash2!!!!) AI lokal bergerak sangat cepat (secara harfiah!) hingga menakutkan. Z lab baru saja merilis DFlash 2 untuk Qwen 3.8 27b dan Muse Glimmer. Saya menambal llama.cpp (PR #27342) dan
Plug-in Dsh sumber terbuka, Liang Wenfeng vs. Liang Wengu.
Sudah sampai ujung arsip
Semua deepseek