Model di bawahnya adalah Qwen 3.8 Max.
Alibaba mengatakan mereka memiliki: 2,4T total parameter ~95B parameter aktif per tugas konteks 1 juta token Idenya sederhana: Kapasitas model yang besar tanpa mengaktifkan seluruh model untuk setiap pekerjaan.
Flash Qwen 3.8 selanjutnya dibuat berbeda.
parameter 125B. Hanya 6 miliar yang aktif per token. Dan Alibaba mengatakan mereka berlatih dengan biaya sekitar 1/10 dari biaya andalan mereka sebelumnya. Arsitektur: → 125 miliar parameter utama dengan hanya 6 miliar yang diaktifkan per token → Parameter 51B lainnya melalui Engram…
Inilah hasil Qwen 3.8 27b NVFP4 dengan hasil dflash2, pemikiran sedang, anggaran penalaran 32k, lari 11 menit.
Tidak terlalu rumit obv. tapi lumayan
Qwen 3.8 Flash Next memiliki beberapa angka liar.
Inilah yang perlu diingat: → 125B total parameter. → Hanya 6 miliar yang aktif per token. → Penyematan engram 51B. → 262 ribu konteks di luar kotak. → Hingga 1 juta token dengan YAN. → 62,5 di SWE-Bench Pro. → 73.9 di kantor agen
Sudah sampai ujung arsip
Semua qwen38