FRAMEWIREEnglishDiperbarui Aug 30Kabel langsung
0:00 / 0:00

Model di bawahnya adalah Qwen 3.8 Max.

Alibaba mengatakan mereka memiliki: 2,4T total parameter ~95B parameter aktif per tugas konteks 1 juta token Idenya sederhana: Kapasitas model yang besar tanpa mengaktifkan seluruh model untuk setiap pekerjaan.

Julian Goldie SEOAug 30
0:00 / 0:00

Flash Qwen 3.8 selanjutnya dibuat berbeda.

parameter 125B. Hanya 6 miliar yang aktif per token. Dan Alibaba mengatakan mereka berlatih dengan biaya sekitar 1/10 dari biaya andalan mereka sebelumnya. Arsitektur: → 125 miliar parameter utama dengan hanya 6 miliar yang diaktifkan per token → Parameter 51B lainnya melalui Engram…

Julian Goldie SEOAug 30
0:00 / 0:00

Inilah hasil Qwen 3.8 27b NVFP4 dengan hasil dflash2, pemikiran sedang, anggaran penalaran 32k, lari 11 menit.

Tidak terlalu rumit obv. tapi lumayan

AX⚡Aug 301
0:00 / 0:00

Qwen 3.8 Flash Next memiliki beberapa angka liar.

Inilah yang perlu diingat: → 125B total parameter. → Hanya 6 miliar yang aktif per token. → Penyematan engram 51B. → 262 ribu konteks di luar kotak. → Hingga 1 juta token dengan YAN. → 62,5 di SWE-Bench Pro. → 73.9 di kantor agen

Julian Goldie SEOAug 291