DeepSeek V4 Pro (0813) vs Qwen 3.8 Maks
GLM 5.3 Max vs Fabel 5 vs Qwen 3.8 Max vs Grok 4.6
GLM 5.3 merupakan lompatan besar dari 5.2. Masih belum mengalahkan Fable 5 bagi saya, tapi sekarang sudah lebih dekat. Dan vs Grok 4.6? Saya akan menggunakan GLM 5.3 dengan cukup mudah pada tes ini.
Tolok Ukur Pengkodean LLM Frontier Tingkat Lanjut 2 14.08.2026
Model: - Opus 5 Max - Kode Claude (Aplikasi) - Qwen 3.8 Max - Kode Qwen (CLI) - GLM 5.3 Max - Zcode (Aplikasi) - GPT 5.6 Sol Ultra - Codex (Aplikasi) Tugas: Ferrofluid: Naik menuju permukaan metaball + kursor magnet
Qwen 3.6-27B hanya mempermalukan model 14X lebih besar.
Model 27B Alibaba mengalahkan model unggulan 397B miliknya dalam hal coding. Namun skor benchmark bukanlah bagian yang paling berguna. Mengapa ini penting: → Model padat 27B — semua parameter diaktifkan pada setiap token → 77,2% di bangku SWE Terverifikasi
Sudah sampai ujung arsip
Semua qwen38