Grok 4.6 melewati Claude Fable 5, Claude Opus 4.8, Gemini 3.1 Pro, GPT-5.5 dan GPT-5.6 Sol di EEBench, sebuah benchmark teknik kelistrikan.
Pertama kali saya melihat kesenjangan yang jelas antara model-model top dalam jenis pengujian ini.
AI mencoba menciptakan kembali gaya gotik Amerika dan menemukan detail yang tidak pernah muncul sebelumnya
Claude Fable 5, Opus 5 dan GPT Sol diberi tugas yang sama: membuat ulang lukisan terkenal Grant Wood selangkah demi selangkah di dalam satu file HTML Namun Fabel 5 melangkah lebih jauh. Sebelum menggambar garpu rumput,
Empat model, adegan yang sama.
Grok 4.6 menempati posisi terakhir, di belakang Opus 5, Qwen 3.8 Max dan GLM 5.3 Max. lihat jamnya. Grok selesai dalam waktu sekitar 15 menit. Opus memakan waktu sekitar 45. tiga kali lebih cepat dan keempat dalam penampilan. dalam kontes kecantikan sekali pakai yang dianggap kalah, dan memang begitu…
Melihat Qwen3.8-27B dimana-mana kemarin jadi saya harus memeriksa apakah hype itu nyata.
Jalankan secara lokal di 3090 vs Claude Opus 5 saya (tinggi). Menurut saya Qwen jauh lebih baik tetapi saya bias terhadap Qwen karena saya tidak pernah menggunakan PC ini dan harganya sangat mahal 😂
Sudah sampai ujung arsip
Semua Claude Opus 5