Mengerti — format benchmark yang sama, kali ini burger, dengan Grok (4.6) menggantikan Kimi di lineup.
Berikut postingannya: Perintah yang sama: "buat burger." Empat model AI. Salah satu dari mereka rupanya lupa seperti apa burgernya. ChatGPT (GPT-5.6 Sol) menggambar apa yang pada dasarnya a
Claude Opus 5 tergila-gila pada desain web.
Perintah ↓
Claude Opus 5 sebesar 30,2% di ARC‑AGI‑3, rata-rata diukur oleh masyarakat awam sekitar 48%, dan GPT‑6 Astra langsung mencapai 99,9%.
Yang kami lewati kali ini bukan sekadar daftar peringkat, melainkan garis pemisah antara manusia dan kecerdasan mesin. Claude Fable 5.1 belum memiliki hasil verifikasi publik.
GPT-6 Astra vs Claude Opus 5 semakin konyol
Astra : → 99,9% pada ARC-AGI-3 → 98% di FrontierMath Tingkat 4 → masukan $10 / keluaran $50 per 1 juta token Claude Opus 5 : → SOTA di Frontier-Bench → SOTA pada GDPval-AA → ~1,5x model terbaik berikutnya di AutomationBench pada saat yang sama
Sudah sampai ujung arsip
Semua Claude Opus 5